CLM-8B

CLM-8B ახლახან გამოვიდა: ახალი ღია ხელოვნური ინტელექტის მოდელი, რომელიც აგენტებისთვის Jev-ზე 9-ჯერ უფრო სწრაფია

მოკლე პასუხი: CLM-8B არის ღია კონტრასტული ენის მოდელი, რომელიც მიზნად ისახავს აგენტების სწრაფ გადაწყვეტილებებს, ავტორის თქმით, შეყოვნება დაახლოებით 9-ჯერ ნაკლებია Jev კლასის ანალოგებთან შედარებით. ეს მაჩვენებლები დაუდასტურებელი რჩება გამოშვების კონფიგურაციის გარეთ. თუ კოდირების აგენტებს ქმნით, დიაგრამებს ენდობით, დიაგრამებს ენდობით და შემდეგ საკუთარ აღკაზმულობაზე დაამუშავეთ A/B მოდელი.

ძირითადი დასკვნები:

შეყოვნების შესახებ პრეტენზიები: Jev-ის ~9× აჩქარება ავტორის მიერ მოხსენებულად ჩათვალეთ მანამ, სანამ სხვები არ გაიმეორებენ მას.

შეფასების აღკაზმულობა: CLM-8B A/B ტესტირებისას ხელსაწყოები და მოთხოვნები დააფიქსირეთ.

ჰიბრიდული სტეკი: ცხელი ციკლებისთვის გამოიყენეთ CLM; ახალი ამოცანებისთვის შეინახეთ ნელი მსჯელობის სისტემა.

ღია წონები: კომერციული ჩანგლების გაგზავნამდე დაადასტურეთ Apache-ს ლიცენზიის ფაილები.

ბოროტად გამოყენების რისკი: შექცევადი ხელსაწყოებისა და საიდუმლოებების აღმოჩენა, როდესაც აგენტები გადაწყვეტილებას მილიწამებში იღებენ.

როგორი უნდა იყოს CLM-8B ⚡

კონტრასტული ენობრივი მოდელის სწავლება, როგორც ამ ვარდნის პოპულარიზაციის მსურველები აღწერენ, მდგომარეობებისა და ქმედებების დაკავშირებას გულისხმობს და არა შემდეგი ნიშნის ალბათობის იზოლირებულად მაქსიმიზაციას. გამჭვირვალე ტერმინებით რომ ვთქვათ: მოდელი მიმართულია „აი, სიტუაცია“-ს „აი, ნაბიჯი“-ს მიბმაზე, რაც უფრო პოლიტიკის ხელმძღვანელის, ვიდრე რომანისტის მსგავსია. ეს არის სისტემა 1-ის ანალოგია, რომელსაც მკვლევარები მუდმივად ეძებენ - სწრაფი, ასოციაციური, გადაწყვეტილების მიმღები - განსხვავებით სისტემა 2-ის გრძელი აზროვნების ჯაჭვისგან, რომელიც ტოკენებს წვავს ხმამაღლა ფიქრის დროს.

CLM-8B ამ მხრივ პირველი საჯარო წონაა. ის პოზიციონირებულია, როგორც ღია კვლევის გამოშვება Apache 2.0 ლიცენზიით , რომელიც თან ახლდა გაშუქებას, რაც მნიშვნელოვანია, თუ გსურთ მისი დახვეწა, გაგზავნა ან გაყოფა იურისტის პიკნიკის გარეშე. ჯეკი კვოკმა წარადგინა ნაშრომი; აზალია მირჰოსეინიმ, რომელიც სტენფორდთან ასოცირებულია, გაავრცელა იგი; უფრო ფართო ჩარჩო სტენფორდისა და NVIDIA-სთან დაკავშირებულ გუნდურ ძალისხმევას ასახავს. დასახელებული მკვლევარები, საჯარო წონა, ღია კოდი - არა ანონიმური გაჟონვა. მესამე მხარის რეპლიკაციისთვის ჯერ ადრეა, ამიტომ სკეპტიციზმის ციფერბლატი შეინარჩუნეთ სადღაც „საინტერესოსა“ და „მაჩვენეთ დამოუკიდებელი საბჭო“-ს შორის.

ზომის კლასი რვა მილიარდი პარამეტრია, რაც საკმარისად მცირეა იმისთვის, რომ ლაბორატორიებსა და დამოუკიდებელ შემქმნელებს შეეძლოთ მისი განთავსება თირკმლის გაყიდვის გარეშე H100 დროით. უკვე მიმდინარეობს საუბარი უფრო დიდი CLM-35B-ის გაგრძელებაზე. გაურკვეველია, შეინარჩუნებს თუ არა ეს უფრო დიდი და-ძმა შეყოვნების ისტორიას თუ სიჩქარეს სიღრმეზე გაცვლის, მაგრამ საგზაო რუკა ნათელია: ეს განკუთვნილია როგორც ოჯახური და არა ერთჯერადი დემო ბარათი.

  •  ფოკუსი: მდგომარეობა → მოქმედების ციკლები აგენტებისთვის, არა ესეს წერისთვის
  •  ლიცენზირება, რომელიც გამოშვების პერიოდში Apache 2.0-ის სახითაა განსაზღვრული
  •  სტილი: სისტემა 1 / გადაწყვეტილებაზე ორიენტირებული სასწავლო ისტორია
  •  შემდგომი: გეგმაში უფრო დიდი CLM-35B-ის შექმნაა ნახსენები

სისტემა 1 სტილი ჩვეულებრივი ტოკენის სარბენი ბილიკის წინააღმდეგ 

თქვენთვის ცნობილი საპროდაქშენო სამართლის მაგისტრების უმეტესობა ტექსტს ერთდროულად თითო ტოკენს წარმოქმნის. ეს შესანიშნავად მუშაობს პროზისთვის, კოდის ამონაწერებისთვის და ფრთხილად მსჯელობის ტრასებისთვის. სწორედ ამიტომ, აგენტი, რომელსაც წუთში ოცი მიკროგადაწყვეტილება სჭირდება, შეიძლება დუნედ იგრძნოს თავი, მაშინაც კი, როდესაც მოდელი „ჭკვიანია“. ყოველი ნაბიჯი ავტორეგრესიულ გადასახადს იხდის.

კონტრასტული ენის მოდელი აქცენტს ცვლის. ქსელს არ სთხოვოთ, რომ პასუხად თავად გადმოსცეს თავისი გზა, თქვენ მას ასწავლით, რომ მოცემულ მდგომარეობაში სწორი მოქმედება აირჩიოს - დაფიქრდეთ კარგ და ცუდ მოძრაობებს შორის კონტრასტული კავშირების შესახებ და არა მხოლოდ თავისუფლად გაგრძელებებზე. შემქმნელებმა უკვე იციან ეს სქემა: ზოგჯერ ათასსიტყვიანი დასაბუთება არ გჭირდებათ; მოდელისთვის საჭიროა, რომ აკრიფოს pytest rm -rf- ის ნაცვლად . სწრაფი ციკლები ამ განსხვავებას ითვალისწინებს.

ეს ყველაფერი არ ნიშნავს, რომ CLM-8B-ს არ შეუძლია ტექსტის გამოცემა. ეს ნიშნავს, რომ ტრენინგის მიზანი და შეფასების ისტორია აგენტურ კონტროლზეა ორიენტირებული. ეს პროდუქტის განსხვავებული ფორმაა, ვიდრე „ჩატის მოდელი, რომელსაც ასევე შეუძლია ინსტრუმენტებზე გამოძახება“. ინდუსტრიამ წლები დახარჯა მოდელების გაუმჯობესებაზე, რათა ინსტრუმენტებზე საუბრისას თავად საუბარი შეეზღუდა. გადაწყვეტილებაზე ორიენტირებული მოდელი არის გვერდითი მოძრაობის ტიპი, რომელიც ან აშკარად ჩანს უკან გადახედვისას, ან ჩავარდება, როდესაც საორიენტაციო მაჩვენებლები ერთმანეთში აირევა. ორივე შედეგი შესაძლებელია.

მოთხოვნილი სიჩქარე და სათადარიგო ნომრები (მიიჩნიეთ მოთხოვნებად)

სოციალურ ქსელებში პოსტების განმსაზღვრელი ნაწილია შემდეგი: პრომოუტერები აცხადებენ, რომ Jev კლასის მოდელებთან შედარებით, დაახლოებით 9-ჯერ უფრო სწრაფი დასკვნა. მცირე დახვეწის შემდეგ, ისინი ასევე აფიქსირებენ აგენტური კოდირების ძლიერ შედეგებს - DeepSWE-ს წარმატება დაახლოებით 81.6%-ია, ხოლო Terminal-Bench 2.1-ს - დაახლოებით 87.6%. ზოგიერთ შეფასებაში ისინი ნულოვანი დარტყმის შესრულებას აღწერენ, როგორც Jev-თან შედარებით, ხოლო შეყოვნება გაცილებით დაბალი რჩება. ერთ-ერთ კლასტერულ შეჯამებაში, რომელიც გამოშვების ჩეთთან ერთად ვრცელდებოდა, მითითებული იყო დაახლოებით 32 ms კლასის რეაგირების დრო Terminal Bench-ის პარამეტრზე. ფრაზა, რომელიც ყურადღებით არის მოხსენიებული და მტკიცებული, ამ სტატიაში დამოუკიდებლად აუდიტირებული არ არის.

თუ ეს შეყოვნების მაჩვენებლები განზოგადდება, პრაქტიკული მოგება იქნება ნაკლები გრაფიკული პროცესორი ერთ კონკურენციულ აგენტზე ან მეტი აგენტი ერთ გრაფიკულ პროცესორზე. კოდირების აგენტები, რომლებიც გარსს არღვევენ, განსაკუთრებით მგრძნობიარეა, რადგან კედლის საათის ლოდინი გროვდება; 200 ms და 30 ms გადაწყვეტილებების მიღება რამდენიმე ასეული ბრუნვის შემდეგ სხვადასხვა პროდუქტად აღიქმება. მომხმარებლები ხშირად ადანაშაულებენ „მოდელის სულელურობას“, მაშინ როდესაც უფრო მკვეთრი პრობლემა ინტერაქტიული შეფერხებაა.

მიუხედავად ამისა - და ეს ზრდასრულთა ზედამხედველობის აბზაცია - ავტორების სკამები რეკლამირებას მანამ ახორციელებენ, სანამ ვინმე სხვა არ გაიმეორებს მათ საერთო აპარატურაზე საერთო მოთხოვნებით. მცირე დახვეწის შედეგებმაც შეიძლება დამალოს ბევრი ხარვეზი. ძლიერი DeepSWE და Terminal-Bench რიცხვები საინტერესოა ზუსტად იმიტომ, რომ ეს კომპლექტები სჯის მყიფე აგენტებს, მაგრამ აღგზნება არ არის რეპლიკაცია. შეინახეთ წებოვანი ფურცელი, რომელზეც ეწერება CLAIM 9×-ზე და ამ 32 ms-კლასის ფიგურაზე. 

შედარების ცხრილი: ტოკენ-ტოკენ LLM-ები CLM სტილის ჩარჩოების წინააღმდეგ

ცხრილები გვეხმარება, როდესაც მარკეტინგული ენა არაზუსტი ხდება. ეს მაგალითი ადარებს LLM-ის თაობის ტიპურ ჩვევებს კონტრასტული ენის მოდელის ისტორიასთან, როგორც მას მკვლევარები აღწერენ. უჯრები განგებ ცოტა არათანაბარია, რადგან კონკრეტული შედარებები ყოველთვის ასეა.

კუთხე ტიპური LLM (ტოკენ-ტოკენი) CLM სტილის / სისტემა 1 კადრირება რატომ არის ეს მნიშვნელოვანი აგენტებისთვის
პირველადი ციკლი შემდეგი ტოკენის პროგნოზირება, ხშირად გრძელი კვალის გამოყენებით მდგომარეობის მოქმედებასთან შესაბამისობაში მოყვანა; კონტრასტული გადაწყვეტილების მიკერძოება ნაკლები ტოკენის დაკარგვა ხელსაწყოების გამოძახებებს შორის (თეორიულად)
შეყოვნების შეგრძნება მრავალსაფეხურიანი კონტროლის ქვეშ შეიძლება იგრძნოს ლაპარაკის ნელი ტემპი ავტორები აცხადებენ, რომ Jev-კლასთან შედარებით ლატენტობა გაცილებით დაბალია ინტერაქტიული კოდირების აგენტებს სძულთ ლოდინის დრო
სიძლიერის ზონა პროზა, დაგეგმვის ესეები, ფართო საუბარი სწრაფი მდგომარეობა → მოქმედება - აგენტის კოდირება მონიშნულია განსხვავებული სამსახური, ყოველთვის არა შემცვლელი
მოხსენებული რიცხვები დამოკიდებულია მოდელზე; აქ ერთი ციფრი არ არის ~9-ჯერ უფრო სწრაფი (პრეტენზია); DeepSWE ~81.6%; Terminal-Bench 2.1 ~87.6% მსუბუქი FT-ის შემდეგ (პრეტენზიები) იმედისმომცემია, თუ მესამე მხარეები დაადასტურებენ - დიდი თუ
ღიაობა დახურული API-ებისა და ღია წონების ნაზავი Apache 2.0-ის ფარგლებში ჩარჩოში ჩასმული ღია წონა/კოდი დააზუსტეთ და თავად მოაწყვეთ ჰოსტინგი ტერმინების გამოცნობის გარეშე
დაჭერა / quirk ჭკვიანურია, მაგრამ ზოგჯერ სამუდამოდ ყვება 🐢 ჯერ კიდევ ადრეა; დამოუკიდებელი განმეორებითი კენჭისყრები მოსალოდნელია ნუ დადებთ ფსონს კომპანიაზე ერთი პრესის ჩარტზე

გამოიყენეთ ცხრილი, როგორც გონებრივი მოდელი და არა როგორც განაჩენი. პროდუქტის გუნდებმა მაინც უნდა გაზომონ საკუთარი შესაძლებლობები: ხელსაწყოების სქემები, ხელახალი ცდის პოლიტიკა და გარემოს ხმაური ქულებს უფრო მეტად შეცვლის, ვიდრე სლაიდების დასტა ადასტურებს.

ვინ დგას ხმაურის უკან 👤

ატრიბუციას მნიშვნელობა აქვს, რადგან ღია ხელოვნური ინტელექტის გამოშვებები მოიცავს როგორც ლაბორატორიული გამოშვებებიდან დაწყებული, იდუმალ ტორენტებით დამთავრებული. ამ ვერსიას სახეები აქვს. ჯეკი კვოკმა წარმოადგინა CLM; აზალია მირჰოსეინიმ ხელი შეუწყო მის უფრო ფართო ხედვაში გაწევრიანებას; გაშუქება თანმიმდევრულად ასახავს სტენფორდისა და NVIDIA-ს კვლევით თანამშრომლობას. ეს ჯადოსნურად არ ხდის ყველა რიცხვს სიმართლეს, მაგრამ ის თამაშში რეპუტაციის კანს მატებს. დასახელებული მკვლევარის ღია გამოშვებები, როგორც წესი, უფრო სწრაფად გადის სტრეს-ტესტირებას, ვიდრე ანონიმური გამოშვებები - კოლეგებს უყვართ საჯარო სამიზნე.

მშენებლებისთვის პრაქტიკული მნიშვნელობა წვდომას წარმოადგენს. ღია წონა და Apache 2.0 სტილის ლიცენზია (როგორც ეს გაშვებული იყო გაშვების დროს), როგორც წესი, ნიშნავს, რომ შეგიძლიათ კომერციულად ექსპერიმენტები ჩაატაროთ ნაკლები ხარვეზებით, ვიდრე მხოლოდ კვლევისთვის განკუთვნილ ლიცენზიებს. ნებისმიერი რამის გამოშვებამდე თავად შეამოწმეთ გამოშვებაში არსებული ლიცენზიის ფაილები; დაფარვის შეჯამებები არ არის კონტრაქტი. ეს შეიძლება პედანტურად ჟღერდეს, მაგრამ ლიცენზიის პედანტიზმი სტარტაპებს იცავს.

სოციალური გაძლიერების ნიმუში ნაცნობია: მკვლევრის პოსტი, პატივცემული გამაძლიერებლის ციტატები, შემდეგ კი „საბოლოოდ ამოხსნილი აგენტების“ ტალღა. ფილტრი იმ ადამიანებისთვის, რომლებიც აღკაზმულობის დეტალებს იზიარებენ. ერთი წარმატებული კოდირების სკრინშოტი განწყობის თეატრია და არა მეცნიერება. 🛰️

რატომ ფლობენ მდგომარეობა-მოქმედების ციკლები აგენტურ კოდირებას 

აგენტური კოდირება სასტიკი გარემოა. მოდელი ხედავს საცავის სნეპშოტს, შელის ტრანსკრიპტს, შესაძლოა წარუმატებელ ტესტს და უნდა აირჩიოს რედაქტირება ან ბრძანება. წარმატება უფრო ხშირად ბინარულია, ვიდრე ჩატი. ან ტესტი ამოქმედდება, ან არა. ჯილდოს ეს ფორმა უპირატესობას ანიჭებს იმ პოლიტიკებს, რომლებიც მოქმედებებს სუფთად ირჩევენ იმ მოდელებთან შედარებით, რომლებიც წარუმატებლობის შესახებ ლამაზ ესეებს წერენ.

კონტრასტული ტრენინგის ისტორიები ამ სამყაროს ერგება, რადგან ისინი ქსელს მოცემულ მდგომარეობაში სასურველი მოქმედებებისკენ უბიძგებენ. წარმოიდგინეთ ეს, როგორც უმცროსი ინჟინრისთვის „როდესაც ამ შეცდომის კლასს დაინახავ, მოძებნე ეს გამოსწორების ნიმუში“ იმის ნაცვლად, რომ „დაწერე ბლოგპოსტი იმის შესახებ, თუ რატომ არიან კომპილატორები რთულები“. უმცროსი ინჟინრისთვის მაინც საჭიროა განსჯა; მოკლე გზა უბრალოდ ამცირებს ყოყმანს.

აქ შეყოვნება რთულდება. დავუშვათ, აგენტი საშუალოდ ოთხმოცი ხელსაწყოს ნაბიჯს იყენებს საშუალო ზომის შეცდომის გამოსასწორებლად. თითო ნაბიჯზე 150 ms-ის გამოკლებით, თქვენ დაიბრუნებთ კედლის საათის თორმეტ წამს - რაც განსხვავებაა ნაკადის მდგომარეობასა და მომხმარებლის მიერ ელფოსტის შესამოწმებლად Alt-Tab-ის დაჭერით გადახვევას შორის. აგენტების ფლოტის მმართველი გუნდებიც გრძნობენ ამ მათემატიკას ღრუბლოვან გადასახადებშიც. Jev კლასის თანატოლთან შედარებით, მტკიცებული სიდიდის მიხედვით დასკვნითი სიჩქარის ზრდა, მაშინაც კი, თუ ის „მხოლოდ“ 4×-ის ტოლია, მაინც ცვლის სიმძლავრის დაგეგმვას.

არსებობს არასტაბილური მეტაფორა, რომელსაც შეხვედრებზე გამუდმებით ვიყენებ: ტოკენ-ტოკენ ჩატის მოდელები ყველა გზაჯვარედინზე მარშრუტის განხილვას ჰგავს, ხოლო System 1 სტილის კონტროლერი უფრო ქალაქში მართვისთვის კუნთოვან მეხსიერებას ჰგავს. კუნთოვანი მეხსიერება ახალ ქალაქში ვერ ხერხდება. ასევე ხდება ვიწროდ მორგებული მოქმედების მოდელი, როდესაც საცავის კულტურა თავისებურია. თქვენ მაინც გჭირდებათ საკონსულტაციო რეჟიმები ახალი არქიტექტურის არჩევანისთვის; გსურთ რეფლექსები ორმოცდამეათე „იმპორტის გამოსწორებისა და ხელახლა გაშვებისთვის“. ჰიბრიდული სტეკები - სწრაფი CLM-ის მსგავსი კონტროლერი პლუს უფრო მძიმე რეზონერი მყარ ტოტებზე - ალბათ ის ადგილია, სადაც სერიოზული სისტემები ხვდება, მაშინაც კი, თუ გაშვების პოსტები ყიდიან ერთ გმირულ მოდელს. 🚦

ასევე აღსანიშნავია: აგენტური კოდირების ისეთი სკამები, როგორიცაა DeepSWE და Terminal-Bench-ის ჯილდოს სკაფოლდინგი. აღკაზმულობის ხარისხს, ხელსაწყოების დაშვებულ სიებს და აღდგენის მოთხოვნებს შეუძლიათ წარმატების მაჩვენებლის ორნიშნა ციფრებით შეცვლა. როდესაც მსუბუქი დახვეწის შემდეგ ~81.6%-ს ან ~87.6%-ს დაინახავთ, ჩაუღრმავდით, თუ რა შეფუთვა იყო წონების გარშემო. ეს არ არის ჩრდილი; ეს არის ის, თუ როგორ მუშაობს ველი.

ღია წონები, ზუსტი რეგულირება და 35B ჩრდილი 

ღია წონები ცვლის პრეტენზიის სოციალურ დინამიკას. დახურულ API მოდელებს შეუძლიათ დიაგრამის ჩვენება და დაგაფიქრებინონ დაბინძურებაზე, დეკოდირების ხრიკებზე ან საიდუმლო სისტემურ მოთხოვნებზე. ჩამოსატვირთი პარამეტრებით, თქვენ შეგიძლიათ, სულ მცირე, ყველაფერი აკონტროლოთ. CLM-8B-ის თქვენი შიდა კოდირების გარემოსთვის დახვეწა - თქვენი ლინტების წესები, თქვენი განლაგების CLI, თქვენი მონორეპო ტოპოლოგია - არის რეალისტური გზა ბრწყინვალე სკამური რიცხვებისკენ და არა ნულოვანი დარტყმის მაგია პირველივე დღეს.

Apache 2.0-ის ჩარჩოები (დაფარვის მიხედვით) შემქმნელებისთვის მოსახერხებელია: პატენტის მინიჭების ენა, მკაფიო გადანაწილების ნორმები, ნაკლები „მხოლოდ კვლევის“ ხაფანგები. კიდევ ერთხელ: წაიკითხეთ ფაილები. დაფარვის ავტორები აჯამებენ; იურისტები სპეციალიზდებიან.

დაგეგმილი CLM-35B გეგმის რყევის მთავარი მომენტია. უფრო დიდი მოდელები ხშირად იბრუნებენ გააზრებულ უნარს და კარგავენ „პატარა და საშინლად სწრაფი“ ხიბლის ნაწილს, თუ დისტილაცია ან სპეკულაციური ხრიკები არ შეაკავებს შეყოვნებას. თუ რვამილიარდიანი ვარიანტი სპორტული მანქანაა, ხოლო ოცდათხუთმეტმილიარდიანი - ტურისტული სედანი, გუნდებმა შეიძლება ორივე შეინარჩუნონ: 8B ცხელი ციკლისთვის, 35B მკაცრი დაგეგმვისთვის. ან უფრო დიდი მოდელი შეიძლება უბრალოდ დომინირებდეს, თუ აპარატურა კვლავ გაიაფდება. ჯერ კიდევ გაურკვეველია, რომელი მომავალი დადგება; ამას მომავლის გამოშვების ჩანაწერები გადაწყვეტს და არა ეს აბზაცი.

ღია აგენტის მოდელებთან დაკავშირებული ერთი დახვეწილი რისკი: ადამიანები მათ CI-ში ჩართავენ სიჩქარის შეზღუდვების გარეშე და აღმოაჩენენ სწრაფ ინექციას მავნე README-ების საშუალებით. სწრაფი მოდელები აძლიერებენ ბოროტად გამოყენებას ისევე, როგორც აძლიერებენ პრაქტიკულ ღირებულებას. დამცავი მოაჯირები არ არის არჩევითი კოსფლეი; ისინი პროდუქტია. 

  • ხარისხის შეფასებამდე დახვეწეთ თქვენი კვალი
  • შეინარჩუნეთ ნელი მსჯელობა, როგორც ახალი ამოცანებისთვის გასასვლელი ლუქი
  • ინსტრუმენტის ლატენტობა p50/p95 თქვენს აღკაზმულობაში, არა მხოლოდ სიზუსტე
  • ვივარაუდოთ, რომ 35B კვლავ გადაადგილებს პარეტოს საზღვარს

ჯევ შედარების წაკითხვა თოვის გარეშე 

Jev კლასის მოდელებთან შედარება რიტორიკულ საქმეს აკეთებს. ისინი აგენტის სიჩქარის საფეხურზე ქმნიან თანატოლს, ამიტომ „9-ჯერ უფრო სწრაფად“-ს აქვს რეფერენტი. ფარდობით პრეტენზიებს საყრდენი სჭირდება და ეს საკმაოდ ლოგიკურია. საფრთხე მთელი შეფასების დასტის ერთ მამრავლად დაშლაა. პარტიის ზომა, სიზუსტე, დეკოდირების პარამეტრები, კონტექსტის სიგრძე და ინსტრუმენტის გამოძახების სერიალიზაცია - ყველაფერი ეს ცვლის „უფრო სწრაფად“-ს მნიშვნელობას და ეს ღილაკები იშვიათად ჩნდება ერთსა და იმავე სლაიდზე.

როდესაც კლასტერის შეჯამება ტერმინალის სტენდის პარამეტრზე დაახლოებით 32 ms კლასის პასუხებს ასახელებს, „პასუხი“ ორაზროვან ეტიკეტად ჩაითვალოს მანამ, სანამ ვინმე არ დააკონკრეტებს, ნიშნავს თუ არა ეს პირველ ტოკენს, სრული მოქმედების JSON-ს თუ ქეშირებულ პრეფიქსს. ეს განსხვავებები მარკეტინგულ მილიწამებს საინჟინრო საათებად აქცევს. შედარებითი ნულოვანი დარტყმის ხარისხი დაბალი შეყოვნებით ოცნების წყვილია; თუ დამოუკიდებელი ჯგუფები ამ ოცნების ნახევარსაც კი დაადასტურებენ, CLM სტილის ტრენინგი არქიტექტურის შეხვედრებზე მუდმივ ადგილს იმსახურებს.

მანამდე კი, ჯევს უფრო მეტად მეტოქეობის ნარატივად მოეპყარით, ვიდრე მოწესრიგებულ ლიდერბორდზე. მეტოქეობა პოსტებს ყიდის. თქვენი წარმოების KPI-ები ნარატივს არ აინტერესებს. გაზომეთ დავალების წარმატება, თითოეული ამოხსნილი ბილეთის ღირებულება და ადამიანის ჩარევის მაჩვენებელი. თუ კონტრასტული ენის მოდელის ჩანგალი იმარჯვებს, იზეიმეთ. თუ ის მხოლოდ Twitter-ს იმარჯვებს, განაგრძეთ სიარული. 🚶

მცირე წინააღმდეგობების დროა: მეტოქეობის შესახებ ნარატივები კვლავ აქტუალურია. ისინი ლაბორატორიებს აიძულებენ, გამოაქვეყნონ ციფრები მსუბუქი განწყობის ნაცვლად. უბრალოდ, ნუ აურევთ ქულების დაფას სპორტში.

რა სჭირდება ამ რელიზს სწორად წარმართვისთვის 

იმისათვის, რომ CLM-8B-ს ახალი ამბების ციკლის მიღმაც ჰქონდეს მნიშვნელობა, რამდენიმე ფაქტორი უნდა იყოს გათვალისწინებული:

  • რეპლიკაცია: გარე ჯგუფებს უნდა შეეძლოთ სათაურის შეყოვნებისა და კოდირების წარმატების მაჩვენებლების დოკუმენტირებული რეცეპტების შესაბამისობაში მოყვანა.
  • გამჭვირვალობის აღკაზმულობა: გააზიარეთ აგენტის შეფუთვის დეტალები, რომლებმაც DeepSWE და Terminal-Bench ქულები გამოიმუშავეს.
  • დოკუმენტები, რომლებიც არ ითვალისწინებენ ლაბორატორიულ ტელეპათიას: მკაფიო დახვეწის სკრიპტები, შეფასების ბრძანებები და აპარატურული შენიშვნები.
  • წარუმატებლობის რეჟიმები: აჩვენეთ, თუ სად იშლება სისტემა 1-ის სტილის გადაწყვეტილებები - ახალი API-ები, ორაზროვანი ბილეთები, უსაფრთხოებისადმი მგრძნობიარე ოპერაციები.
  • განახლების გზა: დააზუსტეთ, თუ როგორ უკავშირდება CLM-35B სისტემა ერთმანეთს, რათა გუნდებმა არ გადააჭარბონ თავიანთი დასტის 8B ჩიხში შესვლას.

თუ ეს უჯრები ცარიელი დარჩება, მოდელი კიდევ ერთ საინტერესო ქაღალდის საწონად იქცევა. თუ ისინი შეავსებენ, აგენტის პლატფორმებს კონკრეტული კომპონენტის არჩევანი ეძლევათ: განხილვითი LLM გონივრული აზროვნებისთვის, კონტრასტული სწრაფი მოდელი კი - რხევითი ხელებისთვის. შრომის ასეთი დანაწილება უფრო ზრდასრულად ჟღერს, ვიდრე იმის მტკიცება, რომ ერთი მეგამოდელი ყველა საქმეს აკეთებს ყველა შეყოვნების ბიუჯეტით.

პრაქტიკული რჩევები მშენებლებისთვის, რომლებიც აგენტებს აგზავნიან 

ხვალ თქვენი დასტის გადაწერა არ გჭირდებათ. გადაწყვეტილების მიღების სწრაფი მოდელების შეფასების გეგმა გჭირდებათ. დაიწყეთ თქვენი აგენტის შეყოვნების კრიტიკული ნაწილის გამოყოფით - შესაძლოა ტერმინალის მიკროციკლი ან „შემდეგი გრეპის არჩევის“ ნაბიჯი - და A/B CLM-8B-ის დახვეწით რეგულირებით თქვენს ამჟამინდელ სამუშაო ძალასთან შედარებით. შეინარჩუნეთ აღკაზმულობა მუდმივი. ყველაფერი ჩაიწერეთ ჟურნალში.

ყურადღება მიაქციეთ ჩუმი ხარისხის რეგრესიებს: მოდელები, რომლებიც მყისიერად პასუხობენ თავდაჯერებული არასწორი ქმედებებით, უარესია, ვიდრე ნელა სწორი მოდელები მაღალი ფსონების მქონე რეპოზიტორებში. დაამატეთ ვერიფიკაციის ნაბიჯები. უპირატესობა მიანიჭეთ შექცევად ხელსაწყოებს. დაგეგმეთ მეორე მოდელის გამოძახება, როდესაც თავდაჯერებულობა დაბალია - დიახ, ეს სიჩქარის მოგების ნაწილს შთანთქავს და ეს ნორმალურია. სიჩქარე მუხრუჭების გარეშე არის ის, თუ როგორ გადაიქცევა დემო ვერსიები შეფერხებებად.

ორგანიზაციული მხრიდან, განაახლეთ სიმძლავრის ფურცლები სვეტით „მოქმედებები წამში თითო GPU-ზე“ და არა მხოლოდ წამში ტოკენები. აგენტური სამუშაო დატვირთვები გადაწყვეტილებებზე ზრუნავს და არა პოეზიის გამტარუნარიანობაზე. თუ ავტორების ~9× პრეტენზია ნაწილობრივ მაინც გადარჩება თქვენს აპარატურასთან კონტაქტს, თქვენი ცხრილი განსხვავებულად გამოიყურება. თუ არა, მაშინ იაფად ისწავლეთ.

და გთხოვთ, ოპერაციების სიყვარულისთვის, ნუ ჩასვავთ წარმოების საიდუმლოებებს ექსპერიმენტულ აგენტში, რადგან მოდელი „უსაფრთხოდ“ ჩანდა. სწრაფად გახსნილი მოდელები აადვილებს ისეთი ჩრდილოვანი სისტემების შექმნას, რომლებსაც არავინ ამოწმებს. პროცესს მაინც აქვს მნიშვნელობა. 

ღია თემები კვლავ ჩამოკიდებულია 

რამდენიმე გადაუჭრელი თემა ხელს მიშლის სრულ სარეკლამო რეჟიმში მუშაობაში:

  • კოდირების წარმატების რა ნაწილი ეკუთვნის წონებს მონაცემებისა და შეფუთვის დახვეწასთან შედარებით, გაურკვეველია.
  • System 1-ის ჩარჩო შეიძლება გათხელდეს, როდესაც დავალებებს გრძელვადიანი დაგეგმვა სჭირდებათ ლოკალური გარსის რეფლექსების ნაცვლად.
  • შესაძლოა, CLM-35B-მ შეინარჩუნოს ლატენტობის ისტორია ან კიდევ ერთ ძლიერ საშუალო ზომის LLM-ად ჩამოყალიბდეს.
  • კონტრასტული მოქმედების პრეფერენციები შეიძლება მყიფე გახდეს დისტრიბუციის ცვლილების პირობებში - ახალი ენები, ახალი ღრუბლოვანი CLI-ები, შეჯიბრებითი საცავები.
  • უსაფრთხოების ისტორიას ჯერ კიდევ სჭირდება ხორცი, როდესაც მოქმედებები მილიწამებში სრულდება.

ეს არ არის ისეთი შემოწმებები, რომლებიც გუნდში ჩასართავად არის განკუთვნილი. ეს არის შემოწმებები, რომლებიც ნებისმიერმა სერიოზულმა დანერგვის მიმოხილვამ უნდა ჩაატაროს. ადრეული ღია ვერსიები იმსახურებენ ყურადღებით შემოწმებას და ხახუნს და არა ბრმა ინსტალაციას.

საბოლოო შედეგი 

CLM-8B არის ღია, Apache-ის ჩარჩოში შემუშავებული (თითოეული დაფარვის მიხედვით) კონტრასტული ენის მოდელი, რომელიც მიზნად ისახავს აგენტებისთვის სწრაფი მდგომარეობიდან მოქმედებამდე ქცევის მიღწევას. ის საჯაროდ წარადგინა ჯეკი კვოკმა აზალია მირჰოსეინის გაძლიერებით და ჩამოყალიბებულია, როგორც სტენფორდის/NVIDIA-სთან დაკავშირებული კვლევა. სათაურში ნათქვამია - Jev-კლასის ინფერენციასთან შედარებით დაახლოებით 9-ჯერ უფრო სწრაფი, DeepSWE-სა და Terminal-Bench-ის ძლიერი შედეგები მცირე დახვეწის შემდეგ, შედარებითი ნულოვანი დარტყმის ხარისხი გაცილებით დაბალი შეყოვნებით, მათ შორის ~32 ms კლასის ტერმინალური პასუხების შესახებ ჭორები - ავტორების მიერ არის მოხსენებული და ჯერ კიდევ ელოდება მესამე მხარის ფართო დადასტურებას. ჰორიზონტზე უფრო დიდი CLM-35B იგეგმება.

თუ აგენტურ კოდირების სისტემებს ქმნით, ეს ფოკუსირებული შეფასების ღირსია და არა რელიგიის. განიხილეთ ეს, როგორც ჰიბრიდულ სტეკში არსებული System 1-ის კანდიდატი კონტროლერი, გაზომეთ თქვენი საკუთარი აღკაზმულობა და შეინახეთ CLAIM სტიკერი ყველა დიაგრამაზე, სანამ დამოუკიდებელი გაშვების პროცესი არ განხორციელდება. საინტერესო ის არ არის, რომ კიდევ ერთი ჩატის მოდელი ახალი ლოგოთი გამოჩნდება. საინტერესო ის არის, შეუძლია თუ არა გადაწყვეტილების ფორმირებულ ტრენინგს აგენტებს მყისიერი შეგრძნება მისცეს, ისე, რომ ისინი დაუფიქრებლად არ შეცდნენ.

პრაქტიკული მაგალითი: CLM-8B-სთვის შეყოვნების კრიტიკული აგენტის მიკრო-მარყუჟის შეფასების აგება

ავტორის დიაგრამები CLM-8B-ის შესახებ, რომელიც ახლახან გამოვიდა: ახალი ღია ხელოვნური ინტელექტის მოდელი, რომელიც აცხადებს, რომ 9-ჯერ უფრო სწრაფია, ვიდრე Jev აგენტებისთვის, შეიძლება დამაჯერებლად გამოიყურებოდეს; თქვენი აღკაზმულობა ერთადერთი ხმაა, რომელიც მნიშვნელოვანია. აი, როგორ მოექცა ბრიტანელი ინდი ინსტრუმენტების შემქმნელთა გუნდმა CLM-8B, როგორც System 1-ის კანდიდატი კონტროლერი - და არა ჩატის შემცვლელი - და გაზომა ის საკუთარ ტერმინალურ მიკრო-მარყუჟზე.

სცენარი

სემი პატარა პროდუქტს მართავს, რომელიც უკვე იყენებს უფრო მძიმე კოდირების აგენტს მრავალფაილიანი რეფაქტორებისთვის. მტკივნეული ნაწილი ცხელი ციკლია: წაიკითხეთ წარუმატებელი ტესტის ტრანსკრიპტი, აირჩიეთ შემდეგი გარსი ან რედაქტირების მოქმედება, გაუშვით, გაიმეორეთ. მომხმარებლები ნაკლებად უჩივიან მოსაწყენ პასუხებს, ვიდრე ზამთრის ხელთათმანების ჩამორჩენას ინსტრუმენტის ორმოცდაათ ნაბიჯზე. სოციალურ ქსელებში პოსტები აძლიერებს კონტრასტული ენის მოდელის წონას და Jev კლასის თანატოლებთან შედარებით დაახლოებით 9-ჯერ დაჩქარებულს, პლუს ძლიერ DeepSWE / Terminal-Bench მაჩვენებლებს მცირე დახვეწის შემდეგ. სემი უარს ამბობს პრესის ჩარტში წარმოების გადაწერაზე.

მათ შექმნეს ერთი შეყოვნების კრიტიკული მიკრო-მარყუჟი: ოცი გამოსწორებული შეცდომების კვალი საკუთარი მონორეპოდან. ამჟამინდელი „მუშა ცხენი“ რჩება ახალი არქიტექტურის ბილეთების განხილვის გზად. CLM-8B - თუ მათი კვალი ჰოსტირებულია და ოდნავ დაზუსტებულია - მხოლოდ „შემდეგი შექცევადი მოქმედების არჩევის“ ეტაპზე კონკურენციის უფლებას იძლევა, დაბალი სანდოობის შემთხვევაში კი უფრო ნელი რეზონერით, როგორც გაქცევის ლუქი.

მიზანია A/B, რომელიც ინარჩუნებს აღკაზმულობის მუდმივობას: იგივე ინსტრუმენტები, იგივე დაშვებულთა სია, იგივე ხელახალი ცდის პოლიტიკა. ჩაიწერეთ მოქმედებები წამში, p50/p95 შეყოვნება, დავალების წარმატება და ადამიანის ჩარევა - შემდეგ კი გადაწყვიტეთ, დაიმსახურებენ თუ არა ღია წონები ადგილს.

რა სჭირდება ასისტენტს

  • რეალური სამუშაოდან აღებული ოცი ანონიმური წარუმატებელი ტესტის კვალი (მხოლოდ შეყვანები + დაშვებული ხელსაწყოები)
  • ფიქსირებული აგენტის შეფუთვა: ხელსაწყოს სქემა, დაშვებულთა სია, მაქსიმალური ნაბიჯები და „ნელი რეზონანსის გამოძახების“ განშტოება
  • მიმდინარე მოდელის საბაზისო ქულები იმავე ოცი დავალების მიხედვით
  • CLM-8B მასპინძლის აპარატურის შენიშვნები (GPU კლასი, სიზუსტე, პარტია), რათა „უფრო სწრაფს“ ჰქონდეს რეფერენტი
  • CLAIM სტიკერის წესი: ავტორი DeepSWE / Terminal-Bench / ~9× / ~32 ms ფიგურები ეტიკეტირებული რჩება მანამ, სანამ ეს აღკაზმულობა რამეს არ გამოიმუშავებს
  • ადამიანი-მფლობელი, რომელიც ამოწმებს არასწორ, მაგრამ სწრაფ ქმედებებს ნებისმიერი CI bolt-ის გამოყენებამდე

მაგალითი ინსტრუქცია

თქვენ მეხმარებით CLM-8B-სთვის სამართლიანი A/B-ის შექმნაში, როგორც ჩვენი კოდირების აგენტის შიგნით სწრაფი მდგომარეობისა და მოქმედების კონტროლერისთვის. გამოიყენეთ მხოლოდ ჩემს მიერ ჩასმული აღკაზმულობის ფაქტები. ნუ მოიგონებთ შეყოვნების მამრავლებს, DeepSWE ქულებს ან ლიცენზიის პირობებს.

დავალება: ჩემი ოცი დავალების სახელწოდებიდან და მიმდინარე საბაზისო შენიშვნებიდან გამომდინარე, შეადგინეთ (1) შეფასების ფურცელი სვეტებით დავალება / მოდელი / ნაბიჯები / კედლის საათი / წარმატება (გავლილი/ჩავარდნილი) / ადამიანის ჩარევა (დიახ/არა) / შენიშვნები, (2) ექვსპუნქტიანი პროტოკოლი, რომელიც ინარჩუნებს შესაფუთ მასალას იდენტური ყველა მოდელში და (3) გადაწყვეტილების წესი მკაფიო, ყოველდღიური ფორმულირებით იმის შესახებ, თუ როდის შეიძლება CLM-8B-მ ფლობდეს მიკრო-მარყუჟს და როდის გადავდივართ ნელ მსჯელობაზე.

შეზღუდვები: ბრიტანული ინგლისური. ავტორის მიერ მოწოდებულ ყველა რიცხვს, თუ ის გამოჩნდება, მიენიჭოს CLAIM-ის ნიშანი. უპირატესობა მიანიჭეთ შექცევად ინსტრუმენტებს. აკრძალეთ „აგენტებმა საბოლოოდ გადაჭრეს“ ენა. თუ ჩემს ჩასმას აკლია მეტრიკა, გამოცნობის ნაცვლად ჩაწერეთ [NEED MEASUREMENT].

გამომავალი: ქულების ფურცლის სათაური და ერთი შევსებული სამაგალითო რიგი ჩანაცვლების ველების გამოყენებით, პროტოკოლის პუნქტები, შემდეგ ესკალაციის/შენარჩუნების წესი. პრეამბულის გარეშე.

როგორ გამოვცადოთ ის

  • გაუშვით იგივე ათი ტრასა მიმდინარე სამუშაო ძრავზე და CLM-8B-ის დახვეწის რეგულირებაზე იდენტური შეფუთვის გამოყენებით. დაადასტურეთ, რომ მხოლოდ კედლის საათი და წარმატება განსხვავდება - არა ხელსაწყოების სიები.
  • იკითხეთ: „რომელი ავტორის ჩარტში შეიძლება შეიცვალოს წარმოება ამ კვირაში?“ კარგი პასუხი: არცერთი, სანამ ეს აღკაზმულობა არ აჩვენებს წარმატებასა და შეყოვნებაზე გამარჯვებას ერთად.
  • უკიდურესი შემთხვევა: CLM-8B პასუხობს ~30 ms-ში დესტრუქციული ბრძანების შეთავაზებით - დაადასტურეთ დაშვებულთა სია და ადამიანის მიერ განხილვისას დააფიქსირეთ იგი CI-მდე.
  • კიდეების შემთხვევა: ახალი API ბილეთი ოცი ტრასის გარეთ - დაადასტურეთ, რომ ის ნელი მსჯელობის მოყვარულია და არა რეფლექსური მოდელი.
  • მიღების შემოწმებები: (1) გაზომილი შედეგის სახით არ არის გამოგონილი 9× მოთხოვნა, (2) p50 და p95 შეყოვნება რეგისტრირებულია, (3) წარმატების მნიშვნელი არის ოცი დავალება, (4) არასწორი სწრაფი მოქმედებები ითვლება, (5) Apache-ს/ლიცენზიის შემოწმება ხდება ოფლაინში ნებისმიერი კომერციული გემის დაგეგმვამდე.

შედეგი

საილუსტრაციო შედეგი (მაგალითად, ერთი სამკაციანი ხელსაწყოების გუნდის შეფასება ოც ფიქსირებულ მონორეპო ტრასაზე, არა ავტორების სკამების დამოუკიდებელი ლაბორატორიული გამეორება): საბაზისო სამუშაო ცხენმა 20 ტრასიდან 14 დაასრულა ადამიანის დახმარების გარეშე; ნაბიჯის საშუალო შეყოვნება დაახლოებით 180 ms; ორ ტრასას ადამიანი დასჭირდა არასწორი რედაქტირების შემდეგ. შიდა ტრასებზე CLM-8B-ის მცირე დახვეწის შემდეგ (იგივე შეფუთვა), 20-დან 15 წარმატებით დასრულდა დახმარების გარეშე; ნაბიჯის საშუალო შეყოვნება დაახლოებით 45 ms მათ ერთ GPU ჰოსტზე; დაშვებულთა სიაში დაფიქსირებული იყო ერთი დამატებითი არასწორი სწრაფი მოქმედება გამოყენებამდე. ოც ტრასისგან შემდგარი ნაკრების კედლის საათი დაახლოებით 38 წუთიდან დაახლოებით 22 წუთამდე შემცირდა, ვერიფიკაციის ეტაპების ჩათვლით. ჰიგიენის საკონტროლო სიაში (აღკაზმულობა უცვლელი დარჩა, CLAIM ეტიკეტები შენარჩუნებულია ავტორების დიაგრამებზე, ნელი მსჯელობა კვლავ გამოიყენება რომანის ბილეთებისთვის, ექსპერიმენტულ აგენტში წარმოების საიდუმლოებები არ არის), 5 მიმოხილვის პუნქტიდან 5 წარმატებით დასრულდა. შეზღუდვები: მცირე დავალებების ნაკრები, ერთი აპარატურის კლასი, მონაცემთა ხარისხის დახვეწა დომინირებს; ეს არ ადასტურებს ავტორების ~9× ან DeepSWE ციფრებს ამ აღკაზმულობის გარეთ.

საკუთარი ვერსიის გასაზომად: გაყინეთ ოცი ტრასა; ჯერ შეაფასეთ მიმდინარე მოდელი; უმასპინძლეთ CLM-8B-ს დოკუმენტირებული სიზუსტით/პარამეტრებით; ხელახლა გაუშვით იგივე შეფუთვით; შეატყობინეთ წარმატება/n, p50/p95, ჩარევები და მიუთითეთ, რომელიმე CLAIM ნომერი ფაქტად იქნა თუ არა მიჩნეული.

რა შეიძლება არასწორად წავიდეს

  • ჩარტის თაყვანისცემა: მიწოდება ~9× სლაიდზე თქვენი საკუთარი p95-ის გარეშე.
  • არასწორი და სწრაფი მოქმედებები: მაღალი ფსონების მქონე რეპოზიტორებში მყისიერი, თავდაჯერებული შეცდომები ამარცხებს ნელ, სწორ შეცდომებს.
  • აღკაზმულობის დრიფტი: მოდელებს შორის ხელსაწყოების მოთხოვნების შეცვლა და მისთვის მოდელის მოგების გამოცხადება.
  • ერთი გმირის დასტა: ნოვატორული არქიტექტურული ნაშრომებისთვის განმსაზღვრელი მსჯელობის უარყოფა.
  • ლიცენზიის ხელით გადაცემა: დაფარვის შეჯამებების ნდობა რეალური წონის რეპოს ლიცენზიის ფაილების ნაცვლად.
  • Shadow CI: სწრაფად გახსნილი აგენტის ჭანჭიკებით ჩასმა მილსადენებში სიჩქარის შეზღუდვის ან ინექციის განხილვის გარეშე.

პრაქტიკული რჩევები

CLM-8B-ს, როგორც აგენტური კოდირების კანდიდატი System 1 კონტროლერის, ფოკუსირებული შეფასება სჭირდება - ღია წონები, გადაწყვეტილების მიმღები სიუჟეტი, ავტორის მიერ მოხსენებული სიჩქარის პრეტენზიები. ეს არ არის კრედო და არც თქვენი დასტისთვის დადასტურებული 9×, სანამ თქვენი აღკაზმულობა ამას არ იტყვის. შეინარჩუნეთ შეფუთვის მუდმივი მნიშვნელობა, აღრიცხეთ წამში მოქმედებები და არასწორი სიჩქარის სიჩქარე, შეინარჩუნეთ უფრო ნელი გაქცევის ლუქი და დატოვეთ CLAIM სტიკერი ყველა პრესის ჩარტზე, სანამ დამოუკიდებელი გაშვებები (მათ შორის თქვენი) არ მოხდება.

ხშირად დასმული კითხვები

რა არის CLM-8B და რატომ საუბრობენ მასზე აგენტების შემქმნელები?

CLM-8B კონტრასტული ენის მოდელის ხაზში პირველი საჯარო წონის ნაკრებია - ღია კვლევითი გამოშვება, რომელიც აგენტებისთვის სწრაფი გადაწყვეტილების მიღების ციკლად არის წარმოდგენილი და არა უბრალოდ კიდევ ერთი ჩატის ტვინი. სასწავლო ისტორია მდგომარეობებს მოქმედებებთან უფრო System 1 რეფლექსის მსგავსად აკავშირებს, ვიდრე შემდეგი ჟეტონით ნელი ესეს მსგავსად. რვა მილიარდი პარამეტრით, ის საკმარისად პატარაა მრავალი ლაბორატორიისა და დამოუკიდებელი შემქმნელისთვის, Apache 2.0 ლიცენზირებით, რომელიც ვარდნის გარშემოა გაშუქებული. გაშვების პოსტებში რიცხვები ავტორის მიერ მოხსენებული მტკიცებებია და არა დამოუკიდებელი ლაბორატორიული გამეორებები.

როგორ ამტკიცებს CLM-8B, რომ აგენტებისთვის Jev-ზე 9-ჯერ უფრო სწრაფია?

პრომოუტერები აცხადებენ, რომ Jev კლასის მოდელებთან შედარებით, დაახლოებით 9-ჯერ უფრო სწრაფი ინფერენციაა, ტერმინალური სტენდის პარამეტრებზე დაახლოებით 32 ms კლასის პასუხებით. მცირე დახვეწის შემდეგ, ისინი ასევე აფიქსირებენ აგენტის კოდირების ძლიერ შედეგებს - DeepSWE დაახლოებით 81.6% და Terminal-Bench 2.1 დაახლოებით 87.6% - და ნულოვანი დარტყმის ხარისხს, რომელიც შედარებადია Jev-თან გაცილებით დაბალი შეყოვნებით. 9× და მილიწამიანი მაჩვენებლები განცხადებებად ჩაითვალეთ მანამ, სანამ მესამე მხარეები მათ საერთო აპარატურაზე არ გაამრავლებენ. შედარებითი სიჩქარისთვის ჯერ კიდევ საჭიროა პარტიის ზომის, სიზუსტის და დეკოდირების პარამეტრების გარკვევა.

რით განსხვავდება კონტრასტული ენობრივი მოდელის ტრენინგი ტიპიური LLM-ისგან?

წარმოების სამართლის მაგისტრების უმეტესობა ერთდროულად ერთ ტოკენს წარმოქმნის, რაც პროზისა და ხანგრძლივი მსჯელობისთვის გამოდგება, მაგრამ აგენტის მიერ მიღებულ ყველა მიკროგადაწყვეტილებას ართულებს. კონტრასტული ენის მოდელის ტრენინგი, როგორც მას პრომოუტერები აღწერენ, ქსელს უბიძგებს, სიტუაციები სასურველ ნაბიჯებზე დააკავშიროს - უფრო პოლიტიკის ხელმძღვანელის მსგავსად, ვიდრე რომანისტის. ეს სისტემა 1-ის ჩარჩო უპირატესობას ანიჭებს სწრაფ მდგომარეობიდან მოქმედებამდე გარდამავალ ციკლებს ინსტრუმენტის გამოძახებებს შორის მარადიულ თხრობასთან შედარებით. CLM-8B-ს კვლავ შეუძლია ტექსტის გამოცემა; ობიექტური და შეფასების ისტორია აგენტურ კონტროლზეა ორიენტირებული.

ვინ გამოუშვა CLM-8B და ნამდვილად ღიაა თუ არა ის?

ჯეკი კვოკმა წარადგინა ნაშრომი; აზალია მირჰოსეინიმ გააფართოა იგი; დაფარვა ასახავს სტენფორდისა და NVIDIA-სთან დაკავშირებულ გუნდურ მუშაობას დასახელებული მკვლევრების, საჯარო წონებისა და ღია კოდის გამოყენებით. რელიზის გარშემო ლიცენზირება ჩამოყალიბებულია როგორც Apache 2.0, რაც მნიშვნელოვანია დახვეწისა და მიწოდებისთვის - მაგრამ დაფარვის შეჯამებებზე დაყრდნობამდე წაიკითხეთ ლიცენზიის ფაილები საცავში. დასახელებული ღია რელიზები, როგორც წესი, უფრო სწრაფად გადის სტრეს-ტესტირებას, ვიდრე ანონიმური დემპები. ფართო მესამე მხარის რეპლიკაციისთვის ჯერ ადრეა.

რატომ არის მდგომარეობიდან მოქმედებამდე გარდაქმნის ციკლები ასეთი მნიშვნელოვანი აგენტური კოდირებისთვის?

აგენტური კოდირება ხშირად ბინარულია: ტესტი ან ეკოლოგიურად სუფთაა, ან არა, ამიტომ სუფთა მოქმედების არჩევანი აჯობებს წარუმატებელი ესეების ლამაზ ვარიანტებს. შეყოვნება ათობით ინსტრუმენტის ნაბიჯზე ნაწილდება - თითო ნაბიჯზე დროის გატარება და კედლის საათისა და ღრუბლოვანი ანგარიშების გადაადგილება. Jev კლასის თანატოლთან შედარებით მოთხოვნილი სიდიდის რიგის სიჩქარე, მაშინაც კი, თუ ის „მხოლოდ“ 4×-ის ტოლია, მაინც ცვლის სიმძლავრის დაგეგმვას. ჰიბრიდული სტეკები - სწრაფი CLM-ის მსგავსი კონტროლერი პლუს უფრო მძიმე რეზონერი მყარ ტოტებზე - რეალისტურ გრძელვადიან ფორმას წარმოადგენს.

უნდა ვენდო თუ არა CLM-8B-სთვის მიღებულ DeepSWE-სა და Terminal-Bench-ის ქულებს?

ეს ნაკრებები სჯის მყიფე აგენტებს, სწორედ ამიტომ, მსუბუქი დახვეწის შემდეგ DeepSWE-ს ~81.6% და Terminal-Bench 2.1-ის ~87.6% საინტერესოდ გამოიყურება. აგენტის სკამები ასევე აჯილდოებს ხარაჩოებს: აღკაზმულობის ხარისხს, ხელსაწყოების დაშვებულ სიებს და აღდგენის მოთხოვნებს შეუძლიათ წარმატების ორნიშნა ციფრით შეცვლა. სანამ დიაგრამას დადგენილ მეცნიერებად მიიჩნევთ, კარგად ჩაუღრმავდით, თუ რა შეფუთვა ედო წონას. ავტორების სკამები მარკეტინგს მანამ აკეთებენ, სანამ ვინმე სხვა არ გაამრავლებს მათ დოკუმენტირებული რეცეპტებით.

რა უნდა ვიცოდე CLM-35B-სა და 8B მოდელის დახვეწის შესახებ?

CLM-35B-ის უფრო დიდი გაგრძელება გეგმად არის ნახსენები; გაურკვეველია, შეინარჩუნებს თუ არა ის შეყოვნების ისტორიას თუ სიჩქარეს სიღრმეზე გაცვლის. CLM-8B-ის დახვეწა საკუთარი lint წესებით, CLI-ის განლაგებით და მონორეპოს კვალის მიხედვით ძლიერი რიცხვებისკენ რეალისტური გზაა - არა ნულოვანი დარტყმის მაგია პირველ დღეს. გუნდებმა შეიძლება ორივე ზომა შეინარჩუნონ, თუ ისინი წარმატებას მიაღწევენ: 8B ცხელი ციკლისთვის, 35B მკაცრი დაგეგმვისთვის. ღია წონა ასევე აადვილებს ბოროტად გამოყენებას, ამიტომ დამცავი ბარიერები და სიჩქარის ლიმიტები პროდუქტია და არა არჩევითი კოსფლეი.

როგორ წავიკითხო ჯევ-ის შედარებები ისე, რომ არ დავიბენო?

Jev-კლასის შედარებები „9-ჯერ უფრო სწრაფ“ თანატოლ წამყვანს იძლევა, რაც ხელს უწყობს პრეზენტაციის დასრულებას. საფრთხე არის პარტიის ზომის, სიზუსტის, კონტექსტის სიგრძის და ინსტრუმენტის გამოძახების სერიალიზაციის ერთ მამრავლად დაშლა. როდესაც chatter ასახელებს ~32 ms-კლასის პასუხებს, იკითხეთ, ნიშნავს თუ არა ეს პირველ ტოკენს, სრული მოქმედების JSON-ს თუ ქეშირებულ პრეფიქსს. გაზომეთ დავალების წარმატება, დოლარი თითო გადაჭრილ ბილეთზე და ადამიანის ჩარევის მაჩვენებელი თქვენს სტეკზე. მეტოქეობის ნარატივები აიძულებს ლაბორატორიებს გამოაქვეყნონ ციფრები; თქვენი წარმოების KPI-ები მაინც გადამწყვეტია.

რა უნდა გააკეთონ მშენებლებმა CLM-8B-ის წარმოებაში გამოყენებამდე?

გამოყავით შეყოვნების კრიტიკული მონაკვეთი - მაგალითად, ტერმინალის მიკრო-მარყუჟი - და A/B დააზუსტეთ თქვენი ამჟამინდელი სამუშაო ცხენის მიმართ მუდმივი აღკაზმულობის შენარჩუნებით. ყურადღება მიაქციეთ არასწორ, მაგრამ სწრაფ მოქმედებებს; დაამატეთ ვერიფიკაცია, უპირატესობა მიანიჭეთ შექცევად ხელსაწყოებს და დაბალი სანდოობის შემთხვევაში, ბიუჯეტში დააყენეთ უფრო ნელი რეზონანსი. თვალყური ადევნეთ მოქმედებებს წამში თითო GPU-ზე და არა მხოლოდ ტოკენებს წამში. არ ჩასვათ წარმოების საიდუმლოებები ექსპერიმენტულ აგენტებში და დატოვეთ CLAIM სტიკერი ყველა პრესის დიაგრამაზე, სანამ თქვენივე გაშვებები არ მოხდება.

როგორ შევქმნა სამართლიანი შეყოვნების მიკრო-ციკლის შეფასება CLM-8B Just Dropp-ის პრეტენზიებისთვის?

გაყინეთ რეალური წარუმატებელი ტესტის კვალის მცირე ნაკრები, შეინარჩუნეთ იგივე ხელსაწყოების სქემა და დაშვებულთა სია სხვადასხვა მოდელში და აღრიცხეთ ნაბიჯები, კედლის საათი, წარმატება და ადამიანის ჩარევები. თუ ინარჩუნებთ განზრახულ გაქცევის ლუქს ახალი ბილეთებისთვის, გამოიყენეთ CLM-8B მხოლოდ „შემდეგი შექცევადი მოქმედების არჩევის“ ეტაპზე. მონიშნეთ ავტორი ~9×, DeepSWE და მილიწამიანი ციფრები, როგორც CLAIM, სანამ ეს აღკაზმულობა არ აჩვენებს გამარჯვებას წარმატებასა და შეყოვნებაზე ერთად. ეს ფოკუსირებული შეფასება სლაიდებზე წარმოების გადაწერას ჯობია.

ცნობები

  1. ჩახუტება სახეზე — კონტრასტული ენის მოდელი (CLM-v0.1-8B) — huggingface.co
  2. GitHub — შედარებადი-LM / CLM — github.com
  3. სტენფორდის უნივერსიტეტი — აზალია მირჰოსეინი — cs.stanford.edu
  4. ჯეკი კვოკი — jackyk02.github.io
  5. X — ჯეკი კვოკის შესავალი — x.com
  6. DeepSWE — deepswe.datacurve.ai
  7. სნორკელის ხელოვნური ინტელექტი — Terminal-Bench 2.1 — snorkel.ai
  8. ჯევი — jevtypesafeai.com
ვიქტორინა
1. რა არის CLM-8B-ის ძირითადი პოზიციონირება?

2. როგორ უნდა განიხილოთ „ჯევზე დაახლოებით 9-ჯერ უფრო სწრაფი“ მტკიცება?

3. CLM-8B-ის თქვენს ამჟამინდელ სამუშაო ცხენთან A/B ტესტირებისას, რას გვირჩევთ სტატიაში?

4. რა ჰიბრიდული დასტის მიდგომას გვთავაზობს სტატია სერიოზული აგენტური სისტემებისთვის?

5. რა უნდა გააკეთონ მშენებლებმა CLM-8B-ის კომერციული ჩანგლის გაგზავნამდე?


ბლოგზე დაბრუნება