მოკლე პასუხი: Claude Opus 5.5-ის მაქსიმალური დონე Arena.ai Code Arena WebDev- 1,818 ქულით და Artificial Analysis-ის Coding Agent Index-ს . ეს საჯარო თერმომეტრებია და არა თქვენი დაგროვილი კოდები. თუ კოდის გაგზავნას საკუთარი შემოსავლის წყაროდ იყენებთ, ნაგულისხმევ პარამეტრზე გადასვლამდე ჩაატარეთ მოკლე „bake-off“ საკუთარ დავალებებზე.
ძირითადი დასკვნები:
Code Arena-ს ლიდერი: 1,818 WebDev Elo-ს უპირატესობად მიიჩნევთ და არა წარმოების დადასტურებად.
აგენტის ინდექსის პიკი: მაქსიმალური ძალისხმევის Opus-ის დაჯავშნა წებოვანი ბილეთებისთვის, სადაც წარუმატებლობა ძვირია.
ღირებულების კომპრომისი: ჟურნალის ტოკენები და კედლის საათი; პიკური და იაფი ქულები განსხვავდება.
ჯერ გამოცხობა: თავად გამოსცადეთ ერთი ინტერფეისის აწყობა, ერთი რეფაქტორი და ერთი გრძელი აგენტის სესია.
გვირგვინი ბრუნავს: შეინარჩუნეთ უფრო იაფი ნაგულისხმევი მნიშვნელობა მოცულობითი სამუშაოსთვის გამოშვების ციკლების განმავლობაში.
ლიდერბორდის აღება, მარტივად ახსნილი
Arena.ai-მ Code Arena-ს WebDev ხაზის პირველ ადგილზე Claude Opus 5.5 (Max) 1,818 ქულით. ეს დაახლოებით ოცდაექვსი ქულით უსწრებს ჩატში შემდეგ მოდელს, GPT-6 Astra Max-ს და წარმოადგენს მნიშვნელოვან წინსვლას წინა Opus 5 Max-თან შედარებით, რომელიც 1,692-ს უახლოვდებოდა. ეს არის დაფის მონაცემები და არა ის, რაც მე დამოუკიდებლად ხელახლა გამოვცადე ჰერმეტულ ლაბორატორიაში. მიუხედავად ამისა, იმავე ოჯახის Max-ის დონეზე დაახლოებით 126 ქულით წინსვლა არის ერთგვარი დელტა, რომელიც ადამიანებს აიძულებს Elo ჩარტებს განაახლონ, როგორც სპორტული ქულები.
Artificial Analysis-ი ცალკე ასახელებს Opus 5.5-ს, როგორც Coding Agent Index-ის ახალ პირველ ადგილს, მათ მიერ თვალყურის დევნებულ შეფასებებში მიღწეული გაუმჯობესებებით. Claude Code-ის ფარგლებში მაქსიმალური ძალისხმევისას, მოდელმა ამ ინდექსზე 66 ქულა დააგროვა - ყველაზე მაღალი, რაც, მათი თქმით, აქამდე გაზომილა. შენიშვნაში არის ერთი ხრიკი: დავალების ღირებულება უფრო მაღალია, როდესაც ძალისხმევას ასე ძლიერად აწვებით. პიკური ქულა და იაფი ქულა ერთი და იგივე არ არის.
ამ ორი სიგნალის გაერთიანებით, თქვენ მიიღებთ ყველაზე მნიშვნელოვან სიუჟეტურ კუთხეს: არა „მოდელის გამოშვება“, არამედ „პროგრამირების დაფების ნაჩქარევად გადაბრუნება“. გამოშვების შესახებ განცხადებები პრესისთვის კეთდება. ლიდერბორდის ხელში ჩაგდების შესახებ ინფორმაცია არის ის, რასაც ძლიერი მომხმარებლები ჯგუფურ ჩატებში არასამუშაო საათებში იღებენ.
- Arena.ai კოდი Arena WebDev: Opus 5.5 (მაქს.) 1,818-ზე
- Gap-ი შემდეგ დასახელებულ კონკურენტთან შედარებით დაფარვის კუთხით: დაახლოებით +26 GPT-6 Astra Max-თან შედარებით
- ნახტომი წინა Opus 5 Max-თან შედარებით: ~1,692-დან 1,818-მდე
- ხელოვნური ანალიზის კოდირების აგენტის ინდექსი: ახალი #1; 66 მაქსიმალური ძალისხმევით კლოდ კოდში
- იგივე შენიშვნა: ამ დატვირთვის პარამეტრში დავალებაზე უფრო მაღალი ღირებულებაა
მოკლე მიმოხილვა: Opus 5 Max vs Opus 5.5 Max Code Arena-ზე
შედარების ცხრილები დაგეხმარებათ, როდესაც არხი მხოლოდ განწყობისა და ეკრანის ანაბეჭდებისგან შედგება. ქვემოთ მოცემულია მარტივი კადრების ჩარჩო და არა დამოუკიდებელი ანალიზი. უჯრედები ცოტა არათანაბარია, რადგან საჯარო დაფები ყოველთვის ასეთია - და რადგან „მაქსის“ სახელის დარქმევა უკვე საკმარისია იმისთვის, რომ ყურადღება გაამახვილოთ.
| მოდელი (როგორც ცნობილია) | დაფა / ზოლი | ქულები / ქულა | რას კითხულობენ ადამიანები მასში |
|---|---|---|---|
| კლოდ ოპუს 5 მაქსი (ადრე) | Arena.ai Code Arena - WebDev | ~1,692 (მოხსენებულია) | ძლიერი, მაგრამ აღარ არის სათაური |
| კლოდ ოპუსი 5.5 (მაქს.) | Arena.ai Code Arena - WebDev | 1,818 (მოხსენებულია #1) | წმინდა ზედა პოსტი; დიდი ნაბიჯი წინა მაქსის წინააღმდეგ |
| GPT-6 ასტრა მაქსი | იგივე Code Arena WebDev ჭორი | ~1,792 თუ გამოვაკლებთ ~26-იან ხარვეზს (მოხსენებული ჩარჩო) | მეორე ადგილზეა ტოტების რაუნდში |
| Opus 5.5 მაქსიმალური დატვირთვით | ხელოვნური ანალიზის კოდირების აგენტის ინდექსი | 66 (მათი ანგარიშის მიხედვით, ყველაზე მაღალი მაჩვენებელი, რაც მათ გაზომეს) | პიკური აგენტის კოდირების ქულა - აღინიშნა სპენდის მხარე |
| ნაკლები ძალისხმევის / იაფი გარბენი | იგივე უფრო ფართო კოდირების სურათი | აქ არც ერთი საჯარო ჯადოსნური რიცხვი არ არის | კომპრომისის ზონა: „საკმარისად კარგი“ vs „დიაგრამის მაქსიმიზაცია“ |
ზოგიერთი მკითხველისთვის ცხრილი ისედაც საკმარისად აღიქმება გამარჯვებულის გამოსავლენად. სინამდვილეში ეს ასე არ არის. ელოს და აგენტის ინდექსები მოსახერხებელი თერმომეტრებია. ისინი თქვენი წარმოების დაგროვილი ნაშთები არ არის.
რა ზომებია Code Arena-ს ფარგლებში?
თუ მხოლოდ რანგს წაიკითხავთ, ტესტის ფორმას ვერ შეამჩნევთ. Code Arena, განსაკუთრებით WebDev-ის მიერ მოყვანილი ვარიანტები, აგებულია კოდირებისა და ინტერფეისის შექმნის ამოცანებში შედარებითი უპირატესობის. ადამიანები (და არენის ხმის მიცემის მექანიზმები) გამარჯვებულებს ირჩევენ მოდელის გამომავალ ვარიანტებს შორის. ეს აჯილდოებს კოდს, რომელიც სწორად გამოიყურება, დემო ვერსიებში გამართულად მუშაობს და ბრმა შედარებისას დახვეწილად გამოიყურება - წინა პლანის სტრუქტურა, ინტერაქტიულობა, ვიზუალური თანმიმდევრულობა, ისეთი რამ, რაც localhost-ის წინასწარი გადახედვისას ყვირის „გააგზავნე“.
ეს განსხვავებული სპორტია სტატიკური მრავალპასუხიანი კოდირების გამოცდისგან. ის ასევე განსხვავდება გრძელვადიანი აგენტის შეფასებისგან, სადაც მოდელს ათობით ინსტრუმენტის გამოძახების დროს გარსის სესია უნდა შეინარჩუნოს ისე, რომ კუთხეში არ აღმოჩნდეს. მოდელს შეუძლია საკმაოდ რთული UI გამოწვევა ჩაშალოს და მაინც წააწყდეს მონორეპო მიგრაციის რთულ პროცესს, რომელიც მოითხოვს სამი ბიბლიოთეკის მიმაგრებას და არასტაბილური ტესტის ნაკრების მართვას, როგორც მძევლის სიტუაციაში.
ასე რომ, როდესაც Opus 5.5 WebDev-ზე 1,818-ზეა, ეს უნდა განიხილოთ, როგორც უპირატესობის სიძლიერე არენის ამომრჩევლების მიერ ნახული ტიპის ბილდებზე. სწრაფი localhost აპლიკაციები, თამაშები, სცენარი და ვიზუალური ინტერფეისი თითქმის ზედმეტად კარგად ერგება ამ ხაზს - რაც შეესაბამება ღამის დემო ვერსიების ვადებს. უპირატესობის ელოს გამოყენება ტყუილი არ არის. ეს კონკრეტული სახის სიმართლეა. მოეპყარით მას, როგორც დეგუსტაციის მენიუს და არა სრულ კვების პანელს.
კიდევ ერთი უცნაურობა: მაქსიმალური დონის ეტიკეტირება. უფრო მაღალი ძალისხმევის / უფრო მაღალი სიმძლავრის პარამეტრები ხშირად ნიშნავს მეტ ტოკენს, მეტ გამოთვლით უნარს და მეტ მოთმინებას. დაფები, რომლებიც მაქსიმალურ ვარიანტებს ავლენენ, აჩვენებენ ზღვარს და არა ყოველდღიურ API ზარს, რომელსაც სტენდაპის ყურების დროს აკეთებთ. ზღვარი მნიშვნელოვანია. ყოველდღიური დრაივერის ღირებულებაც მნიშვნელოვანია. ორივე აზრი გაითვალისწინეთ.
კოდირების აგენტის ინდექსი და დანახარჯისა და პიკის კომპრომისი
Artificial Analysis-ის კოდირების აგენტის ინდექსი ამ აღმავლობის ისტორიის კიდევ ერთი საყრდენია. მათი ანგარიშის მიხედვით, Opus 5.5 სათავეშია, მათ მიერ თვალყურის დევნებულ შეფასებებში გაუმჯობესებებით და Claude Code-ში მაქსიმალური ძალისხმევის 66-ით გამორჩეული. ყველაზე მაღალი მაჩვენებელი, რაც კი მათ გაზომეს, ძლიერი წინადადებაა. მას ასევე მოჰყვება ზრდასრულთათვის განკუთვნილი შენიშვნა: დავალების ღირებულება იზრდება, როდესაც ამაჩქარებელს ამცირებთ.
ეს არის საუკეთესო მოდელის არგუმენტის არსი ბიუჯეტის მქონე გუნდებისთვის. მოდელს, რომელიც მაქსიმალური ძალისხმევით იმარჯვებს, მაინც შეუძლია კვირის წაგება, თუ თითოეული დავალება ჟეტონების მცირე ქონებას დაწვავს. გავრცელებული ჭორები უკვე აღნიშნავს, რომ ზოგიერთი მომხმარებელი ხედავს ჟეტონების დაწვას ხანგრძლივი სესიების დროს. ეს არ აუქმებს ქულას. ეს ცვლის პროდუქტის გადაწყვეტილებას: მაქსიმალური ძალისხმევა უნდა დაიტოვოს უსიამოვნო ბილეთებისთვის და შეინარჩუნოს უფრო იაფი პროფილი წებოვანი კოდისთვის, რეფაქტორებისთვის და „ამ ღილაკის ნაკლებად უშნო გახდის“ სამუშაოსთვის.
წარმოიდგინეთ ეს, როგორც საათობრივად გადამხდელი და სწრაფად მოლაპარაკე კონტრაქტორის დაქირავება. თქვენ გსურთ, რომ მათ რთული პრობლემა გადაჭრან. არ გსურთ, რომ ყველა README გადაწერონ. აგენტის პიკური ქულა შესაძლებლობების პრეტენზიაა. დავალების ღირებულება ოპერაციების პრეტენზიაა. ღამის 1 საათზე სოლო ინდი ჰაკერისთვის საუკეთესო ხელოვნური ინტელექტი ავტომატურად არ ნიშნავს საუკეთესო ხელოვნურ ინტელექტს კომპანიისთვის, რომელიც ერთეულის ეკონომიკურ მიმოხილვას უყურებს. ორივე ჯგუფი ერთსა და იმავე ლიდერბორდის სკრინშოტზე ყვირის.
- მაქსიმალური ძალისხმევის გამოყენება, როდესაც დავალება არასტაბილურია, მრავალფაილიანია და წარუმატებლობა ძვირი ჯდება
- შეამცირეთ ხმოვანი სიგნალი, როდესაც დავალება რუტინული ხდება და ხმა გჭირდებათ
- თვალყური ადევნეთ თქვენს საკუთარ ხარჯებს გაერთიანებულ PR-ზე, არა მხოლოდ საჯარო Elo-ს
- ველით, რომ აგენტების ინდექსები და არენა ელოს შორის ზოგჯერ უთანხმოება იქნება - სხვადასხვა სპორტი
დეველოპერის ღამის რეაქცია: აპლიკაციები, თამაშები და „არ დაზოგოთ“ ენერგია
ციფრები ხსნის სათაურებს. დემო ვერსიები კი განწყობას. დეველოპერები აქვეყნებენ სწრაფ localhost აპლიკაციებს, პაწაწინა თამაშებს, სცენარის ვერსიებს და მომხმარებლის ინტერფეისის/ვიზუალურ ბილდებს, რომლებიც ისე გამოიყურება, თითქოს გასულ კვარტალში შაბათ-კვირას წაართმევდნენ. ნაწილობრივ, ეს შერჩევის მიკერძოებაა - ადამიანები იზიარებენ გამარჯვებულებს და არა სამ წარუმატებელ თაობას, რომლებიც პირველები მოვიდნენ. მიუხედავად ამისა, „მოიცადეთ, რომ სუფთად გამოვიდა“ პოსტების რაოდენობა ნაწილობრივ იმის მიზეზია, თუ რატომ აღიქმება ეს ზრდად და არა ჩუმ პატჩ-ნოტად.
ხუმრობების ციკლი უკვე მომწიფდა: გთხოვთ, ნუ დააზიანებთ Opus 5.5-ს. ეს ხუმრობა მხოლოდ მაშინ ჩნდება, როდესაც მოდელი თითქმის ზედმეტად კარგად გამოიყურება ველურ ბუნებაში, ან როდესაც წინა გამოშვებებმა ხალხს ასწავლა, რომ უსაფრთხოება და პროდუქტის განახლებები ზოგჯერ ამძიმებს სიტუაციას. მნიშვნელობა არ აქვს, მოდის თუ არა რაიმე უარყოფა. მემი განწყობის ტემპერატურის შემოწმებაა. ახლა ეს მაჩვენებელი ანათებს.
პლატფორმებიც იცვლება. მაგალითად, Questflow-მა Opus 5-დან 5.5-მდე განახლებების შესახებ განცხადებები გააკეთა. როდესაც ხელსაწყოების მომწოდებლები სწრაფად ავრცელებენ განახლებულ ვერსიას, ეს იმის სიგნალია, რომ მოთხოვნა ხელშესახებია და წინა დონე უკვე გასული კვირის ნაგულისხმევ დონედ ითვლება. ინტეგრაციის სიჩქარე თავისთავად წარმოადგენს მიმოხილვას: პროდუქტის გუნდები არ ცვლიან მოდელების ამომრჩევლებს სპორტული მიზნებისთვის.
ანეკდოტური ბილდები დეველოპერის რეაქციაა და არა კონტროლირებადი აუდიტი. ეს განსხვავება შუბლზე ტატუირებული გქონდეთ. შესანიშნავი სცენარის დემო ვერსია არ ადასტურებს საწარმოს სანდოობას. ის ადასტურებს, რომ შემოქმედებითი კოდირების სამუშაო პროცესები პოპულარობას იძენს - და პოპულარობა ცვლის იმას, თუ რას ცდილობენ ადამიანები შემდეგ.
რატომ არ ნიშნავს პირველი ნომერი ავტომატურად „ყოველდღიური სამუშაოსთვის საუკეთესო კოდირების ხელოვნურ ინტელექტს“
მოკლე პასუხი: გარკვეული სამუშაოსთვის, რამდენიმე კვირის განმავლობაში. უფრო გრძელი პასუხი: საუკეთესო არის პორტფოლიოს სიტყვა, რომელიც ტროფეის როლს ასრულებს.
თუ თქვენი დღე WebDev-ის ფორმისაა - სადესანტო გვერდები, ინტერაქტიული პროტოტიპები, ვიზუალური დახვეწა, სწრაფი თამაშები, სცენარის მსგავსი ნაკადები - Code Arena WebDev-ის ლიდი ძალიან აქტუალურია. პრივილეგიების მქონე ადამიანები, როგორც წესი, კარგად გამოიყურებიან ბრაუზერში და ბრაუზერში კარგად გამოჩენა ამ სფეროში ნახევარი საქმეა. თუ თქვენი დღე აგენტური კოდირების პროცესია ჩახლართულ კოდურ ბაზაზე, ხელსაწყოებით, გარსებითა და გრძელი სესიებით, Coding Agent Index-ის პიკი უფრო საინტერესო სიგნალია - ხარჯების შესახებ შენიშვნების მიუხედავად.
თუ თქვენი დღე დედამიწაზე ყველაზე რთული ამოცანებია - ახალი ალგორითმები, უსაფრთხოებისთვის კრიტიკული სისტემები, ტომობრივი ცოდნით შეკავშირებული მემკვიდრეობითი დასტები - მომხმარებელთა მიმოხილვებში უკვე ნათქვამია, რომ Opus 5.5-ს კვლავ შეუძლია ჩამორჩეს ურთულეს პრობლემებს და სესიების გაჭიანურებისას ტოკენების დაწვა. ეს არ არის ჩაძირვა. ეს ნაცნობი სასაზღვრო სქემაა: საშუალო შემთხვევა ხტება, პათოლოგიური შემთხვევა კი პათოლოგიური რჩება. ეს შეიძლება იყოს ყველაზე ნაკლებად მომხიბვლელი წინადადება მთელ ამ ნაშრომში და შესაძლოა ყველაზე პრაქტიკულიც.
ასევე გაითვალისწინეთ კონკურენტების მიერ იმავე კვირაში გამოშვება. ჩატერმა ახსენა OpenAI GPT-6 Sol/Luna კლასის გამოშვებები იმავე ბრძოლაში. როდესაც რამდენიმე ლაბორატორია ერთმანეთისგან რამდენიმე დღის ინტერვალით იშლება, ლიდერბორდები მბრუნავ კარად იქცევა. დღევანდელი #1 შეიძლება ხვალინდელი „ჯერ კიდევ შესანიშნავი იყოს, მაგრამ შეხედეთ ამ სხვა დიაგრამას“. საუკეთესო დროებითია. შესაძლებლობების ქვედა ზღვარი, როგორც წესი, უფრო მუდმივად იზრდება. დადეთ ფსონი რხეტზე და არა სკრინშოტზე.
პროდუქტის შესახებ გავრცელებული პრეტენზიები (ყურადღებით მოეპყარით)
დაფების მიღმა, პროდუქტის შესახებ პრეტენზიების ნაკრები ჩვეულებრივ არხებში ვრცელდება. მიუთითეთ ეს, როგორც გავრცელებული პრეტენზიები და არა ამ სტატიიდან მიღებული ლაბორატორიული შედეგები:
- დაახლოებით იგივე შესრულება, რაც „Fable 5.1“-ის კლასის შესრულება ბევრ დავალებაზე, დაახლოებით 40%-ით დაბალი დამუშავების ხარჯებით (მიმოქცევაში არსებული პრეტენზია)
- უფრო ძლიერი აგენტური კოდირება და კომპიუტერის გამოყენების ქცევა, ვიდრე Opus-ის წინა იარუსები (პრეტენზია + განწყობის შესაბამისობა აგენტის ინდექსის მოძრაობასთან)
- ზოგიერთი მომხმარებელი ამბობს, რომ ის კვლავ ჩამორჩება ყველაზე რთულ ამოცანებში
- ხანგრძლივმა სესიებმა შეიძლება ტოკენები უფრო მეტად დაწვას, ვიდრე ხალხი ვარაუდობს
Fable-ის კლასის ღირებულების შესახებ პრეტენზია განსაკუთრებით პიკანტურია, რადგან ის ერთდროულად ცდილობს როგორც ხარისხის, ასევე ეკონომიური პროდუქციის გაყიდვას. თუ ეს თქვენს სამუშაო დატვირთვაშიც შეესაბამება, ეს დიდი პრობლემაა ყველასთვის, ვინც ადრე ფიქრობდა, რომ Opus-ის დონის ხარისხი ყოველ საღამოს მდიდრული ვახშმის ფასივით იყო. თუ ეს თქვენს შეთავაზებებში არ შეესაბამება, ამას Elo-შიც კი იგრძნობთ. პირადი სამუშაო დატვირთვა > მარკეტინგული სიახლოვე. ყოველთვის.
ხელოვნური ანალიზის ისტორიას ყველაზე უკეთ ემთხვევა კომპიუტერის უფრო ძლიერი გამოყენება და აგენტური კოდირება. აგენტები, რომლებსაც შეუძლიათ ხელსაწყოების მართვა, დაწკაპუნება და მდგომარეობის თანმიმდევრულობის შენარჩუნება, პროდუქტის ის ფორმაა, რომელიც ბევრ შემქმნელს სურს. WebDev-ზე Preference Elo-ს და აგენტის ინდექსის პიკებს შეუძლიათ რითმულად იმოქმედონ იდენტური ტყუპების გარეშე. როდესაც ისინი რითმობენ, ხალხი ხმამაღლა იწყებს ლაპარაკს. როდესაც ისინი მოგვიანებით განსხვავდებიან, ხალხი ცინიკურად ხდებიან. იცხოვრეთ შუაში.
იმავე კვირის ჩხუბი: რატომ აძლიერებს დრო ყველაფერს
Opus 5.5-ის გამოშვება წყნარი ამბების უდაბნოში არ მომხდარა. ის ცოტა ხნის წინ გამოვიდა იმავე კვირაში, როდესაც კონკურენტი მოდელების გამოშვებები გამოვიდა, რომლებსაც ჭორი გამუდმებით აერთიანებს - მათ შორის OpenAI GPT-6 Sol/Luna-ს ნახსენები. ხალხმრავლობა მნიშვნელოვანია. გადატვირთული კვირები შედარებით სკრინშოტებს ქმნის. შედარებითი სკრინშოტები ტომობრივ ბანაკებს ქმნის. ტომობრივი ბანაკები ქმნის ილუზიას, რომ ერთი დიაგრამა ამკვიდრებს ცივილიზაციას.
ეს ასევე ქმნის მნიშვნელოვან სტრეს-ტესტს. როდესაც ერთდროულად რამდენიმე ძლიერი მოდელი მუშაობს, დეველოპერები მათ A/B-ს ერთსა და იმავე სათამაშო აპლიკაციებზე რამდენიმე საათში ათავსებენ. ღამის ლოკალური ჰოსტების ბუმი ნაწილობრივ სწორედ ამ სტრეს-ტესტის სოციალურ მედიაში გაჟონვაა. თქვენ უყურებთ განაწილებულ „bake-off“-ს საშინელი მეთოდოლოგიითა და შესანიშნავი გასართობი ღირებულებით. ეს მეცნიერება არ არის. მას მაინც შეუძლია სიგნალის გადაცემა, თუ ყურადღებას არ მიაქცევთ და შერჩევის მიკერძოებას არ მიაქცევთ ყურადღებას.
Anthropic-ისთვის, Code Arena-სა და Coding Agent Index-ზე #1 პოსტის ამ ჩხუბის დროს მოხვედრა შესანიშნავი დროა - ან შესანიშნავი მოდელის ხარისხი, რომელიც შემთხვევით დროის მსგავსად გამოიყურება. ნებისმიერ შემთხვევაში, ნარატივი დარჩა: კოდირების ტალღა, და არა მხოლოდ გაშვების პოსტი.
რა უნდა გააკეთონ მშენებლებმა ამასთან დაკავშირებით
პრაქტიკული სახელმძღვანელო, მისტიციზმის გარეშე:
- გაუშვით თქვენი საკუთარი სამამოცანიანი საკვანძო პროგრამა: ერთი ინტერფეისის აწყობა, ერთი მრავალფაილური რეფაქტორი და ერთი ხანგრძლივი აგენტის სესია
- ჟურნალის ჟეტონები და კედლის საათი, არა მხოლოდ „მუშაობდა თუ არა“
- Arena.ai-სა და Artificial Analysis-ს რეიტინგის ისტორიის მთავარ საჯარო თერმომეტრებად მიიჩნევენ
- დიდი მოცულობის საოჯახო საქმეებისთვის შეინარჩუნეთ უფრო იაფი, ნაგულისხმევი მოდელი
- თუ იყენებთ ისეთ პლატფორმებს, როგორიცაა Questflow, რომელიც უკვე გადავიდა 5.5 ვერსიაზე, ყველაფრის გადაწერამდე დააკვირდით, თუ როგორ იცვლება თქვენი არსებული სამუშაო პროცესები
- უგულებელყავით „საუკეთესო სამუდამოდ“ ვერსიები; რამდენიმე გამოშვების ციკლის შემდეგ ხელახლა იხილეთ
თუ UI დავალება წარმატებულია და აგენტის ხანგრძლივი სესია ძვირი დაგიჯდებათ, პასუხს ერთ შუადღეს მიიღებთ. თუ როგორც პოპულარობა, ასევე ფასი თქვენი მასშტაბისთვის მისაღებია, გილოცავთ - შესაძლოა ახალი ნაგულისხმევი მნიშვნელობა გქონდეთ. თუ ყველაზე რთული დავალება მაინც ვერ მოხერხდა, თქვენ ისწავლეთ ის, რასაც ლიდერბორდები ვერასდროს გეტყოდნენ. ეს არის მთელი თამაში. ოდნავ მშრალი. ძალიან პრაქტიკული.
ერთი არასრულყოფილი მეტაფორა, რადგან ამ მუხლებს კოსმიური კანონი ავალდებულებს, რომ ეს მეტაფორა ჰქონდეთ: ერთი ელოს ლიდერის „საუკეთესო კოდირების ხელოვნურ ინტელექტად“ მოხსენიება იგივეა, რაც მსოფლიოს საუკეთესო შეფ-მზარეულის დაჯილდოება იმის გამო, რომ მან დესერტების კონკურსში გაიმარჯვა. დესერტებსაც აქვს მნიშვნელობა. ასევე მნიშვნელოვანია თორმეტი პრეტენზიული ნათესავისთვის სადილის მომზადება გაფუჭებული ღუმელით. თქვენი რეპოზიტორი ნათესავები არიან.
როგორ ერგება ეს უფრო ფართო კოდირებისა და ხელოვნური ინტელექტის შეიარაღებულ რბოლას
მასშტაბის შემცირებით, ნიმუში ნაცნობი გახდება. ლაბორატორიები აგზავნიან. დაფები ირევა. დეველოპერები ახალ ჭერის ზღვარს აჭარბებენ. ხელსაწყოების მომწოდებლები აუმჯობესებენ ნაგულისხმევ პარამეტრებს. ვიღაც აქვეყნებს განსაცვიფრებელ მინი თამაშს. ვიღაც კი აქვეყნებს წარუმატებლობას უსიამოვნო შეცდომაზე. საშუალო შესაძლებლობები იზრდება მაშინაც კი, როდესაც გვირგვინი თავს იცვლის.
აქ უფრო ახალია ორმაგი დაფის სიგნალი პლუს ღირებულების სქოლიო, რომელიც დიდებასთან ერთად მოგზაურობს. ჩვენ წარსულს ჩაბარდა ის ეპოქა, როდესაც ერთი ჩატის საორიენტაციო ნიშნულს შეეძლო მთელი ნარატივის ტარება. კოდირების სამუშაო პრაქტიკაში მულტიმოდალურია: ჩაწერა, რედაქტირება, დათვალიერება, დაწკაპუნება, გაშვება, ხელახლა ცდა. ინდექსები, რომლებიც აგენტურობაზეა ორიენტირებული და არენები, რომლებიც WebDev-ის უპირატესობაზეა ორიენტირებული, ამის სხვადასხვა ნაწილს იჭერენ. როდესაც ერთი მოდელი ერთდროულად ლიდერობს ორივე ნაჭერზე, ტალღის ტალღის შესახებ საუბარი თავისით იწერება.
არავინ იცის, დარჩება თუ არა Opus 5.5 ლიდერობის პოზიციაზე. თუ დაახლოებით 26-ქულიანი სხვაობა შენარჩუნდება, კონკურენტი Max-ის იარუსები WebDev-ის დაფაზე უკვე ძალიან ახლოს არიან. ასეთი მცირე სხვაობები შეიძლება შეიცვალოს. შესაძლებლობები, რომლებიც დემო ვერსიებში „ღამის განმავლობაში უკეთესად“ იგრძნობა, რამდენიმე კვირის შემდეგაც კი, როდესაც ყველა ადაპტირდება, შეიძლება ახალ ნორმად იქცეს. საინტერესო, მდგრადი კითხვა არ არის გვირგვინი. საქმე იმაშია, გააგრძელებს თუ არა აგენტური კოდირების ხარისხის ფასი დოლარზე ზრდას ჩვეულებრივი მშენებლებისთვის. ამ კითხვაზე, 66-ის ახალი მაქსიმუმი, რომელიც აშკარა ხარჯების გაფრთხილებას შეიცავს, გამჭვირვალე, მარკეტინგთან დაკავშირებული რეპორტინგია. დამსახურებაა.
საბოლოო შედეგი
Claude Opus 5.5-ის Max დონე Arena.ai-ის Code Arena WebDev ხაზზე #1 ადგილზეა 1,818 ქულით, რაც დაახლოებით ოცდაექვსით უსწრებს შემდეგ დასახელებულ კონკურენტს დაფარვის კუთხით და გაცილებით მეტია, ვიდრე წინა Opus 5 Max, რომელიც 1,692-ს შეადგენდა. Artificial Analysis-ის მონაცემებით, ის Coding Agent Index-ის ახალ #1 დონედ ითვლება, Claude Code-ში მაქსიმალური ძალისხმევით 66 - რაც ჯერჯერობით მათი ყველაზე მაღალი მაჩვენებელია - პლუს აღნიშვნა, რომ დავალების ღირებულება ამ ძალისხმევის შედეგად იზრდება. დეველოპერების რეაქცია ხმამაღალია: სწრაფი localhost აპლიკაციები, თამაშები, სცენარისტები, UI ბილდები, „არ დააზიანოთ“ ხუმრობები და პლატფორმის განახლებები, როგორიცაა Questflow-ის Opus 5-დან 5.5-ზე გადასვლა. გავრცელებული განცხადებები ამატებს Fable-კლასის დაბალ ფასად ისტორიას, უფრო ძლიერ აგენტურ/კომპიუტერული გამოყენების განწყობას და ნაცნობ გაფრთხილებებს რთული ამოცანებისა და ტოკენების დაწვის შესახებ.
WebDev-ის ფორმის პრეფერენციული ამოცანებისა და მაღალი ძალისხმევის მქონე აგენტის კოდირების შემთხვევაში, საჯარო საბჭოები ამბობენ, რომ ამჟამად Opus 5.5 ლიდერობს. თქვენი კონკრეტული საცავის, ბიუჯეტისა და კოშმარული ბილეთებისთვის, თქვენ მაინც უნდა ჩაატაროთ გამოცხობის პროცესი. გვირგვინები ბრუნავს. ხელსაწყოები კომპლექსდება. გამოიყენეთ ტალღა, ნუ სცემთ მას თაყვანს. და შესაძლოა, მეორე მოდელიც თბილად შეინარჩუნოთ, როდესაც ინვოისი სიუჟეტურ შემობრუნებას დაემსგავსება.
პრაქტიკული მაგალითი: სამამოცანიანი Opus 5.5-ის საკონტროლო ვერსიის გაშვება ნაგულისხმევის შეცვლამდე
ის რეიტინგის სკრინშოტები Code Arena-ზე #1 ადგილზეა - ახლა საუკეთესო კოდირების ხელოვნური ინტელექტის პრეტენდენტებს შორის თერმომეტრებია და არა დაგროვილი სამუშაო. აი, როგორ აქცია ბრიტანელმა ფრილანსერმა full-stack დეველოპერმა ღამის Elo-ს ტალღა ერთ შუადღის გამოცდად - ერთი ინტერფეისის აწყობა, ერთი მრავალფაილური რეფაქტორი, ერთი გრძელი აგენტის სესია - სანამ ნებისმიერი ნაგულისხმევი მოდელის ამომრჩევი გადაირთვებოდა.
სცენარი
რაილი კლიენტის სადესანტო გვერდებს და SaaS გვერდითი პროექტისთვის უზარმაზარ React/Node მონორეპოს აგზავნის. Arena.ai Code Arena WebDev პოსტებისა და Artificial Analysis-ის Coding Agent Index-ის ჩეთების შემდეგ, რომლებიც Opus 5.5 (Max)-ზე გამოვიდა, Slack-ი „ყველაფრისთვის უბრალოდ Max გამოიყენე“ ენერგიით აივსო. რაილის ინვოისები ისედაც მძიმე იყო ხანგრძლივი სესიებისთვის, ხოლო გასული კვარტლის „საუკეთესო სამუდამოდ“ ცვლამ მათ თვეში ორჯერ მოუწიათ შეთავაზებების გადაწერა.
ისინი საჯარო დაფებს კონტექსტად ინახავენ - WebDev-ზე 1,818 შემთხვევა დაფიქსირდა, აგენტის ინდექსის პიკი ხარჯების სქოლიოთი - და უარს ამბობენ ელოს წარმოების განაჩენად აღქმაზე. გეგმა: სამი ფიქსირებული დავალება Opus 5.5-ზე ნორმალური დატვირთვის პარამეტრით და, მხოლოდ საჭიროების შემთხვევაში, ერთი მაქსიმალური/მაქსიმალური ძალისხმევის გადაცემა წებოვან ბილეთზე. ჟურნალის ჟეტონები, კედლის საათი და იმის გარკვევა, მოხდა თუ არა ცვლილება ძირითადში. უფრო იაფი მოდელი თბილად რჩება წებოვანი სამუშაოსთვის.
მიზანი „საუკეთესოს“ პერსონალური განმარტებაა: ხარისხი თითოეული გაერთიანებული ცვლილებისთვის და არა ჯგუფური ჩატის ეკრანის ანაბეჭდი.
რა სჭირდება ასისტენტს
- სამი გაყინული მოკლე აღწერა: (1) მცირე ინტერაქტიული WebDev ინტერფეისი, (2) მრავალფაილური რეფაქტორი ტესტებით, (3) გრძელი აგენტის სტილის სესია ინსტრუმენტებით/შელი ნაბიჯებით
- ქულების ფურცელი: დავალება / ძალისხმევის დაყენება / ჟეტონები / კედლის საათი / სუფთად მუშაობდა? / გაერთიანდა? / შენიშვნები
- წინა სტანდარტული მოდელის საბაზისო შენიშვნები იმავე სამ მოკლე მიმოხილვაზე (თუნდაც უხეში)
- ბიუჯეტის წესი: მაქსიმალური ძალისხმევა მხოლოდ მაშინ, როდესაც წარუმატებლობა ძვირია; უფრო იაფი ნაგულისხმევი ვარიანტი დიდი მოცულობის საოჯახო საქმეებისთვის
- საჯარო დაფების ბმულები ან ეკრანის ანაბეჭდები, რომლებზეც მითითებულია „მხოლოდ თერმომეტრი“ და რომლებიც მიღების კრიტერიუმებს არ წარმოადგენს
- ადამიანი მფლობელი, რომელიც ნაგულისხმევ პარამეტრს გადაწყვეტს გამოცხობის შემდეგ - და არა პირველი ლამაზი localhost დემო ვერსიის შემდეგ
მაგალითი ინსტრუქცია
თქვენ მეხმარებით Claude Opus 5.5-ისთვის სამამოცანიანი გამოცდის ჩატარებაში, სანამ ჩემს კოდირებას შევცვლი. გამოიყენეთ მხოლოდ ჩემს მიერ ჩასმული დავალებების მოკლე აღწერა და გამოყენების ციფრები. ნუ მოიგონებთ Arena Elo-ს, აგენტის ინდექსის ქულებს ან ხარჯების პროცენტებს.
დავალება: შევადგინო ჩემი ქულების ფურცელი სამი ბრიფისთვის განკუთვნილი ჩანაცვლებით. შემდეგ დაწერეთ ექვსპუნქტიანი გადაწყვეტილების წესი: როდის შევინარჩუნო Opus 5.5 ნაგულისხმევად, როდის შევინარჩუნო მაქსიმალური/მაქსიმალური ძალისხმევა მხოლოდ წებოვანი ბილეთებისთვის და როდის შევინარჩუნო უფრო იაფი მოდელი მოცულობითი სამუშაოებისთვის. თუ ჩემს ჩასმაში საჯარო ლიდერბორდის ნომერი გამოჩნდება, მიამაგრეთ მას თერმომეტრი.
შეზღუდვები: ბრიტანული ინგლისური. აკრძალეთ „საუკეთესო კოდირების ხელოვნური ინტელექტი სამუდამოდ“ ენა. უპირატესობა მიანიჭეთ გაერთიანებულ ცვლილებაზე დაფუძნებულ ღირებულებას ინტუიციასთან შედარებით. თუ მეტრიკა აკლია, Fable-კლასის ან 40%-იანი პრეტენზიების გამოცნობის ნაცვლად ჩაწერეთ [NEED MEASUREMENT].
გამომავალი: ცხრილის სათაური პლუს სამი ცარიელი რიგი, რომლებიც ჩემი დავალებების სახელწოდებითაა დასახელებული, შემდეგ კი გადაწყვეტილების პუნქტები. შესავალი არ არის.
როგორ გამოვცადოთ ის
- UI brief-ი და რეფაქტორი იმავე დატვირთვით შეასრულეთ, რასაც ყოველდღიურად იყენებთ. დარწმუნდით, რომ ტოკენები და კედლის საათი დარეგისტრირებულია და არა მხოლოდ „კარგად გამოიყურებოდა“
- იკითხეთ: „მხოლოდ Code Arena #1 ამართლებდა თუ არა წარმოების შეცვლას?“ კარგი პასუხია: არა - მხოლოდ გამოცხობის შედეგები ამართლებს.
- უკიდურესი შემთხვევა: ინტერფეისი იხსნება, აგენტის ხანგრძლივი სესია ტოკენებს წვავს და მაინც ადამიანია საჭირო - დაადასტურეთ, რომ მაქსი დაჯავშნილია და არა წებოვანი სამუშაოსთვის ნაგულისხმევად.
- კიდის შემთხვევა: ყველაზე რთული პათოლოგიური ბილეთი მაინც ვერ ხერხდება - დარწმუნდით, რომ მეორე მოდელს თბილად ინახავთ და მთელ დასტას არ გადაწერთ.
- მიღების შემოწმებები: (1) არ არის გამოგონილი 1,818 ან 66, როგორც თქვენი გაზომილი ქულა, (2) სამი დავალება შესრულებულია ან აშკარად ვერ ხერხდება შენიშვნებით, (3) ხარჯების რეგისტრაცია, (4) უფრო იაფი ნაგულისხმევი დავალება კვლავ დასახელებულია მოცულობის მიხედვით, (5) ხელახალი ვიზიტის თარიღი დაყენებულია რამდენიმე გამოშვების ციკლის შემდეგ.
შედეგი
საილუსტრაციო შედეგი (ერთი ფრილანსერი დეველოპერის შეფასების მაგალითი სამ გაყინულ ბრიფზე ერთ შუადღეში, არა Arena.ai-ს ან Artificial Analysis-ის დამოუკიდებელი გამეორება): WebDev სტილის UI brief-ზე, Opus 5.5-მა ნორმალური დატვირთვით ერთი გავლისას სუფთა localhost-ის წინასწარი გადახედვა მოახდინა (მსუბუქი დამუშავების შემდეგ 1-დან 1 გაერთიანდა; დაახლოებით 12 წუთი კედლის საათის მიხედვით). მრავალფაილიან რეფაქტორზე, ერთი რეფაქტორზე ერთი ტესტის შემდეგ 1 ტესტის ნაკრები მწვანე გახდა; ტოკენები დაახლოებით 30%-ით მეტი იყო იმავე brief-ზე წინა ნაგულისხმევ პარამეტრთან შედარებით (თვითშეტყობინებით მოხსენებული გამოყენების ექსპორტი). აგენტის ხანგრძლივ სესიაზე, წებოვანი ბილეთი ადამიანის დახმარებით დასრულდა ტოკენების პიკის შემდეგ - ძლიერი იყო უფრო მაღალი დატვირთვისას, ძალიან ძვირი, როგორც ყოველდღიური ნაგულისხმევი. გადაწყვეტილება გამოცდის შემდეგ: Opus 5.5 გახდა ნაგულისხმევი UI და საშუალო ზომის რეფაქტორებისთვის; მაქსიმალური ძალისხმევა დაცული იყო უსიამოვნო ბილეთებისთვის; უფრო იაფი მოდელი შენახული იყო README/წებოს სამუშაოებისთვის. ჰიგიენის საკონტროლო სიაში (თერმომეტრის ეტიკეტები შენახულია, ტოკენები დაფიქსირებულია, მეორე მოდელი თბილია, „საუკეთესო სამუდამოდ“ ჩანაცვლება არ არის), 4-დან 4 პუნქტი წარმატებით დასრულდა. შეზღუდვები: n=3 დავალება, ერთი დეველოპერი, შერჩევის მიკერძოება გაზიარებადი UI გამარჯვებებისკენ; საჯარო Elo ხარვეზები შეიძლება მომავალ კვირას შეიცვალოს.
საკუთარი ვერსიის გასაზომად: გაყინეთ იგივე სამი ბრიფი; ჯერ შეაფასეთ თქვენი მიმდინარე ნაგულისხმევი; გაუშვით Opus 5.5 იდენტური ბრიფებით; შეადარეთ წარმატება, ჟეტონები, კედლის საათი და შერწყმის მაჩვენებელი; შემდეგ დააყენეთ ძალისხმევის დონეები ნაჩვენები მნიშვნელით.
რა შეიძლება არასწორად წავიდეს
- სკრინშოტის თაყვანისცემა: Code Arena-ს რანგის ნაგულისხმევი პარამეტრების შეცვლა თავისთავად მოქმედებს.
- მაქსიმუმი ყველაფრისთვის: წებოვანი კოდის გამოყენებით ჟეტონების ბიუჯეტის დაწვა, რადგან ზედა ქულა საკმაოდ კარგად გამოიყურებოდა.
- დემო მიკერძოება: სთორიბორდის მოგებიდან განწყობის გადაცემა მაშინ, როდესაც მონორეპოს ბილეთი მაინც ვერ ხერხდება.
- ხარჯებისადმი სიბრმავე: აგენტის ინდექსის პიკებზე დავალების ღირებულების შენიშვნების იგნორირება.
- ერთი მოდელის ჩაკეტვა: თბილი სარეზერვო ძალის გამოშვება, როდესაც კონკურენტი Max-ის იარუსები ყვირილის მანძილზე დგანან.
- მარადიული ფიქრი: შემდეგი ხალხმრავალი გაშვების კვირის შემდეგ ხელახლა ვიზიტის გამოტოვება.
პრაქტიკული რჩევები
Opus 5.5-ის წამყვანი Code Arena WebDev და Coding Agent Index ნამდვილი ტალღის სიგნალია - და მაინც მხოლოდ თერმომეტრი. გაუშვით ერთი UI build, ერთი მრავალფაილური რეფაქტორი და ერთი გრძელი აგენტის სესია; აღრიცხეთ ტოკენები და შერწყმები; დაზოგეთ მაქსიმალური ძალისხმევა წებოვანი სამუშაოსთვის; შეინარჩუნეთ უფრო იაფი ნაგულისხმევი მნიშვნელობა მოცულობისთვის. გვირგვინები ბრუნავს. თქვენი ღირებულების ცვლილება შერწყმულ თოფზე არის მნიშვნელოვანი.
ხშირად დასმული კითხვები
რას ნიშნავს, რომ Claude Opus 5.5 ახლახანს პირველ ადგილზე გავიდა Code Arena-ზე?
Arena.ai-მ Claude Opus 5.5 (Max) Code Arena-ს WebDev ხაზის სათავეში 1,818 ქულით დააყენა - დაახლოებით ოცდაექვსი ქულით უსწრებს GPT-6 Astra Max-ს გაშუქების მიხედვით და მნიშვნელოვანი ნახტომია წინა Opus 5 Max-თან შედარებით, რომელიც 1,692-ს უახლოვდება. Artificial Analysis, ცალკე ტრეკში, Opus 5.5-ს ასევე ასახელებს, როგორც ახალ პირველ ადგილს Coding Agent Index-ში, მათ შორის 66 მაქსიმალური ძალისხმევით Claude Code-ში. ეს არის დაფის მონაცემები და არა დამოუკიდებელი ლაბორატორიული აუდიტი. საქმე ეხება კოდირების დაფების ნაჩქარევად გადაბრუნებას და არა მხოლოდ გაშვების პოსტს.
რამდენად დიდია ნახტომი Opus 5 Max-დან Opus 5.5 Max-მდე Code Arena-ზე?
WebDev-ის მიერ მოწოდებულ სნეპშოტზე, წინა Claude Opus 5 Max-მა 1,692-თან ახლოს იდგა, ხოლო Opus 5.5 (Max)-მა 1,818 ქულა დააგროვა და უდავო ლიდერი გახდა. ეს დაახლოებით 126 ქულით წინსვლაა იმავე ოჯახის Max-ის რეიტინგთან შედარებით - ისეთი დელტა, რომელიც ადამიანებს Elo ჩარტების განახლებას აიძულებს, როგორც სპორტული ქულების. GPT-6 Astra Max მეორე ადგილზეა დაახლოებით 26 ქულით სხვაობით. ცხრილი გაითვალისწინეთ, როგორც უპირატესობის სიძლიერის თერმომეტრი და არა თქვენი წარმოების დაგროვილი რაოდენობის შეფასება.
რას ზომავს Code Arena-ს WebDev ხაზი პრაქტიკაში?
Code Arena WebDev აგებულია კოდირებისა და ინტერფეისის შექმნის ამოცანებში შედარებითი უპირატესობის საფუძველზე: ამომრჩეველი ირჩევს გამარჯვებულს მოდელის გამომავალ შედეგებს შორის. ეს აჯილდოებს კოდს, რომელიც კარგად გამოიყურება, დემო ვერსიებში გამართულად მუშაობს და დახვეწილია - წინა სტრუქტურის, ინტერაქტიულობისა და ვიზუალური თანმიმდევრულობის თვალსაზრისით. ეს განსხვავდება სტატიკური მრავალპასუხიანი გამოცდისგან ან გრძელვადიანი აგენტის შეფასებისგან, რომელმაც უნდა შეინარჩუნოს გარსი ათობით ინსტრუმენტის გამოძახებისთვის. 1,818 WebDev ლიდერობა არის უპირატესობის სიძლიერე ამ ბილდებში და არა სრული კვების პანელი ყველა რეპოზიტორისთვის.
რა არის ხელოვნური ანალიზის კოდირების აგენტის ინდექსის ქულა Opus 5.5-ისთვის?
Artificial Analysis-ის კოდირების აგენტის ინდექსში Opus 5.5-ს პირველ ადგილზე ასახელებს, რასაც თვალყურს ადევნებდა შეფასებები. Claude Code-ის მაქსიმალური დატვირთვისას მოდელმა 66 ქულა დააგროვა - ყველაზე მაღალი, რაც, მათი თქმით, აქამდე გაზომილა. ზრდასრულთათვის შენიშვნის სახით უნდა აღინიშნოს, რომ ამაჩქარებლის დაჭერისას დავალების ღირებულება იზრდება. აგენტის პიკური ქულა შესაძლებლობების მტკიცებაა; დავალების ღირებულება ოპერაციების მტკიცებაა და ისინი ერთი და იგივე არსებაა.
არის თუ არა Claude Opus 5.5 საუკეთესო კოდირების ხელოვნური ინტელექტი ყოველდღიური სამუშაოსთვის?
ეს დამოკიდებულია იმაზე, თუ რას ნიშნავს თქვენთვის „საუკეთესო“: ელოს საჯარო ასპარეზზე, აგენტის ინდექსს მაქსიმალური ძალისხმევით, დასრულებულ დავალებაზე დანახარჯს თუ თქვენი ჩახლართული საცავი პარასკევს საღამოს კომპილირდება. WebDev-ის ფორმის დღეები - სადესანტო გვერდები, პროტოტიპები, ვიზუალური დახვეწა - კარგად ერწყმის Code Arena WebDev-ის ლიდერს. ჩახლართულ კოდურ ბაზებში აგენტის დღეები კოდირების აგენტის ინდექსს უფრო საინტერესოს ხდის, ხარჯების შესახებ გაფრთხილებით. გავრცელებული ჩანაწერების თანახმად, მას მაინც შეუძლია ჩამორჩეს ყველაზე რთულ დავალებებზე და დაწვას ტოკენები ხანგრძლივი სესიების დროს.
როგორ უნდა გაუმკლავდნენ გუნდები Opus 5.5-ის ფასისა და პიკის კომპრომისს?
მაქსიმალური ძალისხმევა დაზოგეთ წებოვანი, მრავალფაილიანი სამუშაოსთვის, სადაც წარუმატებლობა ძვირია და შეამცირეთ რუტინული წებოვანი კოდის, რეფაქტორების და გაპრიალების რაოდენობა, რომლებიც მოცულობას საჭიროებს. აკონტროლეთ თქვენი საკუთარი ღირებულების PR თითოეული გაერთიანების შემთხვევაში, არა მხოლოდ საჯარო Elo. მოდელმა, რომელიც მაქსიმალური ძალისხმევით იმარჯვებს, მაინც შეიძლება კვირა წააგოს, თუ თითოეული დავალება ტოკენებში დიდ ქონებას დაწვავს. მარტოხელა ინდი ჰაკერებმა და კომპანიებმა, რომლებიც ერთეულების ეკონომიკას აკვირდებიან, შეიძლება იყვირონ ერთი და იგივე ეკრანის ანაბეჭდზე, მაშინ როცა სხვადასხვა ნაგულისხმევი პარამეტრები სჭირდებათ.
რა გავრცელებული პროდუქტის პრეტენზიებია კლოდ ოპუს 5.5-ის შესახებ, რომელიც ახლახანს #1 ადგილზე გავიდა, ჭორების გარშემო?
გაშუქება ავრცელებს მტკიცებებს, რომ ბევრ დავალებაზე დაახლოებით იგივე „Fable 5.1“ კლასის შესრულებაა, დაახლოებით 40%-ით დაბალი შესრულების ხარჯებით, პლუს უფრო ძლიერი აგენტური კოდირება და კომპიუტერის გამოყენების ქცევა, ვიდრე Opus-ის წინა თაობები. ზოგიერთი მომხმარებელი ამბობს, რომ ის კვლავ ჩამორჩება ყველაზე რთულ დავალებებში და ხანგრძლივმა სესიებმა შეიძლება ტოკენები უფრო მეტად დაწვას, ვიდრე ხალხი მოელის. განიხილეთ ეს, როგორც ვრცელ მტკიცებები და არა სტატიიდან დადასტურებული ლაბორატორიული შედეგები. ინვოისის მოსვლისას პირადი დატვირთვა ჯობნის მარკეტინგულ სიახლოვეს.
რატომ იყო დეველოპერის ღამის რეაქცია ასე ხმამაღალი ამ კვირაში?
დეველოპერები აქვეყნებენ სწრაფ localhost აპლიკაციებს, პატარა თამაშებს, სცენარის დაფებს და UI ბილდებს, რომლებიც გასული კვარტლის შაბათ-კვირის პროექტებს ჰგავს - გამარჯვებულების მიმართ შერჩევის მიკერძოებით. „გთხოვთ, არ დააზიანოთ“ ხუმრობები განწყობის ტემპერატურის შემოწმებაა, როდესაც მოდელი თითქმის ზედმეტად კარგად გამოიყურება. ისეთი პლატფორმები, როგორიცაა Questflow, ხშირად საუბრობენ Opus 5-დან 5.5-მდე განახლებაზე, რაც ხელშესახებ მოთხოვნაზე მიუთითებს. ანეკდოტური დემო ვერსიები რეაქციაა და არა კონტროლირებადი აუდიტი - შეინარჩუნეთ ეს განსხვავება ნათელი.
რა უნდა გააკეთონ მშენებლებმა Opus 5.5-ის კოდირების დაფების ნახვის შემდეგ?
გაუშვით თქვენი საკუთარი სამამოცანიანი გამოცდა: ერთი ინტერფეისის აწყობა, ერთი მრავალფაილური რეფაქტორი და ერთი ხანგრძლივი აგენტის სესია. ჟურნალის ტოკენები და კედლის საათი არა მხოლოდ „მუშაობდა თუ არა“. Arena.ai-სა და Artificial Analysis-ს საჯარო თერმომეტრებად მოეპყარით, შეინარჩუნეთ უფრო იაფი ნაგულისხმევი მნიშვნელობა დიდი მოცულობის სამუშაოებისთვის და უყურეთ, თუ როგორ ცვლიან 5.5 ვერსიაზე უკვე არსებული პლატფორმები არსებულ სამუშაო პროცესებს ყველაფრის გადაწერამდე. უგულებელყავით „საბოლოოდ საუკეთესო“ ვერსიები და რამდენიმე გამოშვების ციკლის შემდეგ ხელახლა გადახედეთ - გვირგვინები ბრუნავს; შესაძლებლობების საზღვარი იზრდება.
როგორ შევასრულო სამამოცანიანი სამართლიანი გამოცდა კოდირების ნაგულისხმევ პარამეტრის შეცვლამდე?
გაყინეთ სამი ინსტრუქცია - პატარა ინტერაქტიული WebDev ინტერფეისი, ტესტებით მრავალფაილური რეფაქტორი და გრძელი აგენტის სტილის სესია - შემდეგ შეაფასეთ დავალება, ძალისხმევა, ტოკენები, კედლის საათი, სუფთად გაშვება?, გაერთიანება? და შენიშვნები. შეადარეთ თქვენს წინა ნაგულისხმევ პარამეტრებს იმავე ინსტრუქციაზე; მაქსიმალური ძალისხმევა გამოიყენეთ მხოლოდ მაშინ, როდესაც წარუმატებლობა ძვირი ჯდება. საჯარო დაფის ნომრები მონიშნეთ თერმომეტრებად და არა მიღების კრიტერიუმებად. გადაწყვიტეთ ნაგულისხმევი პარამეტრი გამოცდის შემდეგ და არა პირველი ლამაზი localhost დემო ვერსიის შემდეგ - და შეინარჩუნეთ უფრო იაფი მოდელი თბილი მოცულობითი სამუშაოებისთვის.
ცნობები
- ანთროპული — anthropic.com
- კლოდ პლატფორმა — platform.claude.com
- Arena.ai — კოდ არენა — arena.ai
- ხელოვნური ანალიზი — კოდირების აგენტის ინდექსი — artificialanalysis.ai