ხელოვნური ინტელექტის სიახლეები, 2026 წლის 6 ოქტომბერი

ხელოვნური ინტელექტის სიახლეების მიმოხილვა და ვიქტორინა: 2026 წლის 6 ოქტომბერი

OpenAI ხელოვნური ინტელექტის მიერ დაწერილ ასობით მათემატიკურ მტკიცებულებას ტოვებს და ცდას ტოვებს

OpenAI-მა ახლახან გამოუქვეყნებელი Frontier მოდელიდან GitHub-ის საცავში 372 მათემატიკური შედეგი გადაიტანა. The Verge 372 შედეგის ოჯახში 722 ხელნაწერს ითვლის. ბევრი მტკიცებულება უკვე შემოწმებულია Lean-ში, ამიტომ ლოგიკა ალბათ კარგია, მაშინაც კი, თუ სიახლე ჯერ კიდევ დასაზუსტებელია.

კომპანია აცხადებს, რომ ოთხგანზომილებიან კაკეიას ჰიპოთეზაში მიღწეულ წარმატებებს, ძირითად ალგორითმებში ცვლილებებს და რიმანის ჰიპოთეზის მიმართულებით „რეალურ პროგრესსაც“ კი აღწევს. წარმომადგენელმა Scientific American-ს განუცხადა, რომ თითქმის ყველა შედეგი ერთი მოთხოვნიდან ერთ აგენტამდე მოდიოდა და არა მრავალმილიონიანი, 10,000 აგენტისგან შემდგარი გუნდიდან, რომელმაც ნავიერ-სტოუკსის ჰიპოთეზა ადრე გატეხა. საშუალო ღირებულება: ChatGPT Pro-ზე ფიქრის დაახლოებით სამი საათი.

მათემატიკოსები ყველა არ არიან გულშემატკივრები. MIT-ის წარმომადგენელმა ენდრიუ საზერლენდმა ძირითადად თქვა: აჩვენეთ მოდელი ან ჩათვალეთ ერთჯერადი ისტორია დაუდასტურებლად. OpenAI-ის საკუთარ საკონსულტაციო ჯგუფს სურდა მოთხოვნები, მოდელების სახელები და გამოთვლითი ქვითრები. OpenAI-მ ამის ნაცვლად გამოაქვეყნა საშუალოები და Lean ფორმალიზაციები. „ჩვენ დავტოვეთ მტკიცებულებები, გთხოვთ, დაიჯესტოთ“ თამამი კვლევითი სტრატეგიაა.

„მისტრალი“ წარმოგიდგენთ Large 4-ს, 1 ტრილიონი პარამეტრის მქონე „Le Chonk“-ს, რომელიც ღია წონაში უზენაესობისკენ არის მიმართული

ფრანგულმა ლაბორატორიამ „მისტრალმა“ გახსნა „მისტრალ ლარჯ 4“-ის - არაოფიციალურად ML4-ის, „ძალიან ოფიციალურად: ლე ჩოკ“-ის - საჯარო წინასწარი ჩვენება. ეს არის ბუნებრივად მულტიმოდალური ნარევი 1 ტრილიონი საერთო პარამეტრით და 49 მილიარდი აქტიური პარამეტრით. წონა დაპირებულია თვის ბოლომდე, პარტნიორებთან და მთავრობებთან წითელი თანამშრომლობის შემდეგ.

ტრენინგი Mistral-ის საკუთარ ევროპულ მონაცემთა ცენტრებში განთავსებულ 3,800 NVIDIA Grace Blackwell გრაფიკულ დაფაზე მიმდინარეობდა. მთავარი თემა სუვერენიტეტი პლუს „ნაკლები ძალისხმევა“ იყო: კიბერუსაფრთხოება, ფინანსები, სამართალი, ჩიპების დიზაინი. Artificial Analysis-ის ერთ-ერთ კიბერტესტზე, რომელიც მოდელს რეალური დაუცველობის რეპროდუცირებასა და გამოსწორებას სთხოვს, Mistral-ის თქმით, ML4-მა 82% მიიღო - ყველაზე მაღალი მაჩვენებელი ნებისმიერ მოდელს შორის - მაშინ როცა ზოგიერთი დახურული გიგანტი უარს ამბობს და ნულთან ახლოს მყოფ ქულას იღებს.

ასე რომ, ევროპას კვლავ სურს მესამე გზის პოვნა დახურულ ამერიკულ ლაბორატორიებსა და ჩინურ ღია წონებს შორის. სხვა საკითხია, გაგრძელდება თუ არა ეს. თავად მეტსახელი იმაზე მეტყველებს, რომ მათ იციან, თუ რამდენად აბსურდულად გამოიყურება პარამეტრების რბოლა გარედან.

კლოდი Google Docs-ში, Sheets-სა და Slides-ში გადადის, როგორც პირველი მხარის გვერდითი პანელი

Anthropic-ის Claude for Google Workspace ფასიან გეგმებზე საჯარო ბეტა ვერსიაშია. დააინსტალირეთ Marketplace-ის დამატება, გახსენით ფაილი და Claude განთავსდება გვერდითა პანელში, რომელსაც შეუძლია დოკუმენტის წაკითხვა და მისი რედაქტირება. ახალი კონექტორები ასევე საშუალებას გაძლევთ შექმნათ და შეცვალოთ Google ფაილები თავად Claude-ის ჩატიდან.

Docs-ში მას შეუძლია წინადადების გამოსწორება ფორმატირების დარღვევის გარეშე, ან უფრო დიდი გადაწერების შეთავაზება შემოთავაზების ბარათებად. Sheets იღებს ფორმულებს, პივოტებს, დიაგრამებს და ჩახლართული შეერთებებისთვის Python-ის შემოვლით გზასაც კი. სლაიდებს შეუძლიათ თქვენი არსებული თემიდან ახალი სლაიდების შექმნა და შემდეგ გადაფარვისას არასასურველი ფაილების მონიშვნა. ნაგულისხმევი რეჟიმი რედაქტირებამდე ითხოვს ინფორმაციას. თუ სახიფათოდ ცხოვრება გიყვართ, არსებობს „ყველას მიღების“ რეჟიმი.

Gemini უკვე აქ ცხოვრობს და Microsoft Copilot-ი Office ვერსიას ამუშავებს - ზოგჯერ ანთროპულ მოდელებზე, რაც სახალისო პატარა წინააღმდეგობაა. კლოდი ახლა ორივე ეკოსისტემაში ხელოვნური ინტელექტის ფენას ცდილობს იყოს. შეიძლება ეს პროდუქტის სტრატეგია იყოს, ან უბრალოდ მხარის არჩევაზე უარის თქმა. ალბათ ორივე.

მეტამ და სიერამ შეიმუშავეს პირადი აგენტის პროტოკოლი, რათა მაღაზიებმა შეძლონ კარგი ბოტების ცუდისგან გარჩევა

Sierra და Meta, Genesys-თან, Instinct-თან, Rocket-თან, Shopify-თან, Stripe-თან და Walmart-თან ერთად, ქმნიან ღია სტანდარტს იმის შესახებ, თუ როგორ ურთიერთობენ პირადი ხელოვნური ინტელექტის აგენტები ბიზნესებთან. მომხმარებლები ირჩევენ, რაზე წვდომა ექნებათ მათ აგენტებს. კომპანიები ადგენენ, რა შეუძლიათ გააკეთონ აგენტებმა ვებსაიტებზე, API-ებზე ან კომპანიის აგენტის მეშვეობით. სესიები OAuth-ზეა დაფუძნებული.

v0.1 სპეციფიკაცია და საცნობარო იმპლემენტაცია ამ თვის ბოლოს გამოქვეყნდება. ბრეტ ტეილორის ფორმულირება პირდაპირია: სანამ მსგავსი რამ არ იარსებებს, ქაოსია. Amazon-მა დაბლოკა Meta's Muse. Walmart-ი Muse-თან პარტნიორობს და CAPTCHA-ს აგენტებს კვლავ აცილებს. ავიაკომპანიები და სხვები უფრო მკაცრ ხაზებს ადგენენ.

OpenAI და Anthropic ჯერ არ არიან ამ პროექტში. ტეილორი ამბობს, რომ ძალიან იმედგაცრუებული იქნება, თუ კონკურენტები ამას გამოტოვებენ. სტანდარტების გამოშვებაზე გულწრფელია. ასევე ცოტა უხერხულია, როდესაც OpenAI-ის თავმჯდომარე პროტოკოლის თანაავტორია.

OpenAI-ის გადაწყვეტილებების API საჯარო ბეტა ვერსიაში გადის სწრაფი „კი“-ან „არა“-ს სტილის პასუხებისთვის

OpenAI-მ Decisions API საჯარო ბეტა ვერსიაში gpt-6-luna-ზე POST /v1/decisions-ის საშუალებით განათავსა. მასში ტექსტის, სურათების ან ორივეს დამატება დაგეხმარებათ აკრეფილი პასუხების მიღებაში დაახლოებით 10-ჯერ უფრო სწრაფად, ვიდრე Responses API-ში - ალბათობა, პირობის სიმართლის დადგენა, თქვენი სიიდან არჩევანი ან ქულა დალაგებული დონეების მიხედვით.

წარმოიდგინეთ „ორჯერ გადახდილი“ საჩივრის გადამისამართება ანგარიშსწორებაზე ან პროდუქტის ფოტოს კრეკის სახით მონიშვნა. სურათები უნდა იყოს ჩასმული base64-ში. ფასი შეადგენს $0.10-ს მილიონ შეყვანის ტოკენზე, ამ საბოლოო წერტილზე გამომავალი ტოკენის გადასახადის გარეშე. შესაბამისი მომხმარებლებისთვის არსებობს ნულოვანი მონაცემთა შენახვისა და HIPAA-ს გზები.

ის DevDay-ზე შეზღუდული წინასწარი ჩვენებით გამოჩნდა და ახლა უკვე ღიაა. GA „მომავალ კვირებში“ იქნება. ეს არის ის, რაც არასექსუალურ სანტექნიკურ პროდუქტებს სჭირდებათ - კლასიფიკატორები ყოველ ჯერზე რომანის დაწერის გარეშე.

Google DeepMind-ის EmbeddingGemma 2 ტექსტს, სურათებს, აუდიოს და ვიდეოს ერთ მოწყობილობაზე დამონტაჟებულ ვექტორულ სივრცეში აერთიანებს

EmbeddingGemma 2 არის 740 მილიონი პარამეტრის მქონე Apache 2.0 მოდელი, რომელიც ტექსტს, კოდს, სურათებს, ვიდეოს და აუდიოს 768 განზომილებიან საერთო სივრცეში ათავსებს. აგებულია Gemma 4-ზე. განკუთვნილია ტელეფონებისა და სხვა მკვრივი აპარატურისთვის და არა კიდევ ერთი გიგანტური, მხოლოდ ღრუბლოვანი ჩამნერგავისთვის.

ჩატვირთეთ მხოლოდ ის, რაც გჭირდებათ: 270 მბ ტექსტისთვის, დაამატეთ ვიზუალური ან აუდიო, ან აიღეთ მთელი დასტა. „მატრიოშკას“ შეკვეცას შეუძლია ვექტორების 128 განზომილებამდე შემცირება, რაც 6-ჯერ ნაკლებ მეხსიერებას უზრუნველყოფს. კონტექსტი 8 ათასი ტოკენია - საკმარისია დაახლოებით 5.5 წუთიანი აუდიოსთვის ან ათობით კადრისთვის. Google-ის თქმით, MTEB კოდი თითქმის 10 პუნქტით გაიზარდა პირველ EmbeddingGemma-სთან შედარებით.

კვანტიზაციის მქონე Pixel 11 Pro-ზე, მხოლოდ ტექსტის შემცველ მოდელებს დაახლოებით 191 მბ აქტიური ოპერატიული მეხსიერება სჭირდება; სრული მულტიმოდალური - დაახლოებით 567 მბ. ორიგინალი ტექსტური მოდელი უკვე 20 მილიონ ჩამოტვირთვას აჭარბებს. Google-ის უფრო ჩუმი გამოშვებები ზოგჯერ უფრო მნიშვნელოვანია, ვიდრე თვალშისაცემი.

სამხრეთ კორეის მეცნიერების მინისტრი Mythos-ის შემდეგ 3.5 მილიარდი დოლარის ღირებულების ხელოვნური ინტელექტის პროექტს აორმაგებს

საპარლამენტო აუდიტის დროს, ვიცე-პრემიერმა ბე კიუნგ-ჰუნმა განაცხადა, რომ სეული შეინარჩუნებს სუვერენული ფონდის მოდელის პროექტს და დაამატებს ცალკე სასაზღვრო ხელოვნური ინტელექტის პროგრამას. მან 4.7 ტრილიონი ვონის (3.5 მილიარდი დოლარის) ოდენობის ინვესტიცია დაუკავშირა Anthropic-ის კლოდ მითოსის გარშემო არსებულ „მითოსის შოკს“ და კიბერუსაფრთხოების საფრთხეებს.

სუვერენულმა ძალისხმევამ მეორე შეფასებაც გაიარა და მესამეში გადადის. ბეიმ მიმდინარე შედეგები გლობალურად საშუალო დიაპაზონში შეაფასა და სურს, რომ რაიმე უფრო ახლოს იყოს წამყვან ღია წონის სისტემებთან. მან ასევე წარმოადგინა „ხელოვნური ინტელექტი ყველასთვის“ სერვისი - უფასო, გამოყენების შეზღუდვების გარეშე - წლის ბოლომდე, პლუს მეგაპროექტები მონაცემთა ცენტრებზე, ფიზიკურ ხელოვნურ ინტელექტსა და ჩიპებზე.

ასე რომ, საქმე არ არის „სახლის მოდელის გაუქმება“. საქმე ეხება „მის გვერდით უფრო დიდი, საშიში ტრასის დამატებას“. ხელოვნური ინტელექტის ეროვნული რბოლები სულ უფრო ძვირი ხდება. საკმარისია თუ არა 3.5 მილიარდი დოლარი აშშ-სა და ჩინეთის მასშტაბებთან შედარებით, ჯერ კიდევ გაურკვეველია. როგორც ჩანს, ბეი ფიქრობს, რომ უძრავად ჯდომა უარესია.

ხშირად დასმული კითხვები

რა ჩააგდო OpenAI-მა GitHub-ში თავისი გამოუქვეყნებელი საფრონტიორო მათემატიკის მოდელით?

OpenAI-მ გამოაქვეყნა 372 მათემატიკური შედეგის ოჯახი - დაახლოებით 722 ხელნაწერი - გამოუქვეყნებელი სასაზღვრო მოდელიდან. ბევრი მტკიცებულება უკვე შემოწმებულია Lean-ში. კომპანია აცხადებს, რომ პროგრესი მიღწეულია ოთხგანზომილებიან კაკეიას ჰიპოთეზაზე, ალგორითმის კორექტირებასა და რიმანის ჰიპოთეზისკენ მუშაობაზე. წარმომადგენელმა განაცხადა, რომ თითქმის ყველა შედეგი მომდინარეობს ერთი მოთხოვნიდან ერთ აგენტზე, რაც საშუალოდ დაახლოებით სამ საათს შეადგენს ChatGPT Pro-ზე ფიქრისას - ეს არ არის მრავალაგენტიანი უზარმაზარი ჯგუფი.

რატომ არიან მათემატიკოსები სკეპტიკურად განწყობილნი OpenAI-ის ერთჯერადი მათემატიკური მტკიცებულებების ისტორიის მიმართ?

MIT-ის პროფესორმა ენდრიუ საზერლენდმა OpenAI-ს მოუწოდა, მოდელი ეჩვენებინა ან ერთჯერადი მტკიცება დაუდასტურებლად მიეჩნია. OpenAI-ის საკონსულტაციო ჯგუფს სურდა მოთხოვნები, მოდელების სახელები და გამოთვლითი ქვითრები. ამის ნაცვლად, კომპანიამ გამოაქვეყნა საშუალო მაჩვენებლები და Lean-ის ზოგიერთი ფორმალიზება. შესაძლოა, მტკიცებულებები ფორმალურად დადასტურდეს, მაგრამ სიახლე და ერთი აგენტის ნარატივი სადავო რჩება მანამ, სანამ უფრო სრული მტკიცებულებები არ გამოჩნდება.

რა არის Mistral Large 4 და როდის ჩამოდის საწონები?

Mistral Large 4 - ასევე ცნობილი როგორც ML4 ან „Le Chonk“ - წარმოადგენს ექსპერტთა მულტიმოდალურ ნაზავს, 1 ტრილიონი პარამეტრით და 49 მილიარდი აქტიური პარამეტრით. ის Mistral-ის ევროპულ მონაცემთა ცენტრებში 3,800 NVIDIA Grace Blackwell გრაფიკულ პროცესორზე იყო გაწვრთნილი. საჯაროდ გამოქვეყნდა; სრული წონები თვის ბოლომდე იქნება ცნობილი პარტნიორებთან და მთავრობებთან შეთანხმების შემდეგ. Mistral-მა წარმოადგინა გამოყენების შემთხვევები კიბერუსაფრთხოების, ფინანსების, სამართლისა და ჩიპების დიზაინის სფეროებში.

როგორ მუშაობს კლოდი Google Docs-ში, Sheets-სა და Slides-ში?

Claude for Google Workspace ფასიან გეგმებზე Marketplace-ის დანამატის მეშვეობით საჯარო ბეტა ვერსიაშია. ის გვერდითა ზოლშია განთავსებული, რომელსაც შეუძლია ფაილის წაკითხვა და რედაქტირება, ან Google ფაილების შექმნა და მორგება Claude-ის ჩატიდან. Docs-ში მას შეუძლია წინადადებების გამოსწორება ან შემოთავაზებების ბარათების გადატანა; Sheets იღებს ფორმულებს, პივოტებს, დიაგრამებს და Python-ის დამატებით ვარიანტს; Slides-ს შეუძლია თქვენი თემიდან სლაიდების შექმნა. ნაგულისხმევი რეჟიმი რედაქტირებამდე ითხოვს ინფორმაციას; „ყველას მიღების“ რეჟიმი გამოტოვებს მოთხოვნებს.

რა პრობლემის გადაჭრას ცდილობს Meta-სა და Sierra-ს პირადი აგენტის პროტოკოლი?

პერსონალური ხელოვნური ინტელექტის აგენტები ხშირად აწყდებიან CAPTCHA-ს ან პირდაპირ ბლოკებს ბიზნეს API-ებზე შოპინგის ან დარეკვის დროს. Sierra და Meta, ისეთ პარტნიორებთან ერთად, როგორიცაა Genesys, Shopify, Stripe და Walmart, მუშაობენ ღია სტანდარტის შემუშავებაზე, რათა მომხმარებლებმა გააკონტროლონ აგენტებზე წვდომა და კომპანიებმა დააწესონ დაშვებული მოქმედებები OAuth-ის საშუალებით. v0.1 სპეციფიკაცია და საცნობარო იმპლემენტაცია ამ თვის ბოლოს იგეგმება. OpenAI და Anthropic ჯერ არ არიან მზად.

როდის უნდა გამოვიყენოთ OpenAI-ის გადაწყვეტილებების API პასუხების API-ს ნაცვლად?

გამოიყენეთ Decisions API, როდესაც გჭირდებათ სწრაფად აკრეფილი „კი“ ან „არა“ სტილის პასუხი - ალბათობა, პირობა მართალია, არჩევანი სიიდან ან ქულა დალაგებულ დონეებზე. ის მუშაობს gpt-6-luna-ზე POST /v1/decisions-ის საშუალებით, იღებს ტექსტს და ჩასმულ base64 სურათებს და დაახლოებით 10-ჯერ უფრო სწრაფია, ვიდრე Responses API. ფასი შეადგენს $0.10 მილიონ შეყვანის ტოკენზე, გამომავალი ტოკენის საფასურის გარეშე. შესაბამისი მომხმარებლებისთვის არსებობს ნულოვანი მონაცემთა შენახვა და HIPAA ბილიკები; GA მოსალოდნელია მომდევნო კვირებში.

რით არის Google DeepMind-ის EmbeddingGemma 2 სასარგებლო ტელეფონებისთვის?

EmbeddingGemma 2 არის 740 მილიონი პარამეტრის მქონე Apache 2.0 მოდელი, რომელიც ტექსტს, კოდს, სურათებს, ვიდეოს და აუდიოს ერთ 768 განზომილებიან სივრცეში აერთიანებს. შეგიძლიათ მხოლოდ ტექსტის (270 მბ) ჩატვირთვა, ვიზუალური ინფორმაციის ან აუდიოს დამატება, ან მთელი სტეკის აღება. Matryoshka-ს შეკვეცას შეუძლია ვექტორების 128 განზომილებამდე შემცირება, რაც 6-ჯერ ნაკლებ მეხსიერებას უზრუნველყოფს. კვანტიზებულ Pixel 11 Pro-ზე მხოლოდ ტექსტს დაახლოებით 191 მბ აქტიური ოპერატიული მეხსიერება სჭირდება, ხოლო სრულ მულტიმოდალურ მეხსიერებას დაახლოებით 567 მბ, 8 ათასი ჟეტონის კონტექსტით.

ვიქტორინა
1. როგორ თქვა OpenAI-მა, რომ მისი ახლად გამოქვეყნებული მათემატიკის შედეგების უმეტესობა წარმოებული იყო?

2. რა არის Mistral Large 4 ("Le Chonk") და როდის არის მოსალოდნელი წონების აწევა?

3. როგორ არედაქტირებს Claude for Google Workspace Docs-ს ნაგულისხმევად?

4. რისთვის არის შექმნილი OpenAI-ის გადაწყვეტილებების API?

5. რას ათავსებს Google DeepMind-ის EmbeddingGemma 2 ერთ საერთო ვექტორულ სივრცეში?


ბლოგზე დაბრუნება