ServiceNow-ს AutoSynthData აგენტის წარუმატებლობებს ტრენინგის ოქროდ აქცევს

ServiceNow-ს AutoSynthData აგენტის წარუმატებლობებს ტრენინგის ოქროდ აქცევს

მოკლე პასუხი: ServiceNow CoreAI-ის AutoSynthData აგენტის წარუმატებლობებსა და მასწავლებლის წარმატებებს გადააქცევს დადასტურებულ სინთეზურ SFT ამოცანებად, როდესაც საწარმოებს სჭირდებათ გარემოს კომპეტენცია და არა მხოლოდ ფართო საორიენტაციო ქულები. ის ასუფთავებს შესაძლებლობების სპეციფიკაციის ბარათებში არსებულ ხარვეზებს, ამრავლებს დამოწმებად სამუშაოს და შემდეგ არეგულირებს ხარისხს დახვეწამდე. ავტორის მიერ მოხსენებული EnterpriseOps-ის სპორტული დარბაზის აწევები ძალაშია, თუ მასწავლებლის ძალა, დამადასტურებელი ხარისხი და გარემოს სიზუსტე ემთხვევა ერთმანეთს.

ძირითადი დასკვნები:

შესაძლებლობების ბარათები: ხარვეზების შესახებ ინფორმაცია ბარათებზე შეინახეთ, რათა გენერატორებმა ვერასდროს ნახონ ორიგინალი ID-ები.

ვერიფიკატორის აუდიტირებადობა: უპირატესობა მიანიჭეთ SQL-ის საბოლოო მდგომარეობის შემოწმებებს, რომლებიც უარყოფენ მუტაციურ არასწორ შედეგებს.

სირთულის ჯგუფი: მასწავლებელს მხოლოდ ისეთი დავალებები აქვს, რომლებსაც სამიზნე იშვიათად წყვეტს და მასწავლებელი, როგორც წესი, წარმატებით ასრულებს.

ადამიანური მიმოხილვა: გადამზადებამდე გააგრძელეთ ადამიანური მიმოხილვა მაღალი რისკის შემცველი პოლიტიკისა და შეუქცევადი ქმედებების შესახებ.

მოძრავი ფრონტი: SFT-ის შემდეგ, ხელახლა შეაფასეთ და სამიზნე ფაზა დარჩენილი ხარვეზებისკენ გადაიტანეთ.

საწარმოს ხელოვნური ინტელექტის აგენტები იშვიათად ცდებიან ზოგადი ცოდნის ნაკლებობის გამო. ისინი ცდებიან, რადგან გარემო სპეციფიკურია: ბილეთების პოლიტიკა, სქემის თავისებურებები, ინსტრუმენტების კონტრაქტები, დათესილი მონაცემთა ბაზები, ცოდნის სტატიები და სისტემებს შორის სამუშაო პროცესები, რომლებიც არ ჰგავს სახელმძღვანელოების დემო ვერსიებს. მოდელი, რომელიც კარგად აფასებს ღია ტესტებს, შეიძლება მაინც შეფერხდეს, როდესაც შემდეგ ეტაპზე აუცილებელია ცვლილების ფანჯრის, CMDB ურთიერთობის ან ვერიფიკატორის დაცვა, რომელიც ამოწმებს საბოლოო მდგომარეობას და არა თავისუფლად ჩატის.

ServiceNow CoreAI / ServiceNow-AI-მ გამოაქვეყნა AutoSynthData , რათა პირდაპირ აღმოეფხვრა ეს ხარვეზი. დასახელებული ავტორი ესაკიველ ესაკირაჯა აღწერს მილსადენს, რომელიც სამიზნე აგენტის წარუმატებლობებს - უფრო ძლიერი მასწავლებლის წარმატებებთან ერთად - გარდაქმნის საწარმოს გარემოზე მორგებულ დადასტურებულ სინთეზურ სასწავლო ამოცანებად. საქმე არ არის მეტი ჩატის ჟურნალის შეგროვება. საქმე არის რთული, დამოწმებადი სამუშაოს გამრავლება, რომელიც იყენებს იმავე შესაძლებლობებს ახალ პირობებში, რათა ზედამხედველობით დახვეწილმა რეგულირებამ შეძლოს გარემოსთვის სპეციფიკური ხარვეზების აღმოფხვრა.

სტატიაში განხილულია ძირითადი იდეა, დავალების აბსტრაქცია, გენერირებისა და ხარისხის კონტროლის ციკლი, საერთო არქიტექტურა და ავტორის მიერ მოხსენებული შედეგები EnterpriseOps Gym-ზე ჰიბრიდულ და ITSM გარემოში. იგი რჩება იმ დასკვნამდე, რასაც კვლევა აღწერს: სინთეზური ამოცანების მოძრავი სასწავლო გეგმა და არა იმის მტკიცება, რომ ნებისმიერი საწარმო მოულოდნელად წყდება.

რატომ აჭარბებს გარემოსდაცვითი კომპეტენცია ფართო შესაძლებლობებს

საწარმოებს სჭირდებათ აგენტები, რომლებიც მუშაობენ მათ გარემოში - მათ სისტემებში, წესებსა და მონაცემთა მდგომარეობაში. ფართო შესაძლებლობები არ არის იგივე, რაც გარემოს კომპეტენცია. აგენტმა შეიძლება იცოდეს, როგორ მუშაობს IT სერვისის მენეჯმენტი ჩვეულებრივ და მაინც ვერ შეამჩნიოს ადგილობრივი პოლიტიკა, რომელიც კრძალავს გარკვეულ გადასვლებს, ან ინსტრუმენტი, რომელიც აახლებს დაკავშირებულ ცხრილს მხოლოდ წინაპირობადი ჩანაწერის არსებობის შემდეგ.

ინდივიდუალური ჩავარდნები ინფორმაციულია, მაგრამ სასწავლო მონაცემებივით მწირია. ერთი გატეხილი ტრაექტორია სისუსტეზე მიუთითებს; ის არ იძლევა ათობით ახლომდებარე სიტუაციას, რომელიც მოდელს ვარიაციის პირობებში აღდგენის სწავლებას ასწავლის. გუნდებს სჭირდებათ მრავალი ახალი დავალება, რომლებიც იგივე შესაძლებლობებს განსხვავებულად გამოიყენებენ, გარემოში შესასრულებელი რჩებიან, რეალისტურად გამოიყურებიან მომხმარებლის მოთხოვნის შესაბამისად და შედეგების შემოწმების შემდეგ დამოწმებადები რჩებიან.

სწორედ ეს არის AutoSynthData-ს დიზაინის ზეწოლა. წარუმატებლობები შესაძლებლობების ბარათების სიგნალებად იქცევა. ბარათები ახალი დავალებების გენერატორებად იქცევა. უფრო ძლიერი მასწავლებელი წარმატებულ ტრაექტორიებს აჩვენებს. ფილტრები და ვერიფიკატორები წყვეტენ, თუ რა შედის ზედამხედველობის ქვეშ მყოფი დახვეწის ნაკრებში. ტრენინგის შემდეგ, შეფასება საზღვარს დარჩენილი ხარვეზებისკენ გადააქვს. ციკლი სასწავლო გეგმის ფორმისაა და არა ერთჯერადი მონაცემების დაგროვების.

ჩარჩოების შექმნა პრაქტიკოსებისთვის მნიშვნელოვანია. თუ მხოლოდ წარუმატებელ მოთხოვნებს ინახავთ, რისკავთ, რომ ზუსტად ამ ერთეულებსა და ფრაზებს გადააჭარბოთ. თუ მხოლოდ შეუზღუდავ სინთეზურ მოთხოვნებს წარმოქმნით, რისკავთ, რომ შეუძლებელ, არარეალურ ან დაუდასტურებელ დავალებებს შექმნით. AutoSynthData ამ უკიდურესობებს შორისაა: ჩავარდნილი მონაცემების დეზინფექცია შესაძლებლობების სპეციფიკაციაში შეიტანეთ, შემდეგ კი ისეთი დავალებების რეგენერაცია, რომლებიც მყარ ბირთვს ინარჩუნებენ ზედაპირის ფორმისა და კონტროლირებადი ზომების შეცვლის პარალელურად.

პრაქტიკული დავალების ფორმა: სისტემა, მოთხოვნა, დამადასტურებელი

აგენტური სამუშაოსთვის გამოსადეგი აბსტრაქციაა: დავალება უდრის სისტემის სპეციფიკაციას, მომხმარებლის მოთხოვნას და ვერიფიკატორს. თითოეულ ნაწილს აქვს შეზღუდვები, რომლებიც სინთეზურ მონაცემებს დასაბუთებულსა და სანდოს ხდის.

სისტემის სპეციფიკაცია მოიცავს შეზღუდვებს, პოლიტიკას და საწყის მდგომარეობას - მაგალითად, მონაცემთა ბაზის ნერგებს და ცოდნის სტატიებს. ის თავსებადი უნდა იყოს ხელმისაწვდომ ინსტრუმენტებთან და მდგომარეობასთან. თვითნებური სირთულის შეზღუდვები, რომლებიც უგულებელყოფენ ინსტრუმენტთა კონტრაქტებს ან ნერგების რეალიზმს, როგორც წესი, ქმნის მყიფე დავალებებს, რომლებიც არასწორ გაკვეთილს გვასწავლის.

მომხმარებლის მოთხოვნის ხარისხს სამი ლინზა აქვს. განხორციელებადობა კითხულობს, არსებობს თუ არა ვალიდური ტრაექტორია. რეალიზმი კითხულობს, დამაჯერებლად მოითხოვდა თუ არა მომხმარებელი ამას. სირთულე კითხულობს, ავლენს თუ არა დავალება მიმდინარე აგენტის სისუსტეს და არა ისეთ რამეს, რასაც სამიზნე უკვე საიმედოდ წყვეტს. მოთხოვნის არსი, რომელიც სამიზნისთვის უმნიშვნელოა, ტრენინგის ბიუჯეტს კარგავს; შეუძლებელი მოთხოვნა კი შეფასების ნდობას კარგავს.

ვერიფიკატორის ხარისხი დამოკიდებულია თანმიმდევრულობაზე, სიზუსტესა და სისრულეზე. ძალიან სუსტი და არასრული ტრაექტორიები წარმატებით სრულდება. ერთი ტრაექტორიის ძალიან შემზღუდველი ალტერნატიული გადაწყვეტილებები წარუმატებელია. საწარმოს პარამეტრები ხშირად უპირატესობას ანიჭებენ SQL-ზე ან მდგომარეობაზე დაფუძნებულ შედეგების შემოწმებას, რადგან ისინი აფასებენ სამყაროს აგენტის მოქმედების შემდეგ და არა აგენტის მიერ გავლილ ზუსტ ტოკენ გზას.

AutoSynthData ამ ტრიადას ეყრდნობა, ამიტომ გენერირებული სამუშაო უცვლელი რჩება. გენერატორები არ იგონებენ თავისუფლად მცურავ ვიქტორინებს. ისინი ქმნიან დავალებებს, რომელთა შესრულებაც შესაძლებელია ადაპტერის გარემოში და შეფასდეს ვერიფიკატორების მიერ, რომლებიც ზრუნავენ საბოლოო მდგომარეობის საჭირო თვისებებზე.

დიაგნოსტიკური შეფასებიდან შესაძლებლობების სპეციფიკაციის ბარათებამდე

პროცესი იწყება სამიზნე აგენტისა და გარემოში უფრო ძლიერი მასწავლებლის დიაგნოსტიკური შეფასებით. პარალელური გამეორებები ავლენს, თუ სად ცდება სამიზნე და სად აღწევს წარმატებას მასწავლებელი. ეს კონტრასტული შემთხვევები სასწავლო გეგმის დიზაინის ნედლეულს წარმოადგენს.

შემდეგ მოდის გასუფთავებული შესაძლებლობების სპეციფიკაციის ბარათებად დაყოფა . ბარათი ასახავს ტესტირების ქვეშ მყოფ შესაძლებლობებს, შესაბამის ინსტრუმენტებს ან სამუშაო პროცესის ფორმას, სადაც სამიზნე ვერ ხერხდება და მასწავლებელი წარმატებით ასრულებს, საჭირო საბოლოო მდგომარეობის თვისებებს და განზომილებებს, რომლებიც შეიძლება შეიცვალოს ახალი დავალებების გამოგონებისას. კრიტიკულად მნიშვნელოვანია, რომ გენერატორი არ იღებს ორიგინალურ მოთხოვნებს, ერთეულებს, ტრაექტორიებს ან დამადასტურებელ დეტალებს - მხოლოდ ბარათებს.

ეს სანიტარიზაცია განზრახ ანტი-ზედმეტად მორგებული ნაბიჯია. თუ გენერატორი დაინახავდა წარუმატებელი ბილეთების ზუსტ ნომრებს, ცოდნის სტატიის ID-ებს ან მასწავლებლის კვალს, მას გაუჩნდებოდა იგივე ეპიზოდის პერიფრაზირების ცდუნება. ბარათები აიძულებს აბსტრაქციას: ასწავლეთ შესაძლებლობა კონტროლირებადი ვარიაციით და არა დამახსოვრებული ინსტანციით.

ბარათების შექმნის შემდეგ, სისტემა მათგან ახალ დავალებებს წარმოქმნის. შემდეგ მასწავლებელი ზედამხედველობის ქვეშ დახვეწილი რეგულირებისთვის წარმატებულ ტრაექტორიებს აჩვენებს. ეს დემონსტრაციები თავისუფალი ფორმის რჩევები არ არის; ისინი გარემოზე დაფუძნებული წარმატებებია, რომლებიც იმავე ტიპის დადასტურებას გადიან, რაც სასწავლო გეგმას აინტერესებს.

ორფაზიანი სტრუქტურის მასშტაბირება. სამიზნე ფაზა ფოკუსირებულია ძირითადი შემოწმებული ნიმუშების გამოყენებაზე ხარვეზების გარშემო - ყველაზე მაღალი სიგნალის მქონე ამოცანები სუსტი აგენტის რღვევის მახლობლად. გამრავლების ფაზა ქმნის მიღებული სამიზნეების ახალ ვარიანტებს. გამრავლებული ნიმუშები ვერ ახერხებენ შემდგომი გამრავლების რაუნდების დათესვას, რაც ზღუდავს დრიფტს. ეს წესი მცირეა, მაგრამ მნიშვნელოვანია: შეუზღუდავი რეკურსიული ვარიაცია შეიძლება გადაუხვიოს ბარათზე დასახელებული შესაძლებლობიდან.

გაზიარებული კონტროლერი, გარემოს ადაპტერი და მოძრავი საზღვარი

არქიტექტურის თვალსაზრისით, AutoSynthData იყენებს საერთო კონტროლერს და გარემოს ადაპტერს. კონტროლერი ახორციელებს დიაგნოსტიკას, დამოწმებას, გენერირებას, მასწავლებლის დემო ვერსიებს, ხარისხის კარიბჭეებს და პაკეტურ მიმოხილვას. ადაპტერი აკავშირებს ამ ნაბიჯებს კონკრეტულ საწარმოს სავარჯიშო ბლოკთან - ინსტრუმენტებთან, მდგომარეობასთან, პოლიტიკასთან და ვერიფიკატორებთან - რათა ერთი და იგივე საკონტროლო ციკლი მიზნად ისახავდეს სხვადასხვა დომენს სასწავლო გეგმის ლოგიკის ნულიდან გადაწერის გარეშე.

ზედამხედველობითი დახვეწის შემდეგ, პროცესი ხელახლა ფასდება. შემდეგ სასწავლო გეგმა დარჩენილი ხარვეზებისკენ გადაინაცვლებს: მოძრავი საზღვარი და არა სტატიკური მონაცემთა ნაკრები. ნაშრომში აღწერილი ექსპერიმენტები ზედამხედველობით დახვეწილ რეგულირებაზეა ორიენტირებული. იგივე ციკლი შეიძლება მოგვიანებით გაძლიერებული სწავლების მხარდაჭერას უწევდეს; ეს მიმართულება აღნიშნულია, როგორც დაგეგმილი და არა დასრულებული.

საწარმო გუნდებისთვის არქიტექტურული გაკვეთილი მოდულურია. კონტროლერებმა არ უნდა დააკოდირონ ერთი ბილეთის სქემა. ადაპტერებმა უნდა აჩვენონ საკმარისი მდგომარეობისა და ინსტრუმენტის სიზუსტე, რათა ვერიფიკატორებმა შეძლონ აზრის გამოხატვა. სასწავლო გეგმამ შეფასების შედეგები უნდა განიხილოს, როგორც შემდეგი შემავალი მონაცემი და არა როგორც ერთჯერადი ქულების დაფა.

EnterpriseOps Gym არის გარემო, სადაც ეს მიდგომა იქნა ილუსტრირებული. ეს არის მასშტაბური საწარმოს აგენტების სამუშაო მაგიდა, რომელიც მოიცავს დაახლოებით 1150 ექსპერტის მიერ შემუშავებულ დავალებას 8 დომენში, დაახლოებით 512 ინსტრუმენტს, დაახლოებით 164 მონაცემთა ბაზის ცხრილს, კონტეინერიზებულ შესრულებას, SQL-ზე დაფუძნებულ შედეგების ვერიფიკაციას, პოლიტიკაზე მართულ ოპერაციებს, ჰიბრიდულ დომენებს შორის სცენარებს, შეუძლებლობისა და უარყოფის ტესტირებას და გრძელ ჰორიზონტალურ მდგომარეობაზე ორიენტირებულ ტრაექტორიებს. AutoSynthData არ არის წარმოდგენილი, როგორც ამ სავარჯიშო დარბაზის გამომგონებელი; სავარჯიშო დარბაზი არის სინთეზის ციკლის სტრესის ტესტირების პლატფორმა.

ნიმუშის დონის ხარისხის კონტროლი, რომელიც სინთეზურ ამოცანებს სანდოდ აქცევს

გენერირება გეიტების გარეშე არის ის, თუ როგორ ხდება სინთეზური აგენტის მონაცემების შეცდომები. AutoSynthData აღწერს ნიმუშის დონის ხარისხის კონტროლს რამდენიმე დამატებითი შემოწმებით.

ამოხსნის სირთულის ფილტრი ნაკრებს მიმართავს ისეთი ამოცანებისკენ, რომლებიც რთულია სამი ცდიდან მასწავლებლისთვის კი ამოხსნადი. აღწერილი კონფიგურაცია უპირატესობას ანიჭებს ამოცანებს, რომლებსაც სამიზნე წყვეტს მაქსიმუმ სამიდან ერთ ცდაში, მაშინ როცა მასწავლებელი წარმატებით ასრულებს სამიდან სულ მცირე ორს. ეს არის დიაპაზონი, სადაც ზედამხედველობით დემონსტრაციებს შეუძლიათ ასწავლონ ის, რაც სუსტ მოდელს უკვე არ გააჩნია.

დადებითი ვერიფიკაცია მოითხოვს, რომ საცნობარო ტრაექტორიამ ვერიფიკატორი გაიაროს. უარყოფითი ვერიფიკაცია მოითხოვს, რომ მუტირებული არასწორი შედეგები ვერ დასრულდეს. ისინი ერთად ამოწმებენ როგორც მიღების, ასევე უარყოფის მხარეს. თუ მხოლოდ დადებითი შედეგებია შემოწმებული, ნებადართულ ვერიფიკატორს შეუძლია ნაგვის დაშვება. თუ მხოლოდ უარყოფითი შედეგებია შემოწმებული, ზედმეტად მკაცრ ვერიფიკატორს შეუძლია უარყოს ვალიდური სამუშაო.

კრიტიკისა და შეკეთების ციკლი, ხელახალი ცდის ლიმიტით, ცდილობს გამოასწოროს ის ამოცანები, რომლებიც ვერ ახერხებენ კარიბჭეების მუშაობას, იმის ნაცვლად, რომ დაუყოვნებლივ გააუქმოს ყველა თითქმის გაცდენილი შეცდომა. ხელახალი ცდის ლიმიტები მნიშვნელოვანია: დაუსრულებელმა შეკეთებამ შეიძლება გამოიგონოს სულ უფრო ხელოვნური შეზღუდვები მხოლოდ საკონტროლო სიის დასაძლევად.

შემდეგ, პაკეტური დონის მეტა-მიმოხილვა იკვლევს მთელ კომპლექტს დაფარვის, მრავალფეროვნების, ზედმეტობისა და წარუმატებელი სამიზნეების აღმოსაჩენად. ნიმუშის კარიბჭეები ინარჩუნებს ინდივიდუალური ელემენტების სიზუსტეს; პაკეტური მიმოხილვა ხელს უშლის სასწავლო გეგმის დაჯგუფებას ერთი ვიწრო წარუმატებლობის რეჟიმში ან თითქმის დუბლიკატების კლონირებას.

ეს კონტროლი ხსნის, თუ რატომ შეიძლება პროცესორმა საათობით შექმნას ათასობით ნიმუში მოცულობის შესაბამისობის შემცვლელად განხილვის გარეშე. სიჩქარე განსხვავდება დომენისა და მასწავლებლის ზომის მიხედვით, მაგრამ ხარისხის კონტროლის ისტორია თანმიმდევრულია: სირთულის დიაპაზონი, დადებითი და უარყოფითი ვერიფიკაცია, შეკეთება ლიმიტებით და შემდეგ მეტა-მიმოხილვა.

ნედლი ჩავარდნები vs ბარათები vs დადასტურებული SFT ნაკრებები

სასარგებლოა თითოეული არტეფაქტის სასარგებლო თვისებების შედარება. დიაგნოსტიკურია ჩავარდნის ნედლი ჟურნალები. შესაძლებლობების ბარათები გენერაციული კონტრაქტებია. პრაქტიკაში ვარჯიშობთ დამოწმებული, ზედამხედველობითი დახვეწის ნაკრებებით.

არტეფაქტი რას შეიცავს სიძლიერე რისკი, თუ გამოიყენება იზოლირებულად
ნედლი წარუმატებლობის ჟურნალები მინიშნებები, მდგომარეობები, გატეხილი ტრაექტორიები, კონტრასტები მასწავლებლის წარმატებასთან ხაზს უსვამს რეალურ ხარვეზებს რეალურ გარემოში ძალიან ცოტა ნიმუში; ადვილია ერთეულებისა და ფრაზების ზედმეტად მორგება
შესაძლებლობების სპეციფიკაციის ბარათები შესაძლებლობები, ინსტრუმენტები ან სამუშაო პროცესი, წარუმატებლობის ან წარმატების კონტრასტი, საბოლოო მდგომარეობის საჭიროებები, ცვლადი ზომები გენერატორებისთვის გაწმენდილი აბსტრაქცია ორიგინალების გაჟონვის გარეშე ხარისხის კონტროლის გარეშე ბარათებმა მაინც შეიძლება შეუძლებელი ან უმნიშვნელო ამოცანების შესრულება შეძლონ
AutoSynthData-ს დადასტურებული SFT ნაკრები ახალი დავალებები პლუს მასწავლებლის დემონსტრაციები, რომლებმაც წარმატებით გადალახეს სირთულის, შემოწმებისა და განხილვის ტესტები მასშტაბირება რეალიზმის, მიზანშეწონილობისა და შედეგების შემოწმების გამოყენებით მაინც დამოკიდებულია მასწავლებლის სიძლიერეზე, ვერიფიკატორის ხარისხზე, გარემოს სიზუსტეზე

EnterpriseOps Gym-ზე ჰიბრიდულ და ITSM სნეპშოტებში, ავტორის მიერ მოხსენებულ გაშვებებში სამიზნედ გამოყენებული იყო Gemma-4-26B-A4B-it. Hybrid-მა ეს სამიზნე Qwen3.8-27B-სთან ერთად მასწავლებლად დააწყვილა და დაახლოებით 18 საათში დაახლოებით 2000 ჰიბრიდული ნიმუში, საუკეთესო საკონტროლო წერტილით მე-5 ეპოქაში. საშუალო Pass@1 გაიზარდა 7.2 პროცენტული პუნქტით - დაახლოებით 35 პროცენტით შედარებით - ვერიფიკატორის წარმატება 63.01 პროცენტიდან 68.55 პროცენტამდე გაიზარდა, რითაც შეამცირა Pass@1-ის ჩამორჩენა საცნობარო მოდელთან დაახლოებით 59 პროცენტი.

ITSM-მა იგივე სამიზნე DeepSeek-V4.1-Flash-თან ერთად მასწავლებელთან შეაწყვილა და დაახლოებით 66 საათში დაახლოებით 1994 ნიმუში, რაც ნაწილობრივ უფრო მეტი იყო უფრო დიდი მასწავლებლის გამო და იმის გამო, რომ ზოგიერთი პროცესორის ოპტიმიზაცია ჯერ არ იყო დანერგილი. Pass@1-ის საშუალო მაჩვენებელი 18.77 პროცენტიდან 27.18 პროცენტამდე გაიზარდა.

დომენი სამიზნე მასწავლებელი ნიმუშები და გაშვების დრო ავტორის მიერ მოხსენებული შედეგი
ჰიბრიდი Gemma-4-26B-A4B-it კვენი 3.8-27B ~2,000 ნიმუში ~18 საათში; საუკეთესო საკონტროლო წერტილის მე-5 ეპოქა საშუალო Pass@1 +7.2 pp (~35% ფარდობითი); ვერიფიკატორის წარმატება 63.01%-დან 68.55%-მდე; Pass@1-ის ~59%-იანი სხვაობა რეფერენსთან ამოიწურა
ITSM Gemma-4-26B-A4B-it DeepSeek-V4.1-Flash ~1,994 ნიმუში ~66 საათში საშუალო გამსვლელი @1 18.77%-დან 27.18%-მდე

ეს ციფრები წაიკითხეთ, როგორც კომპანიის კვლევის შედეგები ამ სპორტდარბაზზე ტესტირებული დომენებისთვის - არა როგორც დამოუკიდებელი მესამე მხარის რეპლიკაცია და არა როგორც უნივერსალური საწარმოს გარანტია. მოგება რეალურია იქ, სადაც მასწავლებლის სიძლიერე, ვერიფიკატორის ხარისხი და გარემოს ერთგულება ერთმანეთს ემთხვევა.

რა უნდა გადაიტანონ პრაქტიკოსებმა ციკლიდან

მაშინაც კი, თუ თქვენი სტეკი არ წარმოადგენს ServiceNow-ს კვლევით მილსადენს, ნიმუში გადადის. დაიწყეთ წარმოების მსგავსი სამიზნისა და უფრო ძლიერი მასწავლებლის წყვილური შეფასებით ერთგული „ქვიშის ყუთში“. კონტრასტული ხარვეზები გარდაქმენით შესაძლებლობების ბარათებად, რომლებიც აშორებენ იდენტიფიკატორებსა და ტრაექტორიებს. შექმენით დავალებები, რომლებიც ცვლის დაშვებულ ზომებს, ამავდროულად ინარჩუნებს საბოლოო მდგომარეობის საჭირო თვისებებს. სთხოვეთ მასწავლებელს წარმატებების დემონსტრირება. დააკონტროლეთ სირთულის ზოლები, დადებითი და უარყოფითი ვერიფიკაციით, შეზღუდული შეკეთებით და პარტიული მრავალფეროვნების მიმოხილვით. დახვეწეთ, ხელახლა შეაფასეთ და გადაწიეთ საზღვარი.

განსაკუთრებული ყურადღება მიაქციეთ ვერიფიკატორის დიზაინს. EnterpriseOps-ის Gym-ის სტილის SQL შედეგების შემოწმება და პოლიტიკაზე დაფუძნებული ოპერაციები აჩვენებს, თუ რატომ არის ჩატის რუბრიკები თავისთავად სუსტი მდგომარეობის შესასრულებლად. თუ თქვენს ვერიფიკატორს არ შეუძლია განასხვავოს მუტირებული არასწორი შედეგები სწორი საბოლოო შედეგებისგან, სინთეზური მასშტაბირება გააძლიერებს ხმაურს.

ასევე პატივი ეცით გამრავლების წესის სულისკვეთებას: მიღებული სამიზნეების ვარიანტებმა არ უნდა განავითარონ უსასრულოდ მეტი ვარიანტი შემოწმებულ ბირთვებზე დაბრუნების გარეშე. დრიფტი მშვიდია. სასწავლო გეგმა, რომელიც ნელ-ნელა იგონებს უფრო ეგზოტიკურ შეზღუდვებს, შეიძლება მაინც გაიაროს ზედაპირული ფილტრები და ორიგინალური შესაძლებლობები არასაკმარისად გაწვრთნილი დატოვოს.

და ბოლოს, ჰიბრიდული, მრავალდომენიანი სამუშაო პირველი კლასის სტრესულ შემთხვევად უნდა ჩაითვალოს. ყოველდღიური მომხმარებლები ერთ ხელსაწყოზე ორიენტირებულად არ ჩერდებიან. ჰიბრიდული დავალებები, გრძელვადიანი ტრაექტორიები და უარის ან შეუძლებლობის ტესტირება არის ის, სადაც გარემოსდაცვითი კომპეტენცია ვლინდება - ან ხმამაღლა ვერ ხერხდება.

გაფრთხილებები, შეზღუდვები და მოგების ფრთხილად წაკითხვა

EnterpriseOps Gym-ზე ავტორის მიერ მოხსენებული შედეგები ინფორმაციული სიგნალებია და არა სრული გარანტია. გამოქვეყნებული ჰიბრიდული და ITSM მიღწევები ვრცელდება ამ დომენებსა და მოდელების დაწყვილებებზე აღწერილი კონფიგურაციის მიხედვით. სხვა დომენებმა, სუსტმა მასწავლებლებმა, უფრო ხმაურიანმა ვერიფიკატორებმა ან გარემოს უფრო ზედაპირულმა სიზუსტემ შეიძლება შეამციროს ან წაშალოს სარგებელი.

ხარისხი სამ საყრდენზეა დამოკიდებული, რომელთა უგულებელყოფა არცერთ მარკეტინგულ ლიტერატურას არ შეუძლია. მასწავლებლის სიძლიერე დემონსტრაციების ზღვარს ადგენს. ვერიფიკატორის ხარისხი ეტიკეტებისა და ფილტრების სანდოობას განსაზღვრავს. გარემოს ერთგულება კი განსაზღვრავს, გაუძლებს თუ არა შეძენილი ქცევები წარმოების სისტემებთან, წესებთან და მონაცემთა მდგომარეობასთან კონტაქტს.

AutoSynthData-ს ექსპერიმენტები ხაზს უსვამს ზედამხედველობით დახვეწილ რეგულირებას. გაძლიერებული სწავლება აღნიშნულია, როგორც იგივე ციკლის შესაძლო მოგვიანებით გამოყენება, დაგეგმილი და არა წარმოდგენილი ნაშრომში. მკითხველმა არ უნდა აურიოს სასწავლო გეგმისთვის მზა მონაცემთა ძრავა და დასრულებული RL ტრენინგის პრეტენზია.

მკითხველებმა სინთეზის პროცესი თავად სამუშაო მაგიდასთან არ უნდა აურიონ. EnterpriseOps Gym უზრუნველყოფს შერჩეულ დავალებებს, ხელსაწყოებს, ცხრილებს, კონტეინერიზაციას და ვერიფიკაციის სტრუქტურას. AutoSynthData იყენებს ამ ტიპის გარემოს, რათა წარუმატებლობები სასწავლო ოქროდ აქციოს. ორივე ნაწილი ზუსტად უნდა იქნას დაწერილი: სავარჯიშო დარბაზი აგენტებს აწვება სტრესს; პროცესი დიაგნოზირებული ხარვეზებიდან ამრავლებს შესასწავლ დავალებებს.

ასევე, „ქვიშის ყუთში“ არ არის უფასო სადილი გამოთვლითი და კალენდრის დროის გამოთვლისას. ჰიბრიდული სინთეზი დაახლოებით ორი ათასი ნიმუშისთვის საათების მიხედვით დასრულდა; ITSM-ს უფრო მეტი დრო დასჭირდა უფრო მძიმე მასწავლებლისა და უფრო ადრეული მილსადენის ფორმის შემთხვევაში. გუნდებმა უნდა გამოყონ ბიუჯეტი მასწავლებლის დასკვნებისთვის, კრიტიკის ან შეკეთების ხელახალი მცდელობებისთვის და ხელახალი შეფასებისთვის სასწავლო გეგმის თითოეული ეტაპის შემდეგ.

სასწავლო გეგმის აზროვნება საწარმოს აგენტების გუნდებისთვის

AutoSynthData-ს ყველაზე ღრმა იდეა სასწავლოა და არა წმინდა გენერაციული. წარუმატებლობები დიაგნოსტირდება. ბარათების რეზიუმე. გენერაცია მრავლდება. ხარისხის კონტროლი ადასტურებს. SFT აახლებს სამიზნეს. ხელახალი შეფასება საზღვარს სწევს. ეს თანმიმდევრობა აგენტის გაუმჯობესებას განიხილავს, როგორც გარემოზე დაფუძნებული გაკვეთილების სერიას და არა კვალის ერთიან ოფლაინ დემონსტრაციას.

სასწავლო გეგმის მიხედვით აზროვნება ცვლის ლიდერების მიერ ძალისხმევის განაწილების წესს. მხოლოდ მეტი ბილეთის ან მეტი ადამიანური ანოტაციის მოთხოვნის ნაცვლად, იკითხეთ, რომელი შესაძლებლობები მაინც ვერ ხერხდება ვარიაციის პირობებში, აქვთ თუ არა ამ შესაძლებლობებს საბოლოო მდგომარეობის სუფთა თვისებები და შეუძლია თუ არა უფრო ძლიერ მასწავლებელს მათი სანდო დემონსტრირება. თუ მასწავლებელი საკმარისად ხშირად ვერ აღწევს წარმატებას, სინთეზური SFT ასწავლის არასანდო ქცევას. თუ საბოლოო მდგომარეობის თვისებები ბუნდოვანია, ვერიფიკატორები ვალიდურ სტრატეგიებს შეეჯახებიან.

ეს ასევე ცვლის წარმატებაზე საუბრის წესს. Hybrid-ზე Pass@1-ის ხარვეზის ნაწილის შემცირება საცნობარო მოდელამდე, ან ITSM Pass@1-ის ათწლეულებიდან ოციანების მაღალ დონემდე აყვანა ავტორის მიერ მოხსენებულ გაზომვებში, გაზომილი გარემოსდაცვითი კომპეტენციის პროგრესს წარმოადგენს. ეს არ არის იმის დასტური, რომ ყველა სამუშაო პროცესი, ყველა პოლიტიკა ან ყველა უარის თქმის შემთხვევა მოგვარებულია. შეინარჩუნეთ მოძრავი სასაზღვრო ენა: დარჩენილი ხარვეზები ხდება შემდეგი Target ფაზა და არა შემდგომი ფიქრი.

პროგრამის დიზაინისთვის, ეს ციკლი დააკავშირეთ ადამიანურ მიმოხილვასთან, სადაც ფსონები მაღალია - უსაფრთხოების პოლიტიკა, შეუქცევადი ქმედებები, რეგულირებადი მონაცემები - და ამავდროულად, ავტომატიზირებულ კარიბჭეებს მიეცით საშუალება, გადაიტანონ მოცულობა კარგად განსაზღვრული მდგომარეობის შემოწმებებზე. სინთეზური მონაცემები საუკეთესოდ მუშაობს, როდესაც გარემოს შეუძლია თქვას „დიახ“ ან „არა“ SQL-ის მსგავსი სიცხადით. ის იბრძვის, როდესაც წარმატება სუბიექტური გემოვნებით არის განპირობებული.

დიზაინის შენიშვნები სირთულეზე, რეალიზმსა და უარყოფაზე

სირთულის განსაზღვრა კიდევ ერთხელ უნდა განვიხილოთ. იმ ამოცანების უპირატესობა, რომლებსაც სამიზნე შემთხვევათა მაქსიმუმ ერთ მესამედში წყვეტს, ტრენინგს წვრილმანებისგან შორს ტოვებს. მასწავლებლისგან წარმატების მოთხოვნა შემთხვევათა მინიმუმ ორ მესამედში დემონსტრაციებს მონეტის აგდებისგან შორს ტოვებს. ეს დიაპაზონი გამოწვევასა და სწავლის უნარს შორის პრაქტიკული კომპრომისია.

რეალიზმი კვლავ უფრო რბილი კრიტერიუმია, მაგრამ მაინც აუცილებელი. საწარმო მომხმარებლები ითხოვენ ისეთ რამეებს, რაც მათ როლებსა და სისტემებს შეესაბამება. მხოლოდ სიმტკიცით მართულ გენერატორებს შეუძლიათ შექმნან რთული მრავალშეზღუდული თავსატეხები, რომლებსაც არცერთი ოპერატორი არ მოითხოვდა. შესაძლებლობების ბარათები, რომლებიც ცვლად ზომებს ჩამოთვლის, ეხმარება, თუმცა ადამიანებს ან მეტა-მიმოხილვას მაინც სჭირდებათ სიურეალისტური მინიშნებების დაჭერა.

უარისა და შეუძლებლობის ტესტირებაგუნდებს ახსენებს, რომ კომპეტენცია გულისხმობს უარის თქმას. მხოლოდ შესასრულებელი ამოცანებისთვის ოპტიმიზებულ მილსადენს შეუძლია უარის სწავლება არასაკმარისად შეაფასოს. AutoSynthData-ს სტილის ციკლების გაფართოებისას, ჩართეთ ბარათები, სადაც სწორი საბოლოო თვისებაა უსაფრთხო უარყოფა პოლიტიკის შესაბამისად და არა მხოლოდ მონაცემთა ბაზის მდგომარეობის წარმატებული მუტაცია.

გრძელვადიანი მდგომარეობის ტრაექტორიები კიდევ ერთ ნიშანს ბადებს დიზაინში. მასწავლებლის დემო ვერსიები თანმიმდევრული უნდა იყოს მრავალი ინსტრუმენტის გამოძახებისას. ვერიფიკატორებმა, რომლებიც მხოლოდ ბოლო ცხრილის რიგს ამოწმებენ, შეიძლება გამოტოვონ შუალედური პოლიტიკის შესვენებები. ვერიფიკატორის დიზაინში სისრულე ნიშნავს იმ თვისებების დაფარვას, რომლებიც ნამდვილად განსაზღვრავს ამ შესაძლებლობის წარმატებას - მათ შორის შეზღუდვებს, რომლებიც უნდა დარჩეს ძალაში მთელი პროცესის განმავლობაში და არა მხოლოდ ბოლოს.

დასკვნითი შეჯამება

AutoSynthData, რომელიც შექმნილია ServiceNow CoreAI / ServiceNow-AI-დან და ავტორია ესაკიველ ესაკირაჯას საჯარო ნაშრომში, არის სისტემა, რომელიც სამიზნე აგენტის წარუმატებლობებსა და მასწავლებლის წარმატებებს გარდაქმნის საწარმო გარემოსთვის დადასტურებულ სინთეზურ სასწავლო ამოცანებად. ის აბსტრაგირებს წარუმატებლობებს გაწმენდილ შესაძლებლობების სპეციფიკაციურ ბარათებად, წარმოქმნის ახალ დავალებებს ორიგინალური მოთხოვნების ან ტრაექტორიების გაჟონვის გარეშე, აგროვებს მასწავლებლის დემონსტრაციებს და ახორციელებს ნიმუშის და პარტიული დონის ხარისხის კონტროლს ზედამხედველობითი დახვეწის დაწყებამდე.

პრაქტიკული მენტალური მოდელი წარმოადგენს ამოცანას, როგორც სისტემის სპეციფიკაციას, მომხმარებლის მოთხოვნას და ვერიფიკატორს - სადაც დაძაბულობა დაცულია განხორციელებადობის, რეალიზმისა და სირთულის მექანიზმებით, და ვერიფიკატორებით, რომლებიც არც ძალიან მოდუნებულია და არც ერთ გზაზეა მიბმული. „მიზანი და შემდეგ გამრავლების“ ფაზები, გამრავლებული ნიმუშებისთვის შემდგომი დათესვის გარეშე წესი, საერთო კონტროლერი და გარემოს ადაპტერი და SFT-ის შემდგომი ხელახალი შეფასება ქმნის მოძრავ საზღვარს დარჩენილ ხარვეზებზე.

EnterpriseOps Gym-ზე, ავტორის მიერ მოხსენებული ჰიბრიდული შედეგები Gemma-4-26B-A4B-it-ით და Qwen3.8-27B-ით დაახლოებით თვრამეტი საათის განმავლობაში დაახლოებით ორ ათას ნიმუშს აჩვენებს და მნიშვნელოვან ზრდას აჩვენებს Pass@1-ისა და ვერიფიკატორის წარმატების მხრივ, რაც ამცირებს საცნობარო მოდელთან არსებული ჩამორჩენის დიდ ნაწილს. ITSM DeepSeek-V4.1-Flash-ის მასწავლებლად გამოყენებით აჩვენებს Pass@1-ის ზრდას 18.77 პროცენტიდან 27.18 პროცენტამდე დაახლოებით 1994 ნიმუშზე უფრო გრძელვადიან პერსპექტივაში. ეს მაჩვენებლები განიხილეთ, როგორც კონკრეტული სფეროების კვლევის სიგნალები, რაც დამოკიდებულია მასწავლებლის, ვერიფიკატორის და გარემოს სიზუსტეზე - და შეინარჩუნეთ გაძლიერებული სწავლება, როგორც ციკლის დაგეგმილი გაფართოება და არა დასრულებული მტკიცება.

თუ ერთი წინადადება გახსოვთ: საწარმოს აგენტები უმჯობესდებიან, როდესაც ჩავარდნები აბსტრაქტულ, გამრავლებულ და დადასტურებულ გაკვეთილებად იქცევა იმ სისტემებში, რომლებზეც ისინი ყოველდღიურად უნდა მუშაობდნენ - და არა მაშინ, როდესაც გუნდები უბრალოდ ერთსა და იმავე გაფუჭებულ შეცდომას იმეორებენ.

პრაქტიკული მაგალითი: გაყინული სპორტული დარბაზის სტილის წარუმატებლობის ნაკრებიდან რთული ITSM შემთხვევების გაფართოება

სცენარი

დიდი ბრიტანეთის საწარმო პლატფორმის გუნდს - წარმოიდგინეთ საშუალო ზომის ფინანსური სერვისების ოპერატიული ჯგუფი, რომელიც ServiceNow-ს სტილის ITSM-ს იყენებს ცვლილებების ფანჯრებით, CMDB ურთიერთობებით და პოლიტიკაზე დამოკიდებული გადასვლებით - ჰყავს წარმოების მსგავსი აგენტი, რომელიც გამუდმებით ერთი და იგივე კლასის სამუშაოს აწყდება: ცხრილებს შორის განახლებები, რომლებიც უნდა აკმაყოფილებდეს დამტკიცების წინაპირობას, ცოდნის სტატიების ძიება, რომელიც კონფლიქტშია ლოკალურ ცვლილებების გაყინვასთან და ჰიბრიდული მოთხოვნები, რომლებიც ITSM-ს მიმდებარე ოპერაციულ ინსტრუმენტებთან აერთიანებს.

ისინი ყინავენ კერძო EnterpriseOps Gym-ის სტილის პაკეტს (კონტეინერიზებული sandbox, SQL შედეგების შემოწმებები, დათესილი ცხრილები, პოლიტიკის წესები), რათა ქულები ყოველკვირეულად შედარებადი იყოს. დიაგნოსტიკური გაშვებისას სამიზნე აგენტი წარუმატებლად მუშაობს იქ, სადაც უფრო ძლიერი მასწავლებელი აღწევს წარმატებას. ხელმძღვანელობას სურს მეტი სასწავლო სიგნალი იმავე ბილეთების ნომრებისა და ერთეულის ID-ების ხელახლა დაკვრის გარეშე. AutoSynthData (ან ეკვივალენტური სინთეზატორის ციკლი წარუმატებლობებიდან, თუ კვლევითი მილსადენი მათ სტეკში დახურულია) არის კანდიდატი: კონტრასტული შეცდომები გარდაიქმნება გაწმენდილ შესაძლებლობების სპეციფიკაციის ბარათებად, გენერირდება ახალი დავალებები, აგროვებს მასწავლებლის დემო ვერსიებს და შემდეგ - კრიტიკულად მნიშვნელოვანია - ადამიანის მიერ განხილული სინთეზური კვალი ნებისმიერი ხელახალი ტრენინგის წინ.

Gym Pass@1-ზე არაფერი იგზავნება დამოუკიდებლად. სინთეზატორის მონაცემები განიხილება, როგორც კანდიდატის სასწავლო გეგმა და არა როგორც უფასო სიმართლე.

რა სჭირდება ასისტენტს

  • გაყინული სპორტული დარბაზის სტილის გარემოს ადაპტერზე წვდომა: ინსტრუმენტები, საწყისი მდგომარეობა, პოლიტიკა და SQL (ან ექვივალენტური მდგომარეობაზე დაფუძნებული) ვერიფიკატორები.
  • დაწყვილებული შეფასების ჟურნალები: სამიზნეების წარუმატებლობა შედარებულია მასწავლებლების წარმატებებთან იმავე დავალებებში.
  • ბარათის სქემა, რომელიც ასახავს შესაძლებლობებს, ხელსაწყოებს/სამუშაო პროცესის ფორმას, წარუმატებლობის/წარმატების კონტრასტს, საჭირო საბოლოო მდგომარეობის თვისებებს და დაშვებული ვარიაციის განზომილებებს - ორიგინალური მოთხოვნების, ერთეულების, ტრაექტორიების ან ვერიფიკატორის შიდა ფუნქციების გარეშე.
  • პირადი ინფორმაციისა და პოლიტიკის წესების (ბილეთების ID-ები, მომხმარებლის სახელები, CI სახელები, რეგულირებადი ველები) შემოწმება, სანამ რაიმე დატოვებდეს „სატესტო გარემოს“ ან შევა გენერატორის მოთხოვნაში.
  • სინთეზური ამოცანების ნიმუშებისა და მასწავლებლის კვალის ადამიანის მიერ განხილვის რიგი (შესაძლებლობა, რეალიზმი, დამადასტურებელი დოკუმენტის სისწორე, უარის/შეუძლებლობის შემთხვევები).
  • გაჩერების მკაფიო პირობები: დამიზნებისა და შემდეგ გამრავლების ფაზები; გამრავლებული ნიმუშები არ ითესება შემდგომ გამრავლების რაუნდებში.

მაგალითი ინსტრუქცია

პლატფორმის მეშვეობით სასწავლო გეგმის ოპერატორთან (ან ორკესტრირების ასისტენტთან, რომელიც მხოლოდ ბარათების დიზაინსა და მიმოხილვის პაკეტებს ადგენს - ის არ ახდენს მოდელების გადამზადებას ან პოპულარიზაციას) დაკავშირებას:

„გაატარეთ დიაგნოსტიკური Pass@1 გაყინულ ITSM-სა და ჰიბრიდულ ნაჭრებზე ჩვენი მიმდინარე სამიზნისა და დანიშნული მასწავლებლის მიმართ. ყოველი კონტრასტისთვის, სადაც სამიზნე ვერ ხერხდება და მასწავლებელი წარმატებით ასრულებს სამიდან ორ ცდას, შეადგინეთ გაწმენდილი შესაძლებლობების სპეციფიკაციის ბარათი: დაასახელეთ შესაძლებლობა, ჩამოთვალეთ შესაბამისი ინსტრუმენტები, მიუთითეთ საჭირო საბოლოო მდგომარეობის თვისებები და ჩამოთვალეთ კონტროლირებადი ზომები (პრიორიტეტული დიაპაზონი, დაკავშირებული CI კლასი, ცვლილების ფანჯრის დროშა, ცოდნის კონფლიქტის ტიპი). ამოიღეთ ბილეთების ნომრები, მომხმარებლის იდენტიფიკატორები, CI სახელები და ნედლი ტრაექტორიები. შექმენით სამიზნე ფაზის ახალი დავალებების პაკეტი მხოლოდ ამ ბარათებიდან. სთხოვეთ მასწავლებელს წარმატებების დემონსტრირება. გამოიყენეთ სირთულის დიაპაზონი (სამიზნე ≤1/3, მასწავლებელი ≥2/3), დადებითი და უარყოფითი დადასტურება და შეზღუდული კრიტიკა/შეკეთება. შექმენით 5%-იანი სტრატიფიცირებული ნიმუშების მიმოხილვის პაკეტი პლუს ყველა უარის/შეუძლებლობის ბარათი. არ დაიწყოთ SFT მანამ, სანამ ორი მიმომხილველი არ მოაწერს ხელს პაკეტს და PII-ის სკრაბ შემოწმებები არ გაივლის წარმატებას. კანდიდატის საკონტროლო წერტილზე SFT-ის შემდეგ, ხელახლა შეაფასეთ გაყინული ნაკრები და შეჩერებული ზუსტი შესაბამისობის ნაკრები, რომელიც არასდროს გამოგვიყენებია გენერირებისთვის. მოახდინეთ დაფარვის ანგარიში წარუმატებლობის კლასის და რეგრესიის მაჩვენებლის მიხედვით.“ წინა წარმოების საკონტროლო პუნქტი. არ განახორციელოთ პოპულარიზაცია მხოლოდ Gym score-ზე

როგორ გამოვცადოთ ის

  1. საბაზისო დაბლოკვა: ჩაწერეთ Pass@1 და ვერიფიკატორის წარმატების მაჩვენებლები გაყინულ კომპლექტზე წარუმატებლობის კლასის მიხედვით (წინასწარი შეკვეთა, შეცვლის ფანჯრის უარყოფა, ჰიბრიდული ჯვარედინი ინსტრუმენტი, ცოდნის კონფლიქტი). შეინარჩუნეთ კომპლექტი და თესლი უცვლელი ციკლისთვის.
  2. ბარათის აუდიტი: შეამოწმეთ, რომ გენერატორები არასდროს იღებენ ორიგინალურ მოთხოვნებს, ერთეულებს ან მასწავლებლის კვალს - მხოლოდ ბარათებს.
  3. ხარისხის კონტროლის ნიმუში: დაადასტურეთ, რომ დადებითი ტრაექტორიები წარმატებით ამოწმებს ვერიფიკატორებს, ხოლო მუტირებული არასწორი შედეგები ვერ ხერხდება. უარყავით სამიზნისთვის ტრივიალური დავალებები ან მასწავლებლისთვის მონეტის აგდება.
  4. ადამიანის მიერ შეფასებული: შემფასებლები თითოეულ ნიმუშს აღნიშნავენ, როგორც შენარჩუნებას/შეკეთებას/ჩავარდნას მიზანშეწონილობის, რეალიზმისა და პოლიტიკის უსაფრთხოების გათვალისწინებით. თვალყური ადევნეთ შემფასებლებს შორის შეთანხმებას საერთო ქვესიმრავლეზე.
  5. ზუსტი დამთხვევის შეკავება: კანდიდატის SFT-ის შემდეგ, შეაფასეთ რეალური (ან ადრე გაყინული) დავალებების შეკავება, რომლებიც არასდროს ყოფილა შეყვანილი დაბარების ან გენერირებისთვის. ცალკე შეაფასეთ სავარჯიშო დავალებების თითქმის პარაფრაზები ზედაპირული დამახსოვრების აღმოსაჩენად.
  6. რეგრესიის კარიბჭე: ნებისმიერი წარუმატებლობის კლასი, რომელიც გაუარესდება წინა წარმოების საკონტროლო წერტილთან შედარებით, ბლოკავს დაწინაურებას ახსნამდე ან გამოსწორებამდე.

შედეგი

აქ ნუ მოიგონებთ გამოწურვის პროცენტებს. გამოიყენეთ გაზომვის გეგმა და ციტირებისას გამოქვეყნებული კვლევის მონაცემებს მონიშნეთ, როგორც სტატიის მტკიცება.

გაზომვის გეგმა (რა უნდა წარმოადგინოს ამ გუნდმა):

  • წარუმატებლობის კლასის დაფარვა: დიაგნოზირებული ხარვეზების კლასების წილი, რომლებმაც ხარისხის კონტროლის შემდეგ ≥N მიღებული სამიზნე ფაზის დავალებები წარმოქმნეს (წინასწარ განსაზღვრეთ N, მაგ. 20 მიღებული დავალება თითო კლასში).
  • Holdout ზუსტი დამთხვევა: Pass@1 / ვერიფიკატორის წარმატება ხელუხლებელ holdout-ზე კანდიდატ SFT-მდე vs შემდეგ (იგივე თესლი, იგივე ვერიფიკატორი).
  • რეგრესიის მაჩვენებელი: წარუმატებლობის კლასების რაოდენობა, სადაც Pass@1 ეცემა წინა წარმოების საკონტროლო წერტილთან შედარებით; დაბლოკეთ, თუ რომელიმე უსაფრთხოებისთვის კრიტიკული კლასი რეგრესიას განიცდის.
  • მიმოხილვის შედეგი: შეინახეთ/შეაკეთეთ/ჩამოვარდნის მაჩვენებლები ადამიანური მიმოხილვის პაკეტზე; თუ ჩამოვარდნის მაჩვენებელი პიკს მიაღწევს, შეაჩერეთ. გაამრავლეთ და შეასწორეთ ბარათები ან ვერიფიკატორები.
  • სკრაბის ჩავარდნები: ნიმუშების რაოდენობა, რომლებიც ვერ ახერხებენ PII/პოლიტიკის შემოწმებას განხილვის დადასტურებამდე (სამიზნე: SFT ნაკრებში ნული გადის).

სტატიის მტკიცება (ავტორის მიერ მოხსენებული EnterpriseOps Gym-ზე - არა ამ გუნდის მიერ გაზომილი შედეგი): ჰიბრიდულმა ცდებმა, სადაც Gemma-4-26B-A4B-it სამიზნედ და Qwen3.8-27B მასწავლებლად იყო, დაახლოებით 18 საათში დაახლოებით 2000 ნიმუში მიიღო, საშუალო Pass@1 დაახლოებით 7.2 პროცენტული პუნქტით გაიზარდა და ვერიფიკატორის წარმატება 63.01%-დან 68.55%-მდე გაიზარდა. ITSM-მა, სადაც DeepSeek-V4.1-Flash მასწავლებლად იყო, საშუალო Pass@1 18.77%-დან 27.18%-მდე გაზარდა დაახლოებით 1994 ნიმუშზე უფრო ხანგრძლივი პერიოდის განმავლობაში (~66 საათი). ესენი განვიხილოთ, როგორც კონკრეტული დომენებისა და დაწყვილებების შესახებ გამოკვლეული სიგნალები და არა როგორც გაერთიანებული სამეფოს წარმოების დასტის უნივერსალური გარანტია.

პროგრამის საილუსტრაციო ფორმა (დაშვებები, არა გაზომილი მიღწევები): თუ გუნდი ერთი ITSM ციკლისთვის მიიღებს დაახლოებით 2000 ხარისხის კონტროლის მქონე ნიმუშს, გაითვალისწინებს მასწავლებლის მიერ დასკვნების გაკეთებას და 5%-იან სტრატიფიცირებულ შერჩევაზე მიმოხილვას და მხოლოდ მაშინ წაახალისებს, როდესაც შეკავება არ იწვევს უსაფრთხოებისთვის კრიტიკული კლასების რეგრესიას, „შედეგი“, რომლის თქმაც მათ პირდაპირ შეუძლიათ, არის პროცესის სიმწიფე - აუდიტირებული სასწავლო გეგმა, გაწმენდილი ტრასები და შესადარებელი გაყინული კომპლექტის დელტაები - და არა დაპირებული პროცენტული ზრდა.

რა შეიძლება არასწორად წავიდეს

  • სინთეზატორის თავისუფალ ჭეშმარიტებად მოპყრობა: ადამიანის მიერ განხილვის ან უარყოფითი ვერიფიკაციის გამოტოვება საშუალებას აძლევს ნებაყოფლობით ვერიფიკატორებს მასშტაბურად დაუშვან ნაგავი.
  • ერთეულის გაჟონვა: ორიგინალური ბილეთის ID-ების ან მასწავლებლის კვალის გენერატორში მიწოდება იწვევს პერიფრაზის ზედმეტად მორგებას; არსებობს ბარათები ამის თავიდან ასაცილებლად.
  • შეუზღუდავი გამრავლება: გამრავლებული ნიმუშებისთვის შემდგომი რაუნდების დათესვის დაშვება დასახელებული შესაძლებლობიდან გადადის.
  • სპორტული დარბაზის ქულების მიწოდება: პოპულარიზაცია მოხდა იმის გამო, რომ გაყინული პაკეტის Pass@1 გაიზარდა, ხოლო holdout ან production shadow ტრაფიკი გაუარესდა.
  • მასწავლებლის სუსტი ლიმიტი: თუ მასწავლებელს არ შეუძლია წარმატების ≥2/3 ზღვრის გადალახვა, SFT არასანდო დემო ვერსიებს ასწავლის.
  • ბუნდოვანი ვერიფიკატორები: ჩატის რუბრიკები სახელმწიფო შემოწმების ნაცვლად, თავისუფლად შესრულებული არასწორ საბოლოო გამოცდებს წარმატებულად აფასებენ.
  • არასაკმარისი ტრენინგის უარყოფა: მხოლოდ შესასრულებელი მუტაციებისთვის ოპტიმიზაცია ცვლილებების ფანჯარას და პოლიტიკის ვარდნას მყიფეს ხდის.
  • PII გაქცევა: სინთეზური მინიშნებები, რომლებიც ზედაპირული გადახვევის შემდეგ ხელახლა შემოაქვს რეალური CI ან მომხმარებლის სახელები.

პრაქტიკული რჩევები

გამოიყენეთ AutoSynthData სტილის ციკლები - ან ექვივალენტური სინთეზატორის ჩავარდნების ნიმუში, თუ ServiceNow CoreAI მილსადენი არ არის ხელმისაწვდომი თქვენს იჯარის ტერიტორიაზე - დიაგნოზირებული ხარვეზებიდან რთული, დამოწმებადი ITSM შემთხვევების გასამრავლებლად. გაასუფთავეთ შესაძლებლობების ბარათებად, შეაფასეთ სირთულე და დადებითი/უარყოფითი დადასტურება, გაწმინდეთ PII და ადამიანის მიერ განხილული ნიმუშები SFT-მდე. გაზომეთ ჩავარდნის კლასის დაფარვა, ზუსტი შესაბამისობის შენარჩუნება და რეგრესიის მაჩვენებელი. სტატიის პრეტენზიის სპორტული დარბაზის მონაცემები მოიხსენიეთ მხოლოდ გარე კვლევის კონტექსტში. სინთეზატორის მონაცემები სასწავლო გეგმის საწვავია და არა გარანტია: აუდიტის ნიმუშები, შეინახეთ ნაკრები გაყინული სამართლიანი შედარებისთვის და არასოდეს გადარიცხოთ სპორტული დარბაზის ქულა ცალკე.

ხშირად დასმული კითხვები

რა არის AutoSynthData და რა პრობლემას ემსახურება ის?

AutoSynthData არის ServiceNow CoreAI / ServiceNow-AI მილსადენი, რომელიც აღწერილია ესაკიველ ესაკირაიას მიერ და რომელიც სამიზნე აგენტის წარუმატებლობებსა და უფრო ძლიერ მასწავლებელს წარმატებებს აერთიანებს საწარმოს გარემოსთვის დადასტურებულ სინთეზურ სასწავლო ამოცანებში. ის ფართო ზოგადი ცოდნის ნაცვლად, ყურადღებას ამახვილებს გარემოს კომპეტენციაზე - ადგილობრივ პოლიტიკაზე, სქემებზე, ინსტრუმენტებსა და მდგომარეობაზე. მიზანია რთული, შემოწმებადი სამუშაოს გამრავლება ისე, რომ ზედამხედველობით დახვეწილმა რეგულირებამ შეძლოს გარემოსთვის დამახასიათებელი ხარვეზების გამოსწორება იმავე გაფუჭებული შეცდომის გამეორების ნაცვლად.

რატომ განსხვავდება გარემოსდაცვითი კომპეტენცია ფართო მოდელის შესაძლებლობებისგან?

საწარმოს აგენტები ხშირად ცდებიან, რადგან თავად გარემო სპეციფიკურია: ბილეთების პოლიტიკა, სქემის თავისებურებები, ინსტრუმენტების კონტრაქტები, დათესილი მონაცემთა ბაზები და სისტემებს შორის სამუშაო პროცესები. მოდელი, რომელიც ღია ბენჩმარკებზე კარგად გამოიყურება, მაინც შეიძლება გაიყინოს ცვლილების ფანჯარაზე, CMDB ურთიერთობაზე ან საბოლოო მდგომარეობის შემმოწმებელ ვერიფიკატორზე. ფართო შესაძლებლობები არ არის იგივე, რაც იმის ცოდნა, თუ როგორ იქცევიან თქვენი სისტემები, წესები და მონაცემთა მდგომარეობა პოლიტიკის მიერ მართული გადასვლების დროს.

რა პრაქტიკული დავალების ფორმას იყენებს AutoSynthData?

სამუშაო ფორმა არის დავალება, რომელიც უდრის სისტემის სპეციფიკაციას, მომხმარებლის მოთხოვნას და ვერიფიკატორს. სისტემის სპეციფიკაცია შეიცავს შეზღუდვებს, პოლიტიკას და საწყის მდგომარეობას, როგორიცაა მონაცემთა ბაზის მარცვლები და ცოდნის სტატიები. მომხმარებლის მოთხოვნები ფასდება შესაძლებლობის, რეალიზმისა და სირთულის მიხედვით. იდეალურ შემთხვევაში, ვერიფიკატორები ეყრდნობიან SQL-ზე დაფუძნებულ ან მდგომარეობაზე დაფუძნებულ შედეგების შემოწმებას, რათა შეაფასონ სამყარო აგენტის მოქმედების შემდეგ და არა მხოლოდ ზუსტი ტოკენის გზა.

როგორ უშლის ხელს დეზინფიცირებული შესაძლებლობების სპეციფიკაციების ბარათები ზედმეტად მორგებას?

დიაგნოსტიკური გაშვებისას ხდება კონტრასტული ანალიზი, სადაც სამიზნე ვერ ხერხდება და მასწავლებელი წარმატებით სრულდება, შემდეგ კი ეს შემთხვევები გადამუშავდება გაწმენდილ შესაძლებლობების სპეციფიკაციის ბარათებში. ბარათი აღრიცხავს შესაძლებლობებს, ხელსაწყოებს ან სამუშაო პროცესის ფორმას, წარუმატებლობის/წარმატების კონტრასტს, საჭირო საბოლოო მდგომარეობის თვისებებს და განზომილებებს, რომლებიც შეიძლება განსხვავდებოდეს. გენერატორი ვერასდროს ხედავს საწყის მოთხოვნებს, ერთეულებს, ტრაექტორიებს ან დამადასტურებელ დეტალებს - მხოლოდ ბარათებს - ამიტომ ახალი დავალებები ზედმეტად აქტიურია დამახსოვრებული ეპიზოდის პერიფრაზირების გარეშე.

რა არის მილსადენში Target და Multiply ფაზები?

სამიზნე ფაზა კონცენტრირებულია ძირითადი, შემოწმებული ნიმუშების შერჩევაზე ხარვეზების გარშემო - ყველაზე მაღალი სიგნალის მქონე ამოცანები სუსტი აგენტის რღვევის ადგილას. გამრავლების ფაზა ატრიალებს მიღებული სამიზნეების ახალ ვარიანტებს. გამრავლებული ნიმუშები ვერ ახერხებენ შემდგომი გამრავლების რაუნდების დათესვას, რაც ხელს უშლის დასახელებული შესაძლებლობიდან გადახრას. ზედამხედველობითი დახვეწის შემდეგ, ხელახალი შეფასება სასწავლო გეგმას გადააქვს დარჩენილი ხარვეზებისკენ, როგორც მოძრავი საზღვრისკენ და არა სტატიკური ნაგავსაყრელისკენ.

როგორ უზრუნველყოფს ნიმუშის დონის ხარისხის კონტროლი სინთეზური ამოცანების სანდოობას?

ამოხსნის სირთულის ფილტრი უპირატესობას ანიჭებს დავალებებს, რომლებსაც სამიზნე წყვეტს სამიდან მაქსიმუმ ერთ ცდაში, მაშინ როცა მასწავლებელი წარმატებით ასრულებს სამიდან სულ მცირე ორს. დადებით ვერიფიკაციას წარმატების მისაღწევად სჭირდება საცნობარო ტრაექტორია; უარყოფით ვერიფიკაციას კი წარუმატებლობისთვის სჭირდება მუტირებული არასწორი შედეგები. კრიტიკისა და შეკეთების ციკლი ხელახალი ცდის ლიმიტით ცდილობს თითქმის წარუმატებელი შეცდომების გამოსწორებას, ხოლო პარტიული დონის მეტა-მიმოხილვა ამოწმებს დაფარვას, მრავალფეროვნებას, ზედმეტობას და წარუმატებელ სამიზნეებს მთელ ნაკრებში.

რა არქიტექტურას იყენებს AutoSynthData საწარმოს დომენებში?

ის აწყვილებს საერთო კონტროლერს გარემოს ადაპტერთან. კონტროლერი ახორციელებს დიაგნოსტიკას, დამოწმებას, გენერირებას, მასწავლებლის დემო ვერსიებს, ხარისხის კონტროლერებს და ჯგუფურ მიმოხილვას. ადაპტერი ამ ნაბიჯებს აერთიანებს კონკრეტულ „სატესტო ყუთში“ - ხელსაწყოები, მდგომარეობა, პოლიტიკა და ვერიფიკატორები - რათა ერთი და იგივე საკონტროლო ციკლი სხვადასხვა დომენზე იყოს მიმართული სასწავლო გეგმის ლოგიკის ნულიდან გადაწერის გარეშე.

რა არის EnterpriseOps Gym ამ კვლევის კონტექსტში?

EnterpriseOps Gym არის მასშტაბური საწარმო აგენტების პლატფორმა, რომელიც გამოიყენება როგორც სტრესის ტესტის პლატფორმა, დაახლოებით 1150 ექსპერტის მიერ შემუშავებული დავალებით 8 დომენში, დაახლოებით 512 ხელსაწყოთი, დაახლოებით 164 მონაცემთა ბაზის ცხრილით, კონტეინერიზებული შესრულებით, SQL-ზე დაფუძნებული შედეგების ვერიფიკაციით, პოლიტიკაზე მართულ ოპერაციებთან, ჰიბრიდულ სცენარებთან და გრძელ ჰორიზონტალურ მდგომარეობაზე ორიენტირებულ ტრაექტორიებთან. AutoSynthData არ არის წარმოდგენილი, როგორც ამ სავარჯიშო დარბაზის გამომგონებელი; სავარჯიშო აჩვენებს სინთეზის ციკლს მოქმედებაში.

რა ავტორის მიერ მოხსენებული შედეგები ჩანს ჰიბრიდული და ITSM პარამეტრებისთვის?

EnterpriseOps Gym-ზე Hybrid მუშაობს Gemma-4-26B-A4B-it-ით, როგორც სამიზნე და Qwen3.8-27B-ით, როგორც მასწავლებლის, დაახლოებით 18 საათში დაახლოებით 2000 ნიმუშის წარმოებით, საშუალო Pass@1-ით, რომელიც დაახლოებით 7.2 პროცენტული პუნქტით გაიზარდა და ვერიფიკატორის წარმატება 63.01%-დან 68.55%-მდე გაიზარდა. ITSM-მა, DeepSeek-V4.1-Flash-ით, როგორც მასწავლებლის, საშუალო Pass@1 18.77%-დან 27.18%-მდე გაზარდა დაახლოებით 1994 ნიმუშზე უფრო ხანგრძლივი პერიოდის განმავლობაში. ესენი განვიხილოთ, როგორც კონკრეტული დაწყვილების შესახებ გამოკვლეული სიგნალები და არა უნივერსალური წარმოების გარანტია.

რა შეცდომები უნდა აიცილონ თავიდან გუნდებმა სინთეზატორის წარუმატებლობისგან წარმოქმნილი ციკლების გამოყენებისას?

არ მიიჩნიოთ სინთეზური მონაცემები თავისუფალ სიმართლედ და არ გამოტოვოთ ადამიანის მიერ განხორციელებული მიმოხილვა და უარყოფითი დადასტურება. მოერიდეთ ორიგინალური ბილეთების ID-ების ან მასწავლებლის კვალის გენერატორში მიწოდებას, გამრავლებული ნიმუშების შემდგომ რაუნდებში დათესვას ან Gym Pass@1-ზე დამოუკიდებლად რეკლამირებას, სანამ შეკავების ან ჩრდილოვანი ტრაფიკი გაუარესდება. ასევე, ყურადღება მიაქციეთ სუსტ მასწავლებლებს წარმატების ზოლის ქვემოთ, ბუნდოვან ჩატის რუბრიკებს სახელმწიფო შემოწმების ნაცვლად, არასაკმარისი მომზადების უარყოფის შემთხვევებს და პირადი ინფორმაციის გაქცევას ზედაპირული წმენდის შემდეგ.

ცნობები

  1. ჩახუტებადი სახე — AutoSynthData — huggingface.co
  2. EnterpriseOps-ის სპორტული დარბაზი — enterpriseops-gym.github.io
  3. arXiv — arxiv.org
  4. GitHub — EnterpriseOps-Gym — github.com
ვიქტორინა
1. ServiceNow CoreAI-ის AutoSynthData ძირითადად რა პრობლემას აგვარებს?

2. რატომ აერთიანებს AutoSynthData-ს შეცდომების შესახებ მონაცემებს გაწმენდილ შესაძლებლობების სპეციფიკაციურ ბარათებში?

3. რა სირთულის დიაპაზონს ანიჭებს უპირატესობას აღწერილი ამოხსნის ფილტრი სასწავლო ამოცანებისთვის?

4. როგორ არის სტრუქტურირებული AutoSynthData-ს მართვის ციკლი გარემოში?

5. EnterpriseOps Gym Hybrid-ზე, ავტორის მიერ მოხსენებული Pass@1 ცვლილება მოყვანილია Gemma-4-26B-A4B-it სამიზნისთვის?


ბლოგზე დაბრუნება