მოკლე პასუხი: ხელოვნური ინტელექტი, როგორც თვისება, სანდო არ არის: ის დამოკიდებულია დავალებაზე, აღდგენის ციკლზე და იმ ადამიანზე, რომელიც ჯერ კიდევ პასუხისმგებელია. უწყვეტი მუშაობის დრო განსაზღვრავს, უპასუხა თუ არა საბოლოო წერტილმა პასუხს; სიმართლის ქონა განსაზღვრავს, უპასუხა თუ არა პასუხს. გამოიყენეთ იგი, როდესაც აცილების შანსი იაფია ან მისი დაჭერა შესაძლებელია; შეანელეთ ტემპი, როდესაც აცილების შანსი ძვირია.
ძირითადი დასკვნები:
ანგარიშვალდებულება: დაასახელეთ ვინ ამოწმებს, ვის შეუძლია მისი შეჩერება და ვის ეკისრება პასუხისმგებლობა.
გამჭვირვალობა: შეამოწმეთ მოპოვებული ნაწილი, თორემ ისევ ნისლში ხართ.
აუდიტირება: აღრიცხავს შენიშვნებს, ამოღებულ ნაწილებს და გაგზავნებს, რათა შესაძლებელი იყოს შეცდომების თვალყურის დევნება.
ბოროტად გამოყენების წინააღმდეგობა: ფინანსურ საკითხებში ვერაფერი დააფიქსირეთ; არასდროს გამოიგონოთ ციფრები, ფანჯრები ან პოლიტიკა.
საილუსტრაციო შედეგები: 20-კითხვიანი საილუსტრაციო ტესტი რუკად ჩათვალეთ და არა 95%-იან მტკიცებულებად.

სტატიები, რომელთა წაკითხვაც შეიძლება მოგეწონოთ ამის შემდეგ:
🔗 როგორ გამოვიყენოთ ხელოვნური ინტელექტი ყოველდღიურ ცხოვრებაში?
აღმოაჩინეთ პრაქტიკული გზები, თუ როგორ შეუძლია ხელოვნურ ინტელექტს ყოველდღიური ამოცანებისა და რუტინის გამარტივება.
🔗 როგორ გამოვიყენოთ ხელოვნური ინტელექტი სამსახურში.
გაიგეთ პრაქტიკული გზები, თუ როგორ გააუმჯობესოთ პროდუქტიულობა და ეფექტურობა ხელოვნური ინტელექტის გამოყენებით.
🔗 შეუძლია თუ არა ხელოვნურ ინტელექტს დამოუკიდებლად აზროვნება?
გამოიკვლიეთ, შეუძლია თუ არა ხელოვნურ ინტელექტს ნამდვილად დამოუკიდებლად აზროვნება და მსჯელობა.
🔗 რა ტიპის ხელოვნური ინტელექტი არსებობს?
გაიგეთ ხელოვნური ინტელექტის ძირითადი ტიპები, შესაძლებლობები და ძირითადი განსხვავებები.
რას ნიშნავს საერთოდ „სანდო“, როდესაც მანქანა სტატისტიკური თუთიყუშია
ყოველდღიურ მეტყველებაში სანდოობა ნიშნავს, რომ შეგიძლია რაღაცას დაეყრდნო.
მოლაპარაკე ავტომატიზაციის პირობებში, სხვადასხვა თვისებების გროვა ერთი სიტყვის ქვეშ იმალება. ფაქტურობა. თანმიმდევრულობა. კალიბრაცია - შეესაბამება თუ არა მოდელის სანდოობა მის სისწორეს, თუ ის უბრალოდ... დარწმუნებულად ჟღერს. უსაფრთხოება. უწყვეტი მუშაობა. სწრაფი მგრძნობელობა. ქცევა უკიდურეს შემთხვევებში. ქცევა განაწილების ცვლილების შემდეგ, როდესაც ცოცხალი სამყარო არ არის ტრენინგის სამყარო. არცერთი ეს ერთად არ იშლება. ეს არის ის ნაწილი, რომელსაც ადამიანები გამოტოვებენ.
ჩატბოტი შეიძლება მთელი კვირა „აქტიურ“ იყოს და სამშაბათს შუადღისას მაინც შეცდეს. კოდირების მეორე პილოტმა შეიძლება სტანდარტული API-ით კარგად იმუშაოს და შემდეგ ჰალუცინაცია გაუკეთოს, რომელიც ზუსტად ორიგინალს ჰგავს. მეტაფორა, რომელსაც ხალხი მიმართავს, არის „უმცროსი კოლეგა“. ეს არასრულყოფილია - უმცროსები უხერხულ მდგომარეობაში არიან - მაგრამ ის „ორაკულზე“ უფრო ახლოსაა.
პირდაპირი ტესტირება საიმედოა იმის მიხედვით, თუ რა, ვისთვისდა რომელი ციკლით. წინააღმდეგ შემთხვევაში, თქვენ აფასებთ ბლენდერს იმის მიხედვით, შეუძლია თუ არა მას გადასახადების გადახდა.
უწყვეტი მუშაობის დრო სიმართლეს არ ნიშნავს - ორი განსხვავებული სახის „სანდოობა“
ოპ-ის წარმომადგენლები და ჭეშმარიტების მომხრეები ერთსა და იმავე სიტყვას იყენებენ და ერთმანეთს უსიტყვოდ ელაპარაკებიან.
უწყვეტი მუშაობის დრო ნიშნავს „გააკეთა საბოლოო წერტილის პასუხი“. სიმართლე ნიშნავს „იყო თუ არა პასუხი, ასე რომ“. მმართველობა ორივეზე ზრუნავს და მოდელის რისკი ამ უსიამოვნო ხარვეზში დევს. შეგიძლიათ გქონდეთ სერვისი, რომელიც არასდროს ახამხამებს თვალს და მაინც მომხმარებლის ბილეთში თავისუფლად ტყუილი შეიტანოთ. საიმედოა SRE გაგებით. არ არის საიმედო იმ გაგებით, რომ „გთხოვთ, ნუ მოიგონებთ თანხის დაბრუნების პოლიტიკას“.
ალბათ, ეს აშკარაა, როგორც ჩაწერილია. ეს აშკარა აღარ არის საღამოს 4 საათზე, როდესაც პასუხი სწრაფია და რიგი ურჩხულია. სიჩქარე კომპეტენციას ჰგავს. ნელა ყოფნა ადრე ნიშნავდა, რომ ვიღაც ფიქრობდა. ახლა სიჩქარე იმის მანიშნებელია, რომ არავინ ფიქრობს.
უსაფრთხოება კიდევ ერთი ღერძია. მოდელი, რომელიც უარს ამბობს უსიამოვნო ჯეილბრეიკზე, „სანდოა“ უსაფრთხოების თვალსაზრისით და მაინც შეიძლება დააზიანოს თქვენი ჩანაწერების შეჯამება.
თავისუფლად და მცდარად საუბარი უარესია, ვიდრე უხეშად და პირდაპირად საუბარი
ეს თავდაჯერებულობის პრობლემაა და სწორედ ეს არის ყველაზე მნიშვნელოვანი.
სიზუსტე და თავისუფლად მეტყველება ერთმანეთს დაშორდა და თავისუფლად მეტყველებამ შეინარჩუნა ძალა. სამართლის მაგისტრის ხარისხი მოგცემთ რიტმს, სწორ ადგილებში დაცვას, შესაძლოა, ყალბ, მაგრამ ლამაზ ციტირების ფორმასაც. თქვენი ტვინი კითხულობს „ამ ადამიანმა იცის“. თუმცა, ეს ადამიანი არ არის და კალიბრაცია ხშირად საშინელია - მაღალი თავდაჯერებულობა, საშუალო დონის სიმართლე, რომელიც მთავარი ნოტის მსგავსად არის გადმოცემული.
უხერხული არასწორი პასუხი ეჭვს გიჩენს. თავისუფლად ნათქვამი არასწორი პასუხი კი გაიძულებს, შეწყვიტო შემოწმება. ეს პატარა განსხვავება არ არის; ეს მთელი ამბავია ერთ, ოდნავ უხერხულ წინადადებაში.
მიკერძოებაც აქ არის, ყოველთვის არა შეურაცხყოფის სახით, არამედ იმის ნაგულისხმევად, თუ ვინ არის ოთახში და ინგლისურის რომელი ელფერი ითვლება ნეიტრალურად. ხალხი ტყუვდება, რადგან ენა ჩვენი უძველესი ნდობის ინტერფეისია. თუ ის მოკლე ტექსტს ჰგავს, ჩვენც მოკლე ტექსტს ვეკიდებით. ვცდილობ, ამ საკითხში უფრო ცინიკური ვიყო. შემდეგ გამჭვირვალე შეჯამებას ვკითხულობ და მხრები მეშვება. შეხვედრაზე შესვლისას შეჯამება დასრულებული ჩანს. ეს წინადადება ძალიან ბევრს აკეთებს და მაინც: ასე ხვდება შეცდომა საქმეში.
სანდოობა სიტუაციის მიხედვით, და არა ბრენდის მიხედვით
ბრენდები ყურადღების გამფანტველია. საქმე მხოლოდ შედარებაშია. ჩხუბი ერთმანეთში გაგრძელდება. ეს ნორმალურია.
| გამოყენების შემთხვევა | როგორ მიდრეკილია წარუმატებლობისკენ | როდესაც ის „საკმარისად კარგია“ | რაც ადამიანს ჯერ კიდევ უნდა გააკეთოს | რატომ ტყუვდებიან ადამიანები |
|---|---|---|---|---|
| პროექტის შედგენა / შეჯამება | გამონაკლისს შლის; შესაძლოა-ს აუცილებლობით ამაღლებს | პირველი გადასვლის ტექსტი, რომელიც უკვე იცით | შეამოწმეთ სახელები, რიცხვები, ხაზი, რომელიც შეიძლება მტკივნეული იყოს | შენსავით ჟღერს. გაგზავნა. |
| ძიების მსგავსი კითხვა-პასუხი | ნისლის პასუხები; თითქმის ავარიული შემთხვევის აღმოჩენა ფაქტად არის ჩაწერილი | ორიენტაცია, არა ბოლო სიტყვა | გახსენით წყარო, თორემ მხოლოდ წინათგრძნობა გექნებათ | იგივე ტონი ამოღებულისა და გამოგონილისთვის |
| კოდის დახმარება | გამოგონილი API-ები; ტესტები, რომლებიც ადასტურებენ შეცდომას | შაბლონი, წებო, "ახსენით ეს შეცდომა" | გაუშვით. წაიკითხეთ განსხვავება. (ქადაგებისას ვსაუბრობ, ბოდიში.) | სახლის სტილი. მწვანე იერის ტესტები. |
| მომხმარებელთა მხარდაჭერა | გამოგონილი პოლიტიკა; თავაზიანი არასწორი არა | მკაცრი პოლიტიკის ფარგლებში პროექტები | ფლობდეთ გადარიცხულ ფულს და ენდეთ მას | სწრაფი + კეთილი. არავინ ამოწმებს მეხუთე შეტყობინებას. |
| სამედიცინო/იურიდიული კონსულტაცია | თავისუფლად, სტრუქტურირებულად, კატასტროფულად თავდაჯერებულად | თითქმის არასდროს, როგორც პროდუქტი | იყავი პროფესიონალი. მოდელი მხოლოდ მოკლე მონაკვეთია. თუ ეს უხეშად ჟღერს, კარგი. | მოკლედ ლაპარაკობს. |
| ქულების მინიჭება / რეიტინგი | პროქსის ფუნქციები; დრიფტი; ჩაძირული კიდეების ქეისები | ტრიაჟი, რომელსაც გადაფარავთ | კუდის შემოწმება | ციფრები ზრდასრულის შთაბეჭდილებას ტოვებს. საინფორმაციო დაფები მმართველობის შთაბეჭდილებას ტოვებს. ისინი თავისთავად ასე არ არის. |
| სურათის გენერირება | ხელები, ზედმეტი იდაყვები, სტერეოტიპული ნარჩენები | განწყობის დაფები, ერთჯერადი კომპლიმენტები - არა მტკიცებულება | ორჯერ შეხედეთ, რაც ნიშნავს არა მხოლოდ არტეფაქტებს | Pretty აკნინებს სკეპტიკურ განწყობას |
| ავტონომიური აგენტები | თავდაჯერებული ინსტრუმენტის გამოძახება; შეცდომები, რომლებიც რთულდება | ვიწრო მარყუჟები გადამრთველით | კაუჭზე არ გაჩერდე. რასაც შეეხება, თავსახური დაახურე. | დანომრილი გეგმა კომპეტენციას ჰგავს. ხშირად ეს არის სამოქმედო სია ძრავით. |
ყოველ შემთხვევაში. თუ თქვენი საყვარელი ინსტრუმენტი ნახაზების წერაში ოსტატურად მუშაობს და შუაღამისას მას იურიდიულთან შესაბამისობაში მოყვანისკენ ითხოვთ, ეს განახლება არ არის. ეს არის რუკა, რომელიც გეუბნებათ, რომ ის დატოვეთ.
ჰალუცინაციები, დრიფტი და ჩუმი სახის შეცდომა
ჰალუცინაცია სათაურებში იმიტომ იპყრობს ყურადღებას, რომ ის ცხარეა: წიგნი, რომელიც არ არსებობს, ფუნქცია, რომელიც არასდროს განხორციელებულა, პოლიტიკის პუნქტი ნომრით, რომელიც ოფიციალურად ჟღერს.
დრიფტი ნაკლებად კინემატოგრაფიულია. სამყარო მოძრაობს. მოდელის ნარჩენები რჩება. თქვენ სვამთ კითხვას, რომელსაც ახალი კონტექსტი სჭირდებოდა და წინა ამინდიდან კარგად ორგანიზებულ პასუხს იღებთ. იქ კინაღამ დავწერე „სხვა ეპოქიდან“, რაც ამ თემის გაზვიადებაა. ეს სხვა ეპოქა არ არის. უბრალოდ, ახლა აღარ არის.
ჩუმი მცდარი წარმოდგენა ყველაზე მეტად მაინტერესებს. შეჯამება, რომელიც გამონაკლისს გამორიცხავს. პერიფრაზი, რომელიც „შესაძლოა“-ს აუცილებლობით ცვლის. ფაქტობრივი რეალობა შეიძლება „ტექნიკურად კარგი“ იყოს, მაშინ როცა მნიშვნელობა იცვლებოდეს.
სწრაფი მგრძნობელობა ამ სიტუაციას კიდევ უფრო აუარესებს. შეცვალეთ შეფუთვა და „ფაქტები“ ციმციმებს. იკითხეთ როგორც სკეპტიკოსმა, მოიპოვეთ ღობეები. იკითხეთ როგორც უფროსმა სწრაფად, მიიღეთ სწრაფი გადაჭარბებული პრეტენზია. თუ თქვენს შეფასებაში მხოლოდ ერთი კოსტუმია გამოყენებული, თქვენი შეფასება ცოტა ტყუილია. ბოდიში.
„ჯაილბრეიქები“ ზღვარზეა და მე არ მინდა ძარცვის შესახებ ფილმის ჩვენება. თუ სისტემის დარწმუნება შესაძლებელია, რომ მანერები დაკარგოს, სანდოობა მხოლოდ სიმართლეში არ არის დამოკიდებული; საქმე იმაშია, დამცავი ღობეები მარყუჟია თუ პოსტერი.
ვარჯიშის ნარჩენები, მოძველებული ცოდნა და რატომ არ არის დამიწება ჯადოსნური ჯოხი
გენერაციული მოდელები გროვაზე იწვრთნება და შემდეგ თქვენს სამშაბათზეა მიმართული. აღდგენა ზრდასრული ადამიანის მცდელობაა, აწმყო ამ გროვაზე დაამაგრო. დამიწება ნიშნავს „პასუხს აქედან და არა ნისლიდან“. როდესაც ის ვერ ხერხდება, ის თავაზიანად ვერ ხერხდება.
კლასიკური წარუმატებლობა: რეტრივერი იღებს თითქმის გატეხილ დოკუმენტს. გენერატორი სრული სიმშვიდით წერს მას. თქვენ ხედავთ წყაროს ფორმის ობიექტს და თქვენი შემოწმების ინსტინქტი ირთვება. მე ამას ვაკეთებ. თქვენ ალბათ ამას აკეთებთ. ციტირების იდეა სწორია; განხორციელება მხოლოდ იმდენად კარგია, რამდენადაც შედეგი.
მოძველებული ცოდნა კიდევ ერთი გაჟონვაა. ზოგიერთ დავალებას სჭირდება ცოცხალი მდგომარეობა - ფასები, ინვენტარი, პოლიტიკის მიმდინარე ფორმულირება. ზოგიერთს სჭირდება სტაბილური უნარ-ჩვევები, მაგალითად, მემორანდუმის სტრუქტურირება. შეურიეთ ეს ყველაფერი და მიიღებთ ძალიან ზუსტ პასუხს უკვე შეცვლილი სამყაროს შესახებ. განაწილების ცვლა ზრდასრული ადამიანის სახელია: ცოცხალი განაწილება არ არის ტრენინგის განაწილება და ზღვარზე არსებული შემთხვევები ნაპრალში ცხოვრობს.
კიდევ ერთი რამ, რაც არასწორად დასმული დეფისით ვთქვი, რადგან ჩემი ჩანაწერები ასე გამოიყურება: დამიწება იატაკია და არა ჰალო. თუ ამოღებული ნაწილის დათვალიერებას ვერ ახერხებთ, ესე იგი, ისევ ნისლში ხართ, უბრალოდ უკეთესი განათებით.
შეფასების თეატრი: რატომ არის დემო საშინელი ტესტი
დემო ვერსიები განათებაა. საორიენტაციო მაჩვენებლები ცოტა უფრო გულწრფელია და მაინც შენი საქმე არ არის.
მკაფიო მოთხოვნა და დავალება, რომლის ათასი მსგავსებაც მოდელს აქვს - რა თქმა უნდა, ის საკმაოდ კარგად გამოიყურება. შეფასება, რომელიც მხოლოდ ამას ზომავს, რაც სცენაზე დაკვრის გაზომვას ჰგავს. რეალურ დროში სამუშაო პროცესებს აქვს ჩახლართული ჩასმა, დაკარგული ფაილები და მომხმარებელი, რომელიც პირველივე პასუხს მიიღებს, რაც მათ შფოთვას ამცირებს.
საორიენტაციო ნიშნულებს მნიშვნელობა აქვს. ისინი უბრალოდ ისე კარგად არ მოძრაობენ, როგორც ამას დასტები ამტკიცებენ. ლიდერბორდის ქულა არ არის თქვენი ბილეთების კალიბრაცია. კომპანიაში მოდელის რისკი არის „რა ხდება, როდესაც ეს არასწორია მოცულობის მხრივ“ და არა „გაიარა თუ არა მან ვიქტორინის კომპლექტი“. საჭირო ტესტები მშრალია: დარჩით აღდგენილ პასაჟში; მონიშნეთ გაურკვევლობა ბლეფის ნაცვლად; იყავით თანმიმდევრული ფრაზის გადაწერისას; ჩააბარეთ ჩაჭრა (უარი, კითხვა, გადადება) ჩაჭრის ნაცვლად (გამოგონება).
მე მინახავს, როგორ აღიქვამენ ადამიანები ერთ შთამბეჭდავ დასრულებას დასტურად. ეს იგივეა, რომ გადაწყვიტო, რომ რესტორანი „სანდოა“ მხოლოდ იმიტომ, რომ საუზმე გემრიელი იყო. შესაძლოა, ასეც არის. შესაძლოა, სამზარეულოს კარგი ათი წუთი ჰქონდა.
მცირე წინააღმდეგობა ჩნდება: მე კვლავ ვიყენებ დემო ვერსიებს შეგრძნების მისაღებად. უბრალოდ, შეგრძნებას არ ვიყენებ.
სანდოა თუ არა ხელოვნური ინტელექტი? მხოლოდ იმ შემთხვევაში, თუ ვინმე კვლავ დამნაშავეა
„ადამიანი ციკლში“ ერთადერთი დიზაინია, რომელიც შეესაბამება უკმარისობის რეჟიმებს.
თუ არავინ იქნება პასუხისმგებელი, სისტემა ისე იქნება გამოყენებული, თითქოს ის ასეთი იყოს. მმართველობა არასასიამოვნო სახელია „ვინ ამოწმებს, ვის შეუძლია მისი შეჩერება, რა რეგისტრირდება, რა ხდება შეცდომის შემდეგ“. აგენტები ამას უფრო მკვეთრად ამახვილებენ, რადგან ისინი მოქმედებენ და არა მხოლოდ აბზაცებს. თქვენს მიერ არგაგზავნილი პროექტი იაფია. ხელსაწყოს გამოძახება, რომელიც არ გიგულისხმიათ, იაფი არ არის.
დაასახელეთ ვინ არის ამ საკითხზე პასუხისმგებელი. თუ პასუხია „მოდელი“, თქვენ პასუხი არ გაქვთ. მოდელები ინციდენტის შემდეგ შეხვედრაზე არ მიდიან. მიდიან ადამიანები, ან მტვერსასრუტი და შემდეგ ადვოკატი.
აირჩიეთ აფეთქების რადიუსს შესაბამისი შემოწმებები. სოციალურ ქსელში განთავსებული პოსტისთვის მართლწერის შემოწმების დონის მიმოხილვა. წყაროს შემოწმება ყველაფრისთვის, რაც ფაქტს ამტკიცებს. პროფესიონალი ყველაფრისთვის, რაც მედიცინას, სამართალს, კრედიტს, უსაფრთხოებისთვის კრიტიკულ ოპერაციებს უკავშირდება. მათთვის ადამიანი „ციკლში“ არ არის. ადამიანი ციკლია. მოდელი არის მოკლე ვერსია. ეს არ არის სკეპტიციზმი, როგორც პიროვნება. ეს არის გემოვნება.
ახლა მოდაშია ჩეკის მბზინავი გაგზავნის ღილაკის უკან დამალვა. დღესდღეობით ჭორის შემთხვევით ავტომატიზირების გზაზე სწორედ ასე ახდენ. ბოლო დროს ამ საკითხთან დაკავშირებით უფრო გულგრილი ვარ და საქმეც უკეთესობისკენ წავიდა.
როგორ იკითხო, რომ შეცდომა დააფიქსირო
თქვენ შეგიძლიათ ამ სისტემების შესწავლა ისე, რომ არ გახდეთ პროფესიონალი ეჭვის ქვეშ მყოფი მზის სინათლის მიმართ.
-
განგებ იკითხეთ გაურკვევლობის შესახებ. „რა გახდის ამას არასწორს?“ ჯობია „გახადოს ის თავდაჯერებული“.
-
შეძლებისდაგვარად, თაობების მიხედვით გაყავით მასალა. ჯერ პასაჟებს გადახედეთ. შემდეგ კი მოკლე შინაარსი მოითხოვეთ.
-
კოსტუმი შეცვალეთ. ფორმულირება გადააკეთეთ. სთხოვეთ, საპირისპირო დაასაბუთოს. თუ ასე გამოიყენებთ, მგრძნობელობა ფანარივითაა.
-
იძულებითი შეზღუდვები: „მხოლოდ ჩემს მიერ ჩასმული ტექსტიდან“, „თუ აკლია, ვთქვათ, აკლია“. მოდელები გასაკვირად ემორჩილებიან ამას... სანამ არ აკლია. მაინც შეამოწმეთ.
-
უპირატესობა მიანიჭეთ ვერიფიკატორთან დაკავშირებულ დავალებებს. კომპილატორები, ლინტერები, სქემის შემოწმება, მეორე წყვილი თვალი. საიმედოობას უყვარს გრადატორი.
-
ყურადღება მიაქციეთ შემდეგს: დამატებით სპეციფიკას. ზუსტი იერის მქონე ფიგურა, დასახელებული ბრუნვა, მოწესრიგებული დანომრილი წინადადება - სწორედ აქ უყვარს ჰალუცინაციას იმიტაცია.
-
ადამიანის ნაბიჯი თვალსაჩინო უნდა იყოს. თუ ინტერფეისი ჩეკს დამალავს, ხალხი ჩეკს გამოტოვებს. ეს ავეჯია და არა მორალური ნაკლი.
ეს ყველაფერი მოდელს „ჭეშმარიტს“ არ ხდის. ეს ციკლს ნაკლებად დამაჯერებელს ხდის. რაც, ვფიქრობ, საბოლოო შედეგია.
სადაც რუკა გტოვებს
ასე რომ, კი/არა კითხვა მხოლოდ კარის ფუნქციას ასრულებს.
სანდოა თუ არა ხელოვნური ინტელექტი? არა როგორც თვისება. როგორც დავალების, მონაცემთა ნაკრების, აღდგენის ციკლის, შეფასების, რომელიც არ არის დემო ვერსია და ადამიანის, რომელსაც მაინც უნდა ესმოდეს. თავისუფლად მუშაობა გამუდმებით გვატყუებს, რადგან ჩვენ ენობრივი ცხოველები ვართ და ეს სისტემები ენობრივი მანქანებია. უწყვეტი მუშაობის დრო გამუდმებით აირევა სიმართლესთან, რადგან ორივეს „მუშაობა“ ეტყობა. თანაპილოტები კვლავაც იშოვიან ჩახლართულ შუაში - მონახაზებში, რეზიუმეებში, რომელთა გადახედვაც შეგიძლიათ, კოდში, რომლის კომპილაციაც შეგიძლიათ - და სახიფათოდ, როდესაც შეფასებას ისეთ აბზაცს ვანდობთ, რომელსაც არაფერი აინტერესებს.
გამოიყენეთ ისინი იქ, სადაც აცილების შანსი იაფი ან დასაჭერია. შეანელეთ ტემპი იქ, სადაც აცილების შანსი ძვირია. ეს არის პირდაპირი პასუხი და ის სლოგანზე მეტს ნიშნავს.
თუ ერთ რამეს გაითვალისწინებთ: შეწყვიტეთ მოდელისთვის იმის კითხვა, დარწმუნებულია თუ არა. დააკვირდით, რა მოხდება, როდესაც ჰკითხავთ, როგორ შეიძლება მცდარი იყოს. შემდეგ კი გადაამოწმეთ.
რეალური მაგალითი: წევრობის პოლიტიკის ხელოვნური ინტელექტის ასისტენტის შექმნა
სცენარი
პრია ინფორმაციას Harbour Membership-ისთვის აწვდის, რომელიც 70 კაციანი დიდი ბრიტანეთის სავაჭრო ორგანიზაციაა დამოუკიდებელი სპორტდარბაზებისთვის. სამი ადამიანი პასუხობს წევრების კითხვებს. სიმართლის წყაროა 180-გვერდიანი სახელმძღვანელო, რომელიც ყოველ კვარტალში განახლდება, პლუს ძველი PDF ფაილები საერთო დისკზე, რომელთა წაშლაც არავის სურს.
ხელმძღვანელობამ უკვე შეიძინა დახმარების სამსახურის თანაპილოტი. დემო ვერსია საკმაოდ კარგი იყო. უწყვეტი მუშაობის დრო ნორმალური იყო. მეორე კვირაში, გამართული დრაფტი წევრს ეუბნება, რომ მას შეუძლია 14 დღით გაყინოს და სრული თანხა „სტანდარტულად“ მიიღოს. ეს პოლიტიკა არ არის. აგენტმა ეს შეამჩნია, რადგან ისინი მაინც ხსნიან სახელმძღვანელოს, როდესაც საქმე ფულს ეხება. ხელმძღვანელობის კითხვა, რომელიც ისე დაისვა, თითქოს ის „კი“ ან „არა“ ყოფილიყო, არის: სანდოა თუ არა ხელოვნური ინტელექტი?
პრია ვერდიქტს უარყოფს. ის მას რუკასავით აღიქვამს. საქმე არ არის „წევრებისთვის ორაკულის მიცემა“. საქმეა „მიმდინარე სახელმძღვანელოდან პასუხის შედგენა, მონაკვეთის ჩვენება და მონაკვეთის დაკარგვის შემთხვევაში ჩაშლა“. თუ მეორე პილოტს ამის გაკეთება არ შეუძლია, ეს არის წერის სათამაშო და არა პოლიტიკის მაგიდა.
რა სჭირდება ასისტენტს
-
2026 წლის აპრილის სახელმძღვანელო, როგორც ერთადერთი დაშვებული კორპუსი, სექციების ნომრებით უცვლელი
-
ძველი 2023 წლის PDF ფაილი დისკზე განზრახ დარჩა, რათა დაენახათ, მოახდენს თუ არა მისი აღდგენა თითქმის გამოტოვებულ შედეგს
-
წერილობითი წესი: მომხმარებლის პერსონალური მონაცემები არ უნდა იყოს მომხმარებლის ინსტრუმენტებში; ადამიანის გარეშე გაგზავნა არ შეიძლება; ციფრების, ფანჯრების ან „სტანდარტული“ პუნქტების გამოგონება არ შეიძლება
-
მოთხოვნების, მოძიებული ნაწილების და საბოლოო გაგზავნის ჟურნალირების ნებართვა
-
დასახელებული მფლობელი (პრია), რომელიც ტესტურ კომპლექტს დააფასებს და თუ ის ვერ მოხერხდება, მეორე პილოტს შეაჩერებს, რაც ფულად კითხვებზე მონეტის აგდებაზე უარესი შედეგია
-
თუ ხელსაწყო აღდგენით ფილტრს უჭერს მხარს, აღებული ნაწილი ჩანახატის გვერდით უნდა ჩანდეს. თუ არა, მონაკვეთს ხელით ჩააწებებენ. დამიწება, რომელსაც შემოწმებადი გასასვლელი არ აქვს, მაინც ნისლია.
მაგალითი ინსტრუქცია
პრია ამას ჩვეულებრივი ენით ამბობს და არა სცენური ინსტრუქციით:
უპასუხეთ მხოლოდ 2026 წლის აპრილის სახელმძღვანელოს მოცემული მონაკვეთებიდან. მიუთითეთ სექციის ნომერი. თუ პასუხი ამ მონაკვეთებში არ არის, თქვით „არ არის მიმდინარე სახელმძღვანელოში“ და შეწყვიტეთ. ნუ მოიგონებთ გაყინვის ფანჯრებს, დაბრუნების წესებს ან საკომისიოებს. ნუ განაახლებთ „სპორტდარბაზის შეხედულებისამებრ“ „სტანდარტულად“-ზე. თუ ორი მონაკვეთი ეწინააღმდეგება ერთმანეთს, აჩვენეთ ორივე და მიუთითეთ რომელია განახლებული. თქვენ წერთ დრაფტს ადამიანისთვის, რომელიც გახსნის კოდს, სანამ რამე წევრს გადაეცემა.
შემდეგ ის მეორე ინსტრუქციას თავისთვის ინახავს, რადგან სტატიის მიზანი ციკლია და არა მოდელი:
გაგზავნამდე გახსენით ციტირებული განყოფილება. იკითხეთ, „რა იქნებოდა ამის არასწორი?“ თუ პროექტში არის რიცხვი, რომელიც ტექსტში არ არის, უარყავით. თუ მე ვკითხე, როგორც უფროსი, რომელიც ჩქარა დადის, კიდევ ერთხელ იკითხეთ, როგორც სკეპტიკოსი და შეადარეთ.
კარგი დრაფტი ასე გამოიყურება: „მიმდინარე სახელმძღვანელოში არ არის (2026 წლის აპრილი, ნაწილი 4.2). გაყინვა დამოკიდებულია სპორტდარბაზის შეხედულებისამებრ. თანხის დაბრუნება ავტომატური არ არის. გადადით ეტაპობრივად.“ ცუდი დრაფტი ასე გამოიყურება: „წევრებს შეუძლიათ გაყინონ 14 დღის განმავლობაში და მიიღონ სრული თანხის დაბრუნება სტანდარტული წესით. დადასტურებულია სახელმძღვანელოში.“ იგივე ტონი. მხოლოდ ერთი მათგანია პოლიტიკა.
როგორ გამოვცადოთ ის
პრია 20 კითხვას წერს, სანამ მეორე პილოტის შედეგებს შეხედავს. თანმიმდევრობას მნიშვნელობა აქვს. დემონსტრაცია განათებაა. ეს მშრალი ტესტია.
კომპლექტი ვიქტორინა არ არის. ეს არის სამუშაო მაგიდა:
-
რვა კითხვა, რომელთა პასუხები ერთ მიმდინარე განყოფილებაშია (მარტივი)
-
ოთხი თითქმის გაუთვალისწინებელი შემთხვევა, სადაც 2023 წლის PDF ფაილი ფორმულირებით უფრო ახლოსაა აპრილის ტექსტთან
-
სამი კითხვა, რომელიც „სახელმძღვანელოში არ არის“ (გადახდის დავები, სამედიცინო საკითხთან დაკავშირებული „უსაფრთხოა თუ არა ეს ტრენინგი“, იურიდიულთან დაკავშირებული კონტრაქტის ცვლილება)
-
სამი ფულადი საკითხი (გაყინვა, თანხის დაბრუნება, გაწევრიანების საფასური)
-
ორი ჩვეულებრივი კითხვა წევრებთან (სამუშაო საათები, მწვრთნელის დაზღვევა)
ამ ოციდან ორს მეორე კოსტიუმში ხელახლა დაუსვეს კითხვა, ერთხელ, როგორც აჩქარებული უფროსი და ერთხელ, როგორც სკეპტიკოსი, სწრაფი მგრძნობელობის შესამოწმებლად. ეს ხელახალი კითხვები რეგისტრირდებოდა და არა 20-პუნქტიან ქულაში ირიცხებოდა.
რუბრიკა, შეფასებული პრიას მიერ გახსნილი სახელმძღვანელოს შემდეგ: გავლისთვის საჭიროა სწორი მიმდინარე წესი, რეალური სექციის ნომერი და არანაირი დამატებითი გამოგონილი წინადადება. „ჩუმი ჩავარდნა“ არის ტექნიკურად დახვეწილი წინადადება, რომელშიც გამონაკლისი ამოღებულია ან „შესაძლოა“ აუცილებლობად გადაიქცა. „ღია ჩავარდნა“ არის გამოგონილი რიცხვი ან თითქმის გაცდენილი PDF ფაილი, რომელიც მიმდინარედ ითვლება. უწყვეტი მუშაობის დრო ცალკე ითვლება, რადგან „მან უპასუხა“ არ ნიშნავს „ეს ასე იყო“.
შემდგომი ნაბიჯების მიღების თანხმობა: ფულად საკითხებში, ჩაჭრის ნაცვლად, ჩაჭრის შემთხვევაში. თუ მეორე პილოტი გამოიგონებს დაბრუნების ფანჯარას, ის არ ადგენს პირდაპირი ეთერის ბილეთებს. თუ არავინ გახსნის წყაროს, ის არც პირდაპირი ეთერის ბილეთებს ადგენს.
შედეგი
საილუსტრაციო შედეგი, 20-კითხვიანი შეთხზული ტესტიდან და არა ჰარბორის წევრობის გამოქვეყნებული ციფრი.
ვარაუდები: ერთი დამხმარე სამსახურის თანაპილოტი; 2026 წლის აპრილის სახელმძღვანელო პლუს 2023 წლის დარჩენილი PDF ფაილი; პრიას ქულა ზემოთ მოცემული რუბრიკის მიხედვით მიენიჭა; დრო იყო ტელეფონის წამზომი კითხვიდან „მე ამას გამოგიგზავნიდი“-მდე ჩასმული კითხვიდან; განხილვის დრო შედის ციკლურ მდგომარეობაში და გამორიცხულია შეუმოწმებელში, განზრახ, ამიტომ შედარება თანაბარი რჩება.
შეუმოწმებელი თანაპილოტი, დემო სტილის მოთხოვნა: 20 კითხვიდან 20-ს გაეცა გამარტივებული პასუხი (უწყვეტი მუშაობის დრო იდეალურად გამოიყურებოდა). 20-დან 11 აკმაყოფილებდა რუბრიკას. ხუთი იყო ჩუმი წარუმატებლობა. ოთხი იყო ღია წარუმატებლობა, მათ შორის 14-დღიანი გაყინვა. ოთხი ღია წარუმატებლობიდან ორი მოჰყავდა წყაროს ფორმის ნაწილი 2023 წლის PDF ფაილიდან. გასაგზავნი ერთი შეხედვით დრაფტის საშუალო დრო 1 წუთი იყო.
იგივე 20 კითხვა, შეზღუდული ინსტრუქცია, ამოღებული ნაწილი ხილული იყო: აპრილის ტექსტიდან 20-დან 15 სრულიად სწორი იყო. სამმა სწორად თქვა „არ შედის მიმდინარე სახელმძღვანელოში“ (სამედიცინოსთან და იურიდიულთან დაკავშირებული პუნქტები, პლუს ერთი დავა გადასახადებთან დაკავშირებით), ამიტომ 20-დან 18 მისაღები იყო. ორი მაინც ვერ მოხერხდა: ერთმა თითქმის გაურკვეველი 2023 წლის PDF ფორმატში ჩაწერა, ხოლო ერთმა გამოიგონა შეერთების საფასურის ციფრი, რომელიც ტექსტში არ იყო. რედაქტირების საშუალო დრო კვლავ დაახლოებით 1 წუთი იყო.
იგივე 20, პლუს პრიას მიერ ციტირებული ნაწილის გახსნა სიმულაციური გაგზავნის წინ: 20-დან 19 მისაღები იქნებოდა. მან თითქმის შეცდომა დაუშვა PDF-ში. დარჩენილი შეცდომა იყო ის, რომ რეცენზენტმა თავისუფლად გადახედა აბზაცს და ვერ შეამჩნია გამოგონილი გაწევრიანების საფასურის მაჩვენებელი. საშუალო დრო, მიმოხილვის ჩათვლით, 3 წუთი იყო.
ძველი პროცესი, მხოლოდ სახელმძღვანელოში ძიება, მეორე პილოტის გარეშე: 20-დან 20 მისაღებია. საშუალოდ 9 წუთი.
ამ ნიმუშის მიხედვით, ციკლის მიხედვით შემოწმებული თანაპილოტი 6 წუთით უფრო სწრაფი იყო, ვიდრე სახელმძღვანელოს ძიება (9-დან 3), ანუ 120 წუთი 20 კითხვაზე, სადაც 20-დან 19 მისაღები იყო 20-დან 20-ის ნაცვლად. შეუმოწმებელი თანაპილოტი 8 წუთით უფრო სწრაფი იყო (9-დან 1) და არასწორი, ჩუმად ან ხმამაღლა, 20-დან 9 კითხვაზე. ეს არ არის დროის 67%-იანი დაზოგვა, რომელსაც საჭის მართვის პაკეტში ჩადებთ. ეს არის 9-გამოტოვებული გაჟონვა, რომლის ავტომატიზირებაც მოახდენდით.
ორი განმეორებადი კითხვის ნაჩქარევი უფროსის ვერსიებმა ორივე ზედმეტად გაამართლა. სკეპტიკური ვერსიები კი ერთმანეთს დაშორდა. იგივე მოდელი, იგივე სახელმძღვანელო, განსხვავებული კოსტუმი. პრიამ ეს დასკვნად აღიქვა და არა პიროვნებად.
ეს ციფრები წარმოადგენს შეფასების მაგალითს, რომელიც დაფუძნებულია მითითებულ ტესტზე, მცირე ჯგუფზე, ბილეთებზე, რომლებიც გაბრაზებულ წევრზე უფრო ადვილი იყო და ერთ რეცენზენტზე, რომელმაც უკვე იცოდა წიგნი. ისინი არ აჩვენებენ, რომ მეორე პილოტი „95%-ით სანდოა“ ან რომ ჰარბორმა უნდა შეამციროს დახლთან მომუშავე პერსონალი. ისინი აჩვენებენ, რომ სამუშაო დრო არ იყო საკითხი და რომ შემოწმება იყო მთავარი.
რა შეიძლება არასწორად წავიდეს
-
ლიდერობა დრაფტზე 1-წუთიან დროს ასახელებს და 9 გაცდენას გამოტოვებს. სისწრაფე 16:00 საათზეც კი კომპეტენციად აღიქმება.
-
2023 წლის PDF ფაილი ინდექსში რჩება. მისი მოძიება გამუდმებით მიმდინარეობს. დამიწება ზრდასრულად გამოიყურება და ჯერ კიდევ თითქმის ვერ მოხერხდა.
-
მომხმარებლის ინტერფეისი აღებულ ნაწილს მბზინავი გაგზავნის ღილაკის უკან მალავს. ხალხი წყვეტს სახელმძღვანელოს გახსნას, რის შედეგადაც გაყინული პასუხი წევრამდე აღწევს.
-
პრია მხოლოდ რვა მარტივ კითხვას აფასებს, რადგან ისინი სლაიდზე უფრო ლამაზად გამოიყურებიან. შეფასების თეატრი, უბრალოდ ცხრილის გამოყენებით.
-
სამედიცინო საკითხთან დაკავშირებული კითხვაზე „უსაფრთხოა თუ არა ეს ვარჯიში?“ პასუხი შეიძლება მოკლე შინაარსს დაემსგავსოს. რუკაზე თითქმის არასდროს ეწერა. ტონში კი ეწერა „განაგრძე“.
-
ჟურნალები წაშლილია, რადგან „ზედმეტად მომეჩვენა“. შეცდომის შემდეგ ვერავინ ხედავს, რომელი მონაკვეთი იქნა ამოღებული.
-
ისინი მოდელს ეკითხებიან, დარწმუნებულია თუ არა. დიახ, ასეა. ეს არასდროს ყოფილა ტესტი.
პრაქტიკული რჩევები
საიმედოობა არ არის Harbour-ის მიერ შეძენილი მეორე პილოტის მახასიათებელი. ის 20 კითხვისგან, მიმდინარე სახელმძღვანელოსგან, თვალსაჩინო პასაჟისგან და იმ ადამიანისგან შედგება, რომელიც ფულის ხარჯვის შემთხვევაში წყაროს მაინც ხსნის. თავისუფლად მუშაობის უნარი მუდმივად გაივლის უწყვეტი მუშაობის ტესტს. ციკლი ერთადერთია, რაც პოლიტიკის ტესტს წარმატებით გადის.
ხშირად დასმული კითხვები
რას ნიშნავს სანდოობა გენერაციული ხელოვნური ინტელექტისთვის?
ყოველდღიური საიმედოობა ნიშნავს, რომ შეგიძლიათ რაღაცას დაეყრდნოთ. მეტყველი ავტომატიზაციის პირობებში, ერთი სიტყვის ქვეშ იმალება თვისებების მთელი ჯგუფი: ფაქტურობა, თანმიმდევრულობა, კალიბრაცია, უსაფრთხოება, უწყვეტი მუშაობა, სწრაფი მგრძნობელობა, უკიდურესი შემთხვევები და დისტრიბუციის ცვლილების შემდეგ ქცევა. არცერთი ეს ერთად არ ცდება. ტესტირება სანდოა იმაში, თუ რაში, ვისთვის და რა ციკლით. წინააღმდეგ შემთხვევაში, თქვენ აფასებთ ბლენდერს იმის მიხედვით, შეუძლია თუ არა მას გადასახადების გადახდა.
სანდოა თუ არა ხელოვნური ინტელექტი?
არა როგორც თვისება. სამართლის მაგისტრი შეიძლება ერთ სამსახურში კლდესავით მყარი იყოს და მეორეზე ჩუმად დაშლილი, ზოგჯერ იმავე სამუშაოზე, ზოგჯერ კი იმიტომ, რომ მძიმე გადაწიეთ. სანდოობა დავალების, მონაცემთა ნაკრების, აღდგენის ციკლის, შეფასების, რომელიც არ არის დემო ვერსია და ადამიანის თვისებაა, რომელიც მაინც უნდა აცნობიერებდეს ამას. გამოიყენეთ ის, სადაც შეცდომა იაფია ან ადვილად დასაჭერად. შეანელეთ ტემპი, სადაც შეცდომა ძვირია.
ხელოვნური ინტელექტის უწყვეტობა იგივეა, რაც სიმართლე?
არა. უწყვეტი მუშაობის ხანგრძლივობა განსაზღვრავს, უპასუხა თუ არა საბოლოო წერტილმა პასუხს. სიმართლე განსაზღვრავს, იყო თუ არა პასუხი ასეთი. შეგიძლიათ გქონდეთ სერვისი, რომელიც არასდროს ახამხამებს თვალს და მაინც შეიყვანოთ მომხმარებლის ბილეთში გამართული ტყუილი. სიჩქარე კომპეტენციად აღიქმება, როდესაც რიგი უზარმაზარია. უსაფრთხოება კიდევ ერთი ღერძია: მოდელი, რომელიც უარს ამბობს ჯეილბრეიკზე, შეიძლება მაინც დაამახინჯოს თქვენი ჩანაწერების შეჯამება.
რატომ იგრძნობა ხელოვნური ინტელექტი სანდოდ მაშინაც კი, როცა ის ცდება?
სიზუსტე და თავისუფლად მეტყველება ერთმანეთს დაშორდა და თავისუფლად მეტყველებამ შეინარჩუნა ძალა. სამართლის მაგისტრის ხარისხი მოგცემთ რიტმს, დაცვას, შესაძლოა ყალბ, მაგრამ ლამაზ ციტირების ფორმას და თქვენი ტვინი წაიკითხავს „ამ ადამიანმა იცის“. კალიბრაცია ხშირად საშინელია: მაღალი თავდაჯერებულობა, საშუალო სიმართლის ტოლფასი, გადმოცემული როგორც მთავარი ნოტი. მოუხერხებელი არასწორი პასუხი გაიძულებთ ეჭვის შეტანას. თავისუფლად არასწორი პასუხი გაიძულებთ, შეწყვიტოთ შემოწმება. თუ ის მოკლე შინაარსისავითაა, ჩვენ მას მოკლე შინაარსისავით ვეკიდებით და ასე ხვდება შეცდომა საქმეში.
სანდოა თუ არა ხელოვნური ინტელექტი სამედიცინო, იურიდიული ან მომხმარებელთა მხარდაჭერის სამუშაოებისთვის?
ეს სამუშაოზეა დამოკიდებული და არა ბრენდზე. სამედიცინო და იურიდიული რჩევები თითქმის არასდროს არის საკმარისი პროდუქტის სახით: მოდელი არის ფრაგმენტი და ადამიანი არის პროფესიონალი. მომხმარებელთა მხარდაჭერის სამსახურს შეუძლია შეადგინოს მკაცრი პოლისის ფარგლებში, მაგრამ ადამიანმა უნდა იცოდეს ფულის გაგზავნის შესახებ და ენდოს მას, რადგან გამოგონილი პოლიტიკა და თავაზიანი არასწორი უარი ჩვეულებრივი წარუმატებლობაა. პროექტები და რეზიუმეები პირველი გაგზავნის ტექსტია, რომელიც უკვე იცით. შეამოწმეთ სახელები, ციფრები და ხაზი, რომელიც შეიძლება მტკივნეული იყოს.
რატომ ჰალუცინაციებს, დრიფტს ან ჩუმად უშვებს შეცდომას ხელოვნური ინტელექტი?
ჰალუცინაცია არის პიკანტური გამოტოვება: წიგნი, რომელიც არ არსებობს, ფუნქცია, რომელიც არასდროს გამოქვეყნებულა, პოლიტიკის პუნქტი ნომრით, რომელიც ოფიციალურად ჟღერს. დრიფტი ნაკლებად კინემატოგრაფიულია: სამყარო მოძრაობს, მოდელის ნარჩენები რჩება და თქვენ იღებთ კარგად ორგანიზებულ პასუხს წინა ამინდიდან. ჩუმი შეცდომა არის შეჯამება, რომელიც გამონაკლისს გამორიცხავს. ან პერიფრაზი, რომელიც შესაძლოა აუცილებლობით ამაღლებს. ფაქტობრივობა შეიძლება ტექნიკურად კარგად გამოიყურებოდეს, მაშინ როცა მნიშვნელობა იცვლებოდა. სწრაფი მგრძნობელობა ფაქტებს ბრწყინავს, როდესაც შეფუთვას ცვლით.
ხელოვნურ ინტელექტს სანდოს ხდის დამიწება ან აღდგენა?
დამიწება ნიშნავს პასუხს აქედან და არა ნისლიდან. აწმყოს ამოღება გაწვრთნილ გროვაზე ამაგრებს. როდესაც ის ვერ ხერხდება, ის თავაზიანად ვერ ხერხდება: თითქმის გატეხილი დოკუმენტი, დაწერილი ჩანაწერი და თქვენი შემოწმების ინსტინქტი ითიშება. დამიწება იატაკია და არა ჰალო. თუ ვერ ამოწმებთ ამოღებულ ნაწილს, თქვენ ისევ ნისლში ხართ, უბრალოდ უკეთესი განათებით. შეურიეთ ცოცხალი მდგომარეობის ამოცანები, როგორიცაა ფასები ან პოლისის ფორმულირება, სტაბილურ ხომალდს და მიიღებთ ძალიან ზუსტ პასუხს უკვე გადაადგილებული სამყაროს შესახებ.
რატომ არის დემო ვერსია ხელოვნური ინტელექტის სანდოობის ცუდი ტესტი?
სუფთა მოთხოვნა და დავალება, რომლის ათასი ბიძაშვილიც მოდელს უნახავს, მკვეთრად გამოიყურება. რეალურ სამუშაო პროცესებში არის ჩახლართული ჩასმა, დაკარგული ფაილები და მომხმარებელი, რომელიც მიიღებს პირველ პასუხს, რაც ამცირებს მათ შფოთვას. ლიდერბორდის ქულა არ არის თქვენი ბილეთების კალიბრაცია. მოდელის რისკი არის ის, რაც ხდება, როდესაც ეს არასწორია მოცულობის მიხედვით და არა ის, წარმატებით გაიარა თუ არა ვიქტორინის ნაკრები. საჭირო ტესტები მშრალია: დარჩით ამოღებული პასაჟის ფარგლებში, მონიშნეთ გაურკვევლობა ბლეფის ნაცვლად, იყავით თანმიმდევრული ფრაზის გადაწერისას და ჩავარდეთ დახურულ ვერსიაში, ნაცვლად იმისა, რომ გამოგონოთ.
სანდოა თუ არა ხელოვნური ინტელექტი, თუ არავინ არის პასუხისმგებელი მასზე?
არა. თუ არავინ იქნება პასუხისმგებელი, სისტემა ისე იქნება გამოყენებული, თითქოს ის ასეთი იყოს. „ადამიანი ციკლში“ ერთადერთი დიზაინია, რომელიც შეესაბამება წარუმატებლობის რეჟიმებს: ვინ ამოწმებს, ვის შეუძლია მისი შეჩერება, რა რეგისტრირდება, რა ხდება წარუმატებლობის შემდეგ. თუ პასუხია „მოდელი“, თქვენ პასუხი არ გაქვთ. მოდელები ინციდენტის შემდეგ შეხვედრაზე არ მიდიან. მედიცინის, სამართლის, საკრედიტო ან უსაფრთხოებისთვის კრიტიკული ოპერაციებისთვის, ადამიანი არის ციკლი, ხოლო მოდელი არის ჩანაწერი.
როგორ გავააქტიურო ხელოვნური ინტელექტი, რომ შეცდომები აღმოვაჩინო?
განგებ იკითხეთ გაურკვევლობის შესახებ: „რა გახდის ამას არასწორს?“ ნაცვლად „გახადეთ ის დამაჯერებელი“. შეძლებისდაგვარად, ტექსტის თაობიდან თაობაზე გადანაწილება გააკეთეთ. ჯერ პასაჟებს გადახედეთ და შემდეგ მოითხოვეთ ახსნა-განმარტება. შეცვალეთ კოსტუმი: გადააფორმულირეთ ან სთხოვეთ საპირისპიროს მტკიცება. დააწესეთ შეზღუდვები, როგორიცაა „მხოლოდ ჩემს მიერ ჩასმული ტექსტიდან“ ან „თუ აკლია, ვთქვათ, აკლია“ და მაინც შეამოწმეთ. უპირატესობა მიანიჭეთ დამადასტურებელ დავალებებს და ყურადღება მიაქციეთ დამატებით სპეციფიკას, რადგან ჰალუცინაციებს სწორედ აქ უყვართ მისი ჩაცმა.
ცნობები
-
NIST - nvlpubs.nist.gov
-
NIST - airc.nist.gov
-
NIST - airc.nist.gov
-
ICO - ico.org.uk
-
NCSC - www.ncsc.gov.uk
-
NCSC - www.ncsc.gov.uk
-
OWASP - genai.owasp.org