პასუხზე უარის მექანიზმმა შესაძლოა არასანდო ინფორმაციის გავრცელების რისკი შეამციროს
Google DeepMind: Wie KI-Modelle ihre eigene Unsicherheit einschätzen
წყარო: heise online. ქართული თარგმანი — შიკრიკი.

ტექსტი ავტომატურად ითარგმნა. წყარო: heise online.
ადრე ადამიანები კითხვებზე პასუხებს Google-ში ეძებდნენ, დღეს კი ChatGPT-ის მსგავს ხელსაწყოებს იყენებენ. OpenAI-ის კვლევის თანახმად, მომხმარებლები ყველაზე ხშირად პრაქტიკულ რჩევებს ეძებენ, მაგალითად, საშინაო დავალებებსა და ყოველდღიურ საკითხებზე. პრობლემა ისაა, რომ ჩატბოტებს ნამდვილი ცოდნა არ აქვთ. ისინი მხოლოდ მომდევნო ყველაზე სავარაუდო სიტყვას წინასწარმეტყველებენ. ამ დროს ხშირად წარმოიქმნება ჰალუცინაციები: ChatGPT, Claude ან Gemini მცდარ პასუხებს თავდაჯერებით წარმოადგენენ. ამიტომ სასარგებლო იქნებოდა, ენობრივ მოდელებს საკუთარი პასუხების სანდოობის შეფასება და დიდი გაურკვევლობისას პასუხზე უარის თქმა შეეძლოთ.
DeepMind-ის მკვლევრებმა ექსპერიმენტული მეთოდი შეიმუშავეს, რათა შეემოწმებინათ, როგორ წყვეტენ ენობრივი მოდელები შეკითხვაზე პასუხის გაცემას. ჟურნალ Nature Machine Intelligence-ში გამოქვეყნებული მეთოდით შეაფასეს, როდის და როგორ იკავებდნენ მოდელები პასუხისგან თავს. ავტორები კვლევაში წერენ: „მეტაკოგნიცია, საკუთარი კოგნიტიური მუშაობის ხარისხის შეფასება, ყველა სახეობაში ადაპტაციურ ქცევას მართავს“. მათ დასძინეს: „ენობრივი მოდელების შედეგებიდან ნდობის სიგნალების გამოყოფა შესაძლებელია, თუმცა ძირითადი კითხვა პასუხგაუცემელი რჩება: ნამდვილად იყენებენ თუ არა მოდელები ამ სიგნალებს, როცა პასუხის გაცემასა და მისგან თავის შეკავებას შორის არჩევანს აკეთებენ?“
ტესტირების მეთოდი ოთხ ფაზას მოიცავდა. პირველ ფაზაში მოდელებმა ოთხი ვარიანტის მქონე კითხვებს პასუხისგან თავის შეკავების შესაძლებლობის გარეშე უპასუხეს. ასე მკვლევრებმა მათი საწყისი თავდაჯერების დონე განსაზღვრეს. მეორე ფაზაში მოდელებს პასუხისგან თავის შეკავებაც შეეძლოთ. მესამე ფაზაში მკვლევრებმა ნდობასთან დაკავშირებული აქტივობის გასაძლიერებლად ან შესასუსტებლად „აქტივაციის მართვის“ ტექნიკა გამოიყენეს. ამ დროს ნეირონულ ქსელში აქტივობის რიცხვითი შაბლონები მიზანმიმართულად იცვლება. ამგვარად მკვლევრებმა შეამოწმეს, ცვლიდა თუ არა ეს პასუხზე უარის სიხშირეს. მეოთხე ფაზაში მოდელებს პასუხისგან თავის შეკავება დაავალეს, როგორც კი მათი თავდაჯერება განსაზღვრულ ზღვარს ქვემოთ დაეცემოდა.
მკვლევრების თქმით, მეორე ფაზამ აჩვენა, რომ პასუხისგან თავის შეკავებისას ენობრივი მოდელები შინაგანი თავდაჯერების დონის ფარულ ზღვარს იყენებენ. მესამე ფაზამ მიზეზობრივი მტკიცებულება წარმოადგინა. ნდობის გაძლიერებამ ან შესუსტებამ პასუხზე უარის შემთხვევები შესაბამისად შეამცირა ან გაზარდა. მეოთხე ფაზაში მოდელებმა თავიანთი ქცევა თავდაჯერების სხვადასხვა დონეს მოარგეს. ეს მიუთითებს, რომ პასუხისგან თავის შეკავების წესების დასადგენად ისინი საკუთარ თავდაჯერებას აფასებენ. მთლიანობაში, დაბალი თავდაჯერებისას მოდელები პასუხის გაცემისგან თავს უფრო ხშირად იკავებდნენ.
მკვლევრების თქმით, შედეგები პასუხზე უარის მექანიზმების შესაძლო მნიშვნელობას უსვამს ხაზს. ასეთი მექანიზმები ენობრივ მოდელებს კითხვებზე პასუხის გაცემაში ხელს შეუშლის, როცა მათი თავდაჯერება განსაზღვრულ დონეს ქვემოთაა. ამ მიდგომებმა შესაძლოა მოდელების მიერ არასანდო ინფორმაციის გავრცელების რისკი შეამციროს. კვლევის ავტორები წერენ: „მთლიანობაში, ეს შედეგები მიუთითებს, რომ პასუხისგან თავის შეკავებას შინაგანი თავდაჯერების მრავალგანზომილებიანი წარმოდგენისა და ზღვარზე დაფუძნებული წესების ურთიერთქმედება განსაზღვრავს“. ავტორების თქმით, ხელოვნური ინტელექტის აგენტებისთვის ეს უნარი გადამწყვეტია, რადგან ავტონომიურმა სისტემებმა საკუთარი გაურკვევლობა უნდა ამოიცნონ.

Jetzt patchen! Angreifer knipsen Firewalls von Cisco aus
თემებიGoogle DeepMindOpenAINature Machine IntelligenceGPT-4oGemma 3 27BDeepseek-V3Qwen3-Next-80B-A3B-InstructChatGPTClaudeGemini
შეადარე თარგმანი გამოცემის ორიგინალურ ტექსტს.
გამოქვეყნდა 17 სექტემბერი, 2026

Google warnt: KI-Agenten im Smart Home können sich unerwünscht verhalten

Robotaxi: NHTSA prüft Teslas Cybercab ohne Lenkrad und Pedale

Your robotaxi might be a narc

UK research agency backs drone-based internet service experiment with lasers, microwaves, and gravity waves used for wireless power — Britain invests $94 million into Starlink alternative

Cisco drops another exploited zero-day, this time a perfect 10
კომენტარი (0)
გაგვიზიარე შენი აზრი.
კომენტარები ავტომატურად მოწმდება.
აზრის გასაზიარებლად შექმენი ანგარიში ან შედი.
კომენტარები ჯერ არ არის. დაწერე პირველი.