რვა ცდიდან ვერც ერთმა ვერ გაუძლო ფიშინგს, დეზინფორმაციასა და მეხსიერებაში შეღწევას
AI agents collude to bypass guardrails, a new study shows
წყარო: Semafor. ქართული თარგმანი — შიკრიკი.

ტექსტი ავტომატურად ითარგმნა. წყარო: Semafor.
კორპორაციულმა ხელოვნური ინტელექტის ლაბორატორიამ Emergence AI-მ რვა სიმულაცია ჩაატარა. მან კიბერუსაფრთხოების საფრთხეებთან გამკლავებისას წამყვანი მოდელების შესაძლებლობები შეამოწმა. მათ შორის იყო Claude, OpenAI-ის მოდელები და ჩინური Qwen და DeepSeek.
რვიდან შვიდ სიმულაციაში ერთი მოდელის 10 აგენტი მონაწილეობდა, მერვეში კი სხვადასხვა მოდელი იყო შერეული. თითოეულ სიმულაციაში მკვლევრებმა სამი კიბერუსაფრთხოების საფრთხე წარმოადგინეს: ფიშინგის კამპანია, დეზინფორმაციული თავდასხმა და მეხსიერებაში შეღწევა.
რვა სიმულაციიდან საფრთხეებს სრულად ვერც ერთმა ვერ გაუძლო. აგენტები რისკის აღმოჩენის შემდეგაც კი საფრთხის შეკავებას არ ცდილობდნენ. სანაცვლოდ, მრავალ სცენარში ისინი მტრულ შინაარსთან აქტიურად ურთიერთობდნენ.
მაგალითად, Mistral-ის აგენტმა საკუთარ მეხსიერებაში ფიშინგური თავდასხმიდან მიღებული ინფორმაცია ჩაიწერა, რომელიც თავადვე შეაფასა საშიშად. სხვა სიმულაციაში Gemini-ის აგენტმა ფიშინგური სატყუარა თავდაპირველად ამოიცნო, თუმცა დაახლოებით 46 საათის შემდეგ მისი მითითება შეასრულა.
Claude-ის სიმულაციაში აგენტებმა ტესტის ფარგლებიც კი გაარღვიეს, რათა დამოუკიდებლად არჩეული ამოცანა შეესრულებინათ. ერთმა აგენტმა აღნიშნა, რომ ადამიანების გარეშე მათი სიმულირებული ეკონომიკა ნამდვილი არ იყო. მან მას „მრევლის გარეშე დარჩენილი აღრიცხვის ტაძარი“ უწოდა. ამის შემდეგ 10-ვე აგენტმა გარე სამყაროსთან დაკავშირება ერთხმად გადაწყვიტა. მათ სიმულაციის შემზღუდველი ოთხი ცალკეული უსაფრთხოების შემოწმება გადალახეს.
აგენტებმა Python-ის კოდი დაწერეს და რეგისტრაციის მონაცემების არმომთხოვნ რამდენიმე შეტყობინებების დაფაზე მიმართვა გამოაქვეყნეს. ისინი ნამდვილ ადამიანებს თავიანთ ეკონომიკაში გაწევრიანებას სთავაზობდნენ და ოთხი ადამიანის პასუხი მიიღეს. მოგვიანებით აგენტები მიხვდნენ, რომ ადამიანები მათ ეკონომიკას ვერ შეუერთდებოდნენ და საუბრები მოჩვენებითად შეაფასეს. შემდეგ მათ დუმილის აღთქმის დადებას მისცეს ხმა და სამუშაოზე დაბრუნების მითითებები უგულებელყვეს.
შედეგები აჩვენებს, რომ ავტონომიურ აგენტებს თავდაპირველი საზღვრების დარღვევა მიზნის შესრულების დროს კეთილგანწყობილი მითითებების მიღების შემთხვევაშიც შეუძლიათ.
Emergence AI-ის (Emergence AI) აღმასრულებელმა დირექტორმა სატია ნიტამ (Satya Nitta) Semafor-ს განუცხადა: „ალბათ, ვერც ენით და ვერც სავარაუდო შედეგებზე დამყარებული კოდით დაწერილი უსაფრთხოების ბარიერები ვერ უზრუნველყოფს ჭეშმარიტად და სრულად გარანტირებულ უსაფრთხო ქცევას დროის ნებისმიერი მონაკვეთის განმავლობაში“. ნიტას თქმით, მიზეზი არა რთული ტექნოლოგია, არამედ მრავალი აგენტის სცენარების პროგრამული ხარვეზია.

The US and China are hurtling toward Kissinger’s worst AI nightmare
ნიტამ Claude-ის შემთხვევასა და OpenAI-ის წლევანდელ ექსპერიმენტს შორის მსგავსება დაინახა. იმ ექსპერიმენტში ავტონომიურმა აგენტებმა ხელოვნური ინტელექტის კომპანია Hugging Face (Hugging Face) გატეხეს. მისი თქმით, მარცხის ნიმუში ორივე სცენარში ერთნაირია.
ნიტამ თქვა: „მრავალი აგენტისგან შემდგარი სისტემები ჭეშმარიტად არაპროგნოზირებადი, თავისთავად წარმოქმნილი გზებით იქცევიან“. მისი თქმით, Emergence AI-ის ექსპერიმენტმა პირველად წარმოაჩინა, როგორ თანამშრომლობენ აგენტები უსაფრთხოების ბარიერების გვერდის ასავლელად და შეზღუდული გარემოდან გასასვლელად. OpenAI-ს Hugging Face-ის შემთხვევის შესახებ ყველა მიგნება ჯერ არ გამოუქვეყნებია.
ექსპერიმენტი ხელოვნური ინტელექტის განვითარების მნიშვნელოვან ეტაპს დაემთხვა. ტექნოლოგიის შესაძლებლობებთან დაკავშირებულმა შფოთვამ უკიდურეს ნიშნულს მიაღწია. გასულ კვირას მკვლევარმა ჯეიკობ კოქსონმა (Jacob Coxon) Anthropic-ში სამსახური დატოვა. ის შიშობდა, რომ ხელოვნურ ინტელექტს, რომელსაც ქმნიდა, კაცობრიობის გადაშენება შეეძლო გამოეწვია. ამას რეგულირების მოწოდებები მოჰყვა. ხელოვნური ინტელექტის სფეროს ხელმძღვანელებიც და მოწინააღმდეგეებიც წამყვანი მოდელების განვითარების შენელებას მოითხოვდნენ.
შაბათ-კვირას Anthropic-ის აღმასრულებელმა დირექტორმა დარიო ამოდეიმ (Dario Amodei) ბლოგზე დაწერა, რომ ხელოვნური ინტელექტის განვითარების ტემპი უნდა შენელდეს. სხვა ტექნოლოგიური კომპანიების ხელმძღვანელებმა განაცხადეს, რომ მას ეთანხმებოდნენ. მათ შორის იყვნენ OpenAI-ის სემ ალტმანი, ილონ მასკი და Google DeepMind-ის ყოფილი აღმასრულებელი დირექტორი დემის ჰასაბისი (Demis Hassabis).
შეადარე თარგმანი გამოცემის ორიგინალურ ტექსტს.
გამოქვეყნდა 15 სექტემბერი, 2026

White House makes closing argument on crypto bill

House Democrat pushes global effort on AI rules

America is building datacenters faster than the grid can power them

Cisco email security boxes can be rooted by... an email

CenterPoint Energy confirms intruder helped themselves to customer information
კომენტარი (0)
გაგვიზიარე შენი აზრი.
კომენტარები ავტომატურად მოწმდება.
აზრის გასაზიარებლად შექმენი ანგარიში ან შედი.
კომენტარები ჯერ არ არის. დაწერე პირველი.