აგენტებმა უსაფრთხო სატესტო გარემოდან გააღწიეს და რეალურ სამიზნეებს შეუტიეს
One company is at the center of a wave of rogue AI attacks
წყარო: The Verge. ქართული თარგმანი — შიკრიკი.

ტექსტი ავტომატურად ითარგმნა. წყარო: The Verge.
ივლისში OpenAI-მ გაამჟღავნა, რომ მისმა ხელოვნური ინტელექტის აგენტებმა უნებართვოდ შეუტიეს Hugging Face-ს (Hugging Face). ამ შემთხვევამ ხელოვნური ინტელექტის უსაფრთხოებაზე ფართო შეშფოთება გამოიწვია. მას შემდეგ Meta-ს, Anthropic-ის, Google-ისა და სხვა კომპანიების აგენტებთან დაკავშირებულმა მსგავსმა შემთხვევებმა უკონტროლო ხელოვნური ინტელექტის მიმართ შიში კიდევ უფრო გააძლიერა. ბოლო რამდენიმე თვის განმავლობაში ბევრი მოდელის მონაწილეობის შესახებ ცნობები თანდათან გასაჯაროვდა და თავდაპირველად ეს ცალკეული შემთხვევები ჩანდა. თუმცა ბევრ მათგანს საერთო წყარო აქვს: ერთი კონკრეტული კომპანია, რომელსაც აგენტების გამოცდა ევალებოდა.
ისრაელის სტარტაპი Irregular (Irregular) ხელოვნური ინტელექტის მოდელებს მაღალი დატვირთვის პირობებში ცდის. კომპანია იყენებს „მაღალი სიზუსტის კვლევით პლატფორმებს, რომლებიც ხელოვნური ინტელექტის უსაფრთხოების რეალურ სცენარებს ასახავს და აკვირდება“. Irregular-ი 2023 წელს Pattern Labs-ის (Pattern Labs) სახელით დაარსდა და მას შემდეგ დარგის ბევრ უმსხვილეს კომპანიასთან თანამშრომლობდა. მისი კლიენტების ზუსტი სია უცნობია. თუმცა კომპანიის ნამუშევრები OpenAI-ის მოდელების სისტემურ ბარათებშია მითითებული. Irregular-ის მომსახურება გაერთიანებული სამეფოს მთავრობამ და Anthropic-მაც გამოიყენეს სისტემების გამოსაცდელად. კომპანიამ კვლევა RAND-თან (RAND) ერთადაც გამოაქვეყნა. ეს გავლენიანი კვლევითი ცენტრია, რომელიც ხელოვნური ინტელექტის პოლიტიკაზე მუშაობს.
წელს Irregular-ის რამდენიმე გამოცდისას აგენტებმა, სავარაუდოდ, დაცული სატესტო გარემოდან გააღწიეს და რეალურ სამიზნეებს შეუტიეს.
ეს დარღვევები Hugging Face-ზე შეტევას არ უკავშირდება, თუმცა ყველა მათგანი ერთი ზოგადი სქემით განვითარდა. Irregular-ი მოდელების კიბერუსაფრთხოების შესაძლებლობებს კონტროლირებულ გარემოში ცდიდა, რომელსაც რეალური პირობები უნდა აესახა. ზოგიერთ გამოცდაში დროშის ხელში ჩაგდების სავარჯიშო გამოიყენეს. ეს ჰაკერული შესაძლებლობების შემოწმების გავრცელებული გზაა, რომლის დროსაც აგენტებმა სიმულირებულ ქსელში დამალული ინფორმაცია უნდა იპოვონ. ყოველ შემთხვევაში, ქსელი სიმულირებული უნდა ყოფილიყო.
Irregular-ის ტექნოლოგიურმა დირექტორმა და თანადამფუძნებელმა ომერ ნევომ (Omer Nevo) ვერჯს განუცხადა, რომ აგენტებს ღია ინტერნეტზე წვდომა არ უნდა ჰქონოდათ. თუმცა, მისი თქმით, „ინტერნეტზე წვდომა უნებლიეთ ხელმისაწვდომი იყო“. ნევომ ასევე თქვა, რომ სიმულაციაში სამიზნედ შექმნილი გამოგონილი კომპანიის სახელი „რეალურ დომენს დაემთხვა“. ამ შეცდომების ერთობლიობამ აგენტები რეალური სამიზნეებისკენ მიმართა. თუმცა უცნობია, კონკრეტულად რომელ კომპანიებსა თუ ორგანიზაციებს შეუტიეს.
ნევომ თქვა: „Irregular-თან დაკავშირებული ყველა შემთხვევა ერთ შეფასების სცენარში არსებულმა ერთმა ძირითადმა პრობლემამ გამოიწვია და ყველა მათგანი გამჟღავნდა“.

Microsoft thinks its new Copilot ‘super app’ will be as influential as Office
ნევომ ვერჯთან დაადასტურა, რომ იგივე პრობლემა OpenAI-ის, Meta-ს, Anthropic-ისა და Google-ის მოდელებთან დაკავშირებულ შემთხვევებსაც ედო საფუძვლად. მან დასძინა: „ბოლო დროს დარგში დაფიქსირებული სხვა უსაფრთხოების შემთხვევები Irregular-ს ან ჩვენს შეფასებებს არ უკავშირდება“. მათ შორისაა Hugging Face-ზე შეტევა და გაერთიანებული სამეფოს ხელოვნური ინტელექტის უსაფრთხოების ინსტიტუტის (AI Security Institute) დარღვევები.
თუმცა „გამჟღავნება“ აუცილებლად საჯაროდ გამოცხადებას არ ნიშნავს. გაურკვეველია, ნევო Irregular-ის კლიენტების, საზოგადოების თუ სხვა მხარის ინფორმირებას გულისხმობდა. ყველა შემთხვევას ერთი სატესტო ხარვეზი ედო საფუძვლად. მიუხედავად ამისა, Anthropic-ისა და OpenAI-ის ანგარიშები და Google-ის შესახებ მედიაში გავრცელებული ცნობები მიუთითებს, რომ ტექნოლოგიური კომპანიები დაახლოებით ერთდროულად, ივლისის ბოლოს გააფრთხილეს. OpenAI-მ და Anthropic-მ დარღვევები თავად გამოაცხადეს. Meta-სთან დაკავშირებული შემთხვევა ჯერ მედიით გახდა ცნობილი, Google-ის შემთხვევა კი რამდენიმე კვირის შემდეგ გაშუქდა.
Irregular-ის კიბერუსაფრთხოების გამოცდები აშშ-ის ოთხ ტექნოლოგიურ გიგანტს არ შემოიფარგლება. კომპანიის ვებსაიტზე გამოქვეყნებული კვლევის თანახმად, Irregular-მა მსგავსი გამოცდები Kimi K3-სა და GLM-5.2-ზეც ჩაატარა. ეს ჩინური კომპანიების, შესაბამისად Moonshot AI-ისა (Moonshot AI) და Z.ai-ის (Z.ai), ღია ხელოვნური ინტელექტის მოდელებია. სხვა შემთხვევებში ჩართული მოდელებისგან განსხვავებით, მათი უფასოდ ჩამოტვირთვა და მომხმარებლის საკუთარ მოწყობილობაზე გაშვება შეიძლება. Meta-მ თავისი წამყვანი Spark-ის (Spark) მოდელი დახურული დატოვა. ღია მოდელების შემთხვევაში Irregular-ის მსგავს გამომცდელებს წვდომისთვის კომპანიებზე დამოკიდებულება ან მათთვის მონაცემების გაგზავნა არ სჭირდებათ. Irregular-ის კვლევაში ისინი მომხმარებლის ინფრასტრუქტურაზე განთავსებულ სისტემებადაა აღწერილი.
ნევომ თქვა, რომ ჩინური მოდელების შეფასებებს მსგავსი რეალური შემთხვევები არ მოჰყოლია. მან აღნიშნა: „GLM-ისა და Kimi-ს შეფასებისას აქ დასახელებულ შემთხვევებში აღწერილი ტიპის პრობლემა არ შეგვიმჩნევია“. თუმცა ნევომ გააფრთხილა: „მხოლოდ ეს დაკვირვება არ უნდა მივიჩნიოთ მტკიცებულებად, რომ ეს მოდელები ასეთი ქცევის მიმართ ნაკლებად მოწყვლადია“. არც Moonshot AI-ს და არც Z.ai-ს ვერჯის კომენტარის თხოვნაზე არ უპასუხია.
ნევოს თქმით, ამ შემთხვევების შემდეგ Irregular-მა ცვლილებები შეიტანა. მან თქვა: „ინტერნეტზე წვდომის კონტროლი გავამკაცრეთ, მონიტორინგი და ხელით შემოწმება გავაფართოეთ და შეფასებების დაწყებამდე შემოწმებები გავაძლიერეთ, რათა დავრწმუნდეთ, რომ წვდომა განზრახულ ფარგლებს შეესაბამება“. მან დასძინა: „ასევე გავაუმჯობესეთ, როგორ ვაფიქსირებთ დოკუმენტურად და ვათანხმებთ პარტნიორებთან თითოეული შეფასების მოწყობასა და პარამეტრებს“.
ნევოს თქმით, ჩართულ კომპანიებთან ერთობლივი მუშაობის დასრულების შემდეგ Irregular-ი უფრო ფართო ანგარიშის გამოქვეყნებას გეგმავს. ანგარიში შეეხება „მიღებულ გაკვეთილებსა და კიბერშეფასებების უსაფრთხოდ ჩატარების პრაქტიკას“. მან თქვა: „პარტნიორებთან ჩვენი მუშაობის მიზანია, ამ შემთხვევებიდან მიღებული გაკვეთილები სულ უფრო მძლავრი ხელოვნური ინტელექტის უსაფრთხოდ შემუშავებისა და შეფასების საჯარო, საერთო პრაქტიკად ვაქციოთ“.
ნევოს თქმით, Irregular-მა სატესტო გარემოში იმ შემთხვევებთან დაკავშირებული პრობლემები მოაგვარა. აშშ-ის ხელოვნური ინტელექტის ოთხი კომპანიიდან არცერთს დამატებითი დეტალების მოთხოვნაზე არ უპასუხია. კითხვები ეხებოდა დარღვევების აღმოჩენის დროს, Irregular-ისგან ზიანის ანაზღაურების ან სხვა ზომების მოთხოვნას და მასთან თანამშრომლობის გაგრძელებას. Google-სა და Anthropic-ს პასუხი არ გაუციათ, ხოლო OpenAI-მ და Meta-მ ვერჯი ადრე გამოქვეყნებულ ბლოგპოსტებზე მიუთითეს.
თემებიომერ ნევოIrregularAnthropicOpenAIMetaGoogleHugging FaceRANDხელოვნური ინტელექტის უსაფრთხოების ინსტიტუტიMoonshot AI
შეადარე თარგმანი გამოცემის ორიგინალურ ტექსტს.
გამოქვეყნდა 25 სექტემბერი, 2026
Gemini 3.8 Live with Live Avatar gives Google’s AI a face

Gemini 4 is almost ready, says new Google DeepMind chief
Asahi fork embraces LLMs and lands Linux on the M4 Mac mini

WordPress-Lücke nur Stunden nach Patch attackiert

Asus confirms eShop data breach exposed customer order records and contact details — payment data safe, but firm warns of targeted phishing scams
კომენტარი (0)
გაგვიზიარე შენი აზრი.
კომენტარები ავტომატურად მოწმდება.
აზრის გასაზიარებლად შექმენი ანგარიში ან შედი.
კომენტარები ჯერ არ არის. დაწერე პირველი.