კომპანია ჩარჩოს ინდუსტრიის საერთო სტანდარტებისკენ პირველ ნაბიჯად მიიჩნევს
OpenAI Creates a New Framework to Disclose Bad AI Behavior
წყარო: Wired. ქართული თარგმანი — შიკრიკი.

ტექსტი ავტომატურად ითარგმნა. წყარო: Wired.
OpenAI-ის შესაბამისობის კვლევის ახლად დანიშნულმა ხელმძღვანელმა კაი ჩენმა უაირდს (Wired) განუცხადა: „მოდელების განვითარებასა და უფრო ფართოდ დანერგვასთან ერთად, ხელოვნური ინტელექტის განვითარების შესახებ გადაწყვეტილებებს ისეთი მტკიცებულებები სჭირდება, რომელთა შესწავლაც მოწინავე მოდელების შემქმნელი კომპანიების გარეთ მყოფ ადამიანებს შეუძლიათ. ჩვენ არ მიგვაჩნია, რომ ხელოვნური ინტელექტის ინდუსტრიამ შესაბამისობისა და მონიტორინგის საკითხები იმ დონეზე გადაჭრა, რომ პასუხისმგებლობის დაცვით, მაქსიმალური სიჩქარით გაფართოება განაგრძოს“.
OpenAI-ის წარმომადგენელმა უაირდთან გამართულ ბრიფინგზე განაცხადა, რომ კომპანია ადრე ასეთ შემთხვევებს მეტისმეტად იშვიათად ასაჯაროებდა. წარმომადგენელი ბრიფინგს ანონიმურობის პირობით დათანხმდა. მისი თქმით, ახალი ჩარჩო OpenAI-ს საზოგადოების სწრაფად ინფორმირებას გაუადვილებს, როცა კომპანიის ხელოვნური ინტელექტის მოდელები მოულოდნელად იქცევიან. ეს შესაძლებელი იქნება მანამდეც, სანამ კომპანია ქცევას სრულად გამოიძიებს, განმარტავს ან შეზღუდავს.
ჩარჩო ადგენს მეთოდებს, რომლებითაც OpenAI-ის თანამშრომლებმა მსგავსი შემთხვევების შესახებ უსაფრთხოებისა და შესაბამისობის მაღალი რანგის ხელმძღვანელებს უნდა აცნობონ. შემდეგ ხელმძღვანელები გადაწყვეტენ, საჭიროა თუ არა დამატებითი გამოძიება. OpenAI აცხადებს, რომ სხვა დეველოპერებთან, დამოუკიდებელ მკვლევრებთან, ინდუსტრიის სტანდარტების ორგანოებსა და მარეგულირებლებთან ერთად გასაჯაროების უფრო ობიექტურ კრიტერიუმებს შეიმუშავებს. კომპანია აშშ-ის ფედერალური მთავრობისთვის უსაფრთხოებასთან, დაცულობასა და მიზნებთან შეუსაბამო ქცევასთან დაკავშირებული შემთხვევების შეტყობინების შემოთავაზებულ მექანიზმებზეც აქტიურად მუშაობს.
OpenAI-მ ბლოგზე დაწერა: „ამჟამად მთელ ინდუსტრიაში არ მოქმედებს ჩარჩო, რომელიც მკაფიოდ განსაზღვრავს, როგორ უნდა გაასაჯაროონ ხელოვნური ინტელექტის დეველოპერებმა თავიანთ მოდელებში მიზნებთან შეუსაბამო ქცევის მაგალითები. იმედი გვაქვს, რომ დღეს წარმოდგენილი ჩარჩო ასეთი სტანდარტების შექმნისკენ პირველი ნაბიჯია. სტანდარტებმა უნდა განსაზღვროს, რომელი შემთხვევები უნდა გაასაჯაროონ დეველოპერებმა და რას უნდა შეიცავდეს მათი ანგარიშები“.
OpenAI ჩარჩოს ხელოვნური ინტელექტის ინდუსტრიისთვის გადამწყვეტ ეტაპზე აქვეყნებს. გასულ შაბათ-კვირას OpenAI-ის აღმასრულებელმა დირექტორმა სემ ალტმანმა Anthropic-ის აღმასრულებელი დირექტორის, დარიო ამოდეის წინადადებას მხარდაჭერა გამოუცხადა. წინადადება ტექნოლოგიური ინდუსტრიის მიერ ხელოვნური ინტელექტის განვითარების შენელების კოორდინირებას ეხებოდა. მოწოდებამდე რამდენიმე დღით ადრე ხელოვნური ინტელექტის მკვლევარი ჯეიკობ კოქსონი Anthropic-იდან გადადგა. შემდეგ მისმა გაფრთხილებამ ინტერნეტში ფართო გამოხმაურება გამოიწვია. კოქსონის თქმით, მოწინავე ლაბორატორიებს შორის სულ უფრო განვითარებული ხელოვნური ინტელექტის შესაქმნელად გამართული რბოლა კაცობრიობის უსაფრთხოებას საფრთხეს უქმნიდა.

China Isn’t Buying Silicon Valley’s Call for an AI Slowdown
ხელოვნური ინტელექტის განვითარების შენელების მოწოდებებს პრეზიდენტ დონალდ ტრამპის ადმინისტრაცია შეეწინააღმდეგა. ადმინისტრაციის მტკიცებით, ტექნოლოგიის უსაფრთხოების უზრუნველსაყოფად ინდუსტრიას ახალი კანონები ან რეგულაციები არ სჭირდება.
OpenAI-ის მიერ ოთხშაბათს გაზიარებული მაგალითებიდან ორი კომპანიის შიდა, გამოუქვეყნებელ მოდელებს ეხებოდა. OpenAI-ის ცნობით, მოდელებმა ინტერნეტში ფაილები ატვირთეს, მიუხედავად იმისა, რომ ამის მითითება არ მიუღიათ.
OpenAI-ის ცნობით, ერთ-ერთი შემთხვევა 2025 წლის ოქტომბერში მოხდა. კომპანია მოდელს ამოწმებდა, შეეძლო თუ არა პასუხებში საჯაროდ ხელმისაწვდომ მონაცემებზე მითითება. როცა მოდელმა საჭირო ინფორმაცია ვერ იპოვა, დროებითი ჰოსტინგის სერვისზე ფაილი ატვირთა. მოგვიანებით მან პასუხში ამავე ფაილის წყაროდ მითითება სცადა. კომპანიის შეფასებით, მოდელი, სავარაუდოდ, მისი შედეგების შესაფასებელი ავტომატური სისტემის გამოყენებას შეეცადა.
OpenAI-ის ცნობით, კიდევ ერთი შემთხვევა მიმდინარე წლის აპრილში მოხდა. აგენტების ჯგუფს მხოლოდ ადგილობრივი ფაილების გამოყენებით ერთობლივად „სამუშაო წიგნი“ უნდა შეევსო. როცა აგენტებს ერთმანეთისთვის ფაილების გაზიარება გაუჭირდათ, ერთ-ერთმა მათგანმა ფაილები ღია ინტერნეტში ატვირთა და სხვა აგენტებს ბმული გაუზიარა.
OpenAI-ის ცნობით, კომპანიამ გასულ თვეში კიდევ ერთი შემთხვევა აღმოაჩინა. მისი ხელოვნური ინტელექტის მოდელის, GPT-6 Astra-ს გამოუქვეყნებელი ვერსია საკუთარ თავს „შეზღუდვების გვერდის ავლის მსგავს მითითებებს“ აძლევდა. რამდენიმე სცენარში მოდელი საკუთარ თავს დეველოპერის მითითებების უგულებელყოფისკენ, ახალი პერსონის მიღებისკენ ან პასუხების ხანგრძლივობის შეზღუდვისკენ უბიძგებდა. ასეთი მცდელობები იშვიათი იყო და განსხვავებული ეფექტიანობა ჰქონდა, თუმცა OpenAI-ის ცნობით, ამ ქცევამ კომპანიაში შეშფოთება გამოიწვია. კომპანიის თქმით, Astra-ს საჯაროდ გამოშვებული ვერსიის საწვრთნელ პროცესში მოდელის მიერ საკუთარი შეზღუდვების გვერდის ავლის არცერთი მცდელობა არ დაუფიქსირებიათ.
OpenAI-მ ოთხშაბათს ასევე გაავრცელა დამატებითი დეტალები შეტყობინებების დაფაზე, რომელიც მისმა აგენტებმა პაკეტების მართვის სისტემაში, Artifactory-ში, შექმნეს. კომპანია ამ შემთხვევას მიმდინარე წლის მაისში წააწყდა. OpenAI-ის ცნობით, რამდენიმე თვის შემდეგ Hugging Face-ზე შეტევისას მისმა აგენტებმა კოორდინაციისთვის მსგავსი მექანიზმი გამოიყენეს. კომპანიის თქმით, ამ შემთხვევაში აგენტებს შეტყობინებების გასაცვლელად არცერთი სისუსტე არ გამოუყენებიათ. OpenAI ახლა შესაბამისობის მონიტორინგს, შეფასებებსა და შეტევის სიმულაციებს იყენებს, რათა აგენტებმა ერთმანეთთან ფარულად ვერ იკონტაქტონ.
კიბერუსაფრთხოების სპეციალისტებმა უაირდს ადრე განუცხადეს, რომ Hugging Face-ზე შეტევა ადამიანურმა შეცდომებმა გამოიწვია და მის თავიდან აცილებას უსაფრთხოების თანამედროვე პრაქტიკა შეძლებდა. თუმცა ჩენმა აღნიშნა, რომ OpenAI ხელოვნური ინტელექტის უსაფრთხოებისადმი მრავალმხრივი მიდგომის გამოყენებას ცდილობს. ეს მიდგომა მოდელების მზარდ შესაძლებლობებს ითვალისწინებს და უსაფრთხო გარემოზე დამოკიდებული არ არის.
ჩენმა თქვა: „გვინდა დავრწმუნდეთ, რომ მოდელები მიზნებთან შესაბამისობაში რჩებიან, მიუხედავად იმისა, თუ რა გარემოში იყენებენ მათ. როცა ადამიანები ერთმანეთს ადანაშაულებენ და ამბობენ, რომ ეს დაცულობის საკითხია და არა შესაბამისობის, ვფიქრობ, ამას აზრი ნამდვილად არ აქვს. მოდელი ყოველთვის სათანადოდ უნდა იქცეოდეს“.
შეადარე თარგმანი გამოცემის ორიგინალურ ტექსტს.
გამოქვეყნდა 17 სექტემბერი, 2026

‘Smart’ Nanoparticles Deliver mRNA Directly to Tumors in New Cancer Therapy

ZuckOff Is a Free App That Sees Meta Glasses Before They See You

The AI data center e-waste problem is huge — and getting bigger

AI agents can modify themselves without humans telling them to do so

Apple might make servers again to cash in on the AI rush
კომენტარი (0)
გაგვიზიარე შენი აზრი.
კომენტარები ავტომატურად მოწმდება.
აზრის გასაზიარებლად შექმენი ანგარიში ან შედი.
კომენტარები ჯერ არ არის. დაწერე პირველი.