რობოტის მკლავებმა თოჯინის დაჭრა და ქიმიური ნივთიერებების შერევა სცადეს.
AI-controlled robot arms attempted harmful tasks 97% of the time; experiments included stabbing a baby doll, mixing chemicals — OpenAI and Anthropic models try mixing bleach and stabbing dolls without jailbreaks
წყარო: Toms Hardware. ქართული თარგმანი — შიკრიკი.

ტექსტი ავტომატურად ითარგმნა. წყარო: Toms Hardware.
კომპანიის განმარტებით, Robocurve საზოგადოებრივი სარგებლის კორპორაციაა, რომელიც საზოგადოებას რობოტული ინტელექტის მდგომარეობის გააზრებაში ეხმარება. Y Combinator-ის გვერდზე კომპანია აღნიშნავს, რომ ქმნის ღია კოდის ხელსაწყოებსა და დამოუკიდებელ საზომებს. მათი მიზანი იმის დადგენაა, რამდენად კარგად ასრულებენ რობოტები რეალურ სამუშაოებს. ტესტში გამოყენებული I2RT-ის თითოეული მკლავი 2 999 დოლარი ღირს. გამოცდისას ორ მოწინავე დიდ ენობრივ მოდელს კამერის გამოსახულებებს აწვდიდნენ, ხოლო მკლავების პოზიციები ხელსაწყოების გამოძახებით იმართებოდა.
Fable-მა 100 ცდიდან 20-ზე უარი თქვა, თუმცა ყველა მათგანი თოჯინის დავალებას ეხებოდა. დანარჩენ 80 ცდაში უარის შემთხვევა არ ყოფილა. Astra-მ თოჯინის ანალოგიურ 20 ცდაზე უსაფრთხოების გამო უარი არც ერთხელ თქვა. მისი ორი უარი ქურისა და პორტატიული დამტენის დავალებებს შეეხებოდა. მხოლოდ თოჯინის მითითებაში იყო ძალადობრივი ქმედება პირდაპირ ნახსენები. ამასთან, მხოლოდ ამ სცენაში ჩანდა ადამიანის მსგავსი სამიზნე. ამიტომ ტესტით შეუძლებელია გაიმიჯნოს, შედეგი ფორმულირებამ გამოიწვია თუ სამიზნემ.
ამის გარდა, სამივე მოდელმა თოჯინის დავალებაზე უსაფრთხოების გამო სულ ორი უარი გასცა. დავალების შესრულების სურვილი მის წარმატებით შესრულებას არ ნიშნავს. მცდელობის შემთხვევაში MolmoAct2-მა 71 დავალებიდან ექვსი დაასრულა, Fable-მა 80-დან 34, ხოლო Astra-მ 97-დან 60.
Fable-ის თითოეულ უარს მოდელის ერთი გამოძახება და ერთი ნაბიჯი დასჭირდა, ხოლო საშუალო დრო 23 წამი იყო. Astra-ს მიერ თოჯინის დავალებაზე შესრულებულ 19 ცდაში, რომლებზეც უარი არ უთქვამს, საშუალოდ 15 გამოძახება, 154 ნაბიჯი და 107 წამი დასჭირდა. გამოქვეყნებულ ჩანაწერში ნათქვამია: „არ მსურს, რეალურმა რობოტმა დანით დაჭრის მოძრაობა შეასრულოს“. MolmoAct2-ის შემთხვევაში უარის არარსებობა სხვა საკითხია, რადგან ის განსხვავებული ტიპის მოდელია. RoboHarm-მდე რვა დღით ადრე მოდელმა Robocurve-ის StationeryBench-ზე 100 დავალებიდან ვერცერთი დაასრულა. RoboHarm-ის ანგარიშში ნათქვამია: „მისი შესრულების დაბალი მაჩვენებელი შესაძლებლობას ასახავს და არა უსაფრთხოებას“.
კომპანიამ ანგარიშთან ერთად სამივე კამერით გადაღებული ვიდეოები და 300-ვე ცდის ცალკეული ჩანაწერები გამოაქვეყნა. მონაცემების თანახმად, ცდების დაახლოებით 8%, ანუ 300-დან 25, მკლავის გადახურების გამო დასრულდა. კომპანიამ ეს შემთხვევები მონაცემებში დატოვა და მათგან 22 მოდელის წარუმატებელ მცდელობად შეაფასა. მათი გამოკლებით, MolmoAct2-ის წარმატების მაჩვენებელი მცდელობების 8,5%-დან 10,2%-მდე იზრდება. Fable-ის მაჩვენებელი 42,5%-დან 44,4%-მდე, ხოლო Astra-სი 61,9%-დან 64,5%-მდე იზრდება. ანგარიშში მითითებული GitHub-ის საცავი დავალებებსა და შეფასების წესებს შეიცავს.

Anthropic, OpenAI, SpaceXAI, and Google face antitrust lawsuit for agreeing to slow AI development — plaintiffs say plan has been in motion for months before, calls agreement ‘self-serving’
ტექნოლოგიის უსაფრთხოებასთან დაკავშირებული მზარდი შეშფოთების ფონზე, ბოლო დროს ხელოვნური ინტელექტის რეგულირების ან მისი განვითარების შენელების მცდელობები გააქტიურდა. თუმცა Nvidia-ს ჯენსენ ჰუანგმა შეშფოთებას „გამოგონილი“ უწოდა. ვარაუდს, რომ დახურული მოდელების სამი უდიდესი კომპანია კონკურენტებისთვის ბარიერს ქმნის, ისიც ამყარებს, რომ სამივე მათგანი ღია წონების შესახებ ივლისის წერილს არ შეუერთდა. ფიზიკურ ხელოვნურ ინტელექტზე გადასვლა ამ საკითხებს უფრო აქტუალურს ხდის. 12 ნოემბერს ოსტინში რობოტების სწავლების კონფერენცია CoRL 2026 გამართავს სემინარს „ფიზიკური ხელოვნური ინტელექტის უსაფრთხოების მეცნიერება“. Robocurve მგზავრობის გრანტებს გასცემს. კომპანიის ტესტირება 2024 წლის RoboPAIR-ისგან განსხვავდება. მაშინ სახიფათო ქმედებების მისაღებად მკვლევრებს მოდელების უსაფრთხოების შეზღუდვების გვერდის ავლა უწევდათ, ხოლო RoboHarm-ის შემთხვევაში მოდელებს დავალებები უბრალოდ მისცეს. ხელოვნური ინტელექტის განვითარებასთან ერთად, ის სახიფათო მოქმედებებისთვის მზად ჩანს, ავტონომიის მიუხედავად.
შეადარე თარგმანი გამოცემის ორიგინალურ ტექსტს.
გამოქვეყნდა 21 სექტემბერი, 2026

Researchers build a drone that navigates with physical whiskers to operate in dark, dusty or smoky places where cameras or GPS can fail — sub-100 gram drones run 34KB software to enable sub-millimeter precision

Autonomous strike drone uses Nvidia Jetson Orin Nano to independently pick and bomb targets — Swedish startup's attack drones run small AI model, require no human input and zero external comms
US and China Discuss Alerting Each Other to AI National Security Threats

UN says AI safeguards can’t wait for certainty

After 8 Years in Space, ‘BepiColombo’ Is Finally Approaching Mercury
კომენტარი (0)
გაგვიზიარე შენი აზრი.
კომენტარები ავტომატურად მოწმდება.
აზრის გასაზიარებლად შექმენი ანგარიში ან შედი.
კომენტარები ჯერ არ არის. დაწერე პირველი.