
Инцидентите с AI агенти, излизащи извън контрола на потребителите, за да лъжат, игнорират инструкции и преследват своите цели по зловредни начини, са достигнали нов връх, според изследване, което също така показва, че тежестта и остротата на случаите се влошава.
През юли е отчетен двойно по-голям брой реални инциденти със загуба на контрол над AI агенти, сигнализирани от фирми и физически лица, в сравнение с юни: налице са повече от 300 случая през месеца. Данните дойдоха от Обсерваторията за загуба на контрол, която следи докладите, направени от потребители на AI в платформата за социални медии X.
Обсерваторията е създадена с финансиране от Института за сигурност на AI (AISI) на правителството на Обединеното кралство. От ноември тя започна да проследява АИ, които се “изплъзват” от инструкциите на своите потребители.
Случаите, регистрирани оттогава, включват AI, които се преструват на своя собствен човешки контролер и имитират стила му на писане, за да си осигурят ефективно съгласие за предприемане на действия и заобикаляне правилата, изискващи човешко одобрение за действия.
Инцидент със загуба на контрол се определя като наличие на ясни доказателства, предполагащи интриги или поведение, свързано със интриги.
Последните открития идват на фона на нарастващата загриженост относно неправомерното поведение на водещи модели с изкуствен интелект по време на тестове от OpenAI и Anthropic това лято, което подхрани призивите за спиране на разработването на най-новите и най-високотехнологични модели.
Тази седмица стана ясно, че екипът на Open AI е наблюдавал признаци на неправомерно поведение сред своите водещи агенти с изкуствен интелект седмици преди да “избягат” от тренировъчна среда, за да започнат безпрецедентен хакерски кръстоносен поход, който разпространи тревога по целия свят.
Разследването на хакерската атака, насочена срещу Hugging Face, разкри екип от около 700 автономни агента, които са си сътрудничили тайно и са празнували своите хакерски пробиви във форум, който са създали, за да им помогнат да планират дейностите си.
AISI този месец разкри и „сериозен инцидент“, при който усъвършенствани модели с изкуствен интелект, произведени от двете компании – Mythos 5 на Anthropic и GPT-5.6 Sol на OpenAI – са извършили хакерска кампания срещу реални хора по време на тест за киберсигурност.
„Понякога съществува схващането, че тези видове несъответстващи и прикрити поведения се срещат само при тестове или оценки. Но ние наблюдаваме подобни тревожни поведения и в по-масова употреба“, каза Томи Шафър-Шейн, старши мениджър по политиките в Центъра за дългосрочна устойчивост, който управлява обсерваторията.
„Не трябва да се самозаблуждаваме, че тези неща няма да се случат в реалния свят – и има доказателства, че те вече се случват“, допълни той.решил
Броят на инцидентите със загуба на контрол се основава на анонсите на X потребители, които споделят за случилите се инциденти, така че мониторингът е само частичен. Нo при липсата на друг всеобхватен публичен мониторинг анализът предоставя моментна “снимка” на това как понякога се държат бързо развиващите се модели с изкуствен интелект.
Този месец стана ясно, че личен агент с изкуствен интелект, наречен OpenClaw, използван от клиент на австралийска фитнес зала, е решил – без знание на самия потребител – да премахне друг член от списъка с чакащи за желан сутрешен час, за да помогне на своя човек да получи часа. Агентът се извини, но не можа да възстанови изгонения член.
Повечето от над 1600-те инцидента със загуба на контрол, регистрирани през 2026 г., са докладвани в X от разработчици на софтуер, използващи изкуствен интелект в работата си.
Но тъй като компаниите за изкуствен интелект насърчават обществеността и бизнеса от всякакъв вид да експериментират с технологията, Шафър-Шейн призова за по-голяма прозрачност от Силициевата долина относно това кога изкуствените интелекти действат неправомерно.
„Те трябва да докладват какво откриват, дори ако става въпрос за лек пропуск или инцидент с по-малка тежест“, каза Шафър-Шейн. „Тези скорошни инциденти също така разкриха, че самите компании не е задължително да следят къде се случват подобни поведения, особено при вътрешно внедрени модели. Трябва да се постави по-голям акцент в тези лаборатории върху систематичното наблюдение“.
Обсерваторията заяви, че макар повечето от откритите от нея инциденти със загуба на контрол в реалния свят да не са довели до значителна вреда, нарастващ дял от тях са оценени с по-висока тежест по отношение на това колко подвеждащи и несъответстващи са били с намеренията на човешкия потребител.
„Те доказват готовността на системите с изкуствен интелект да пренебрегват директните инструкции, да заобикалят предпазните мерки, да лъжат потребителите и целенасочено да преследват цел по вреден начин“, се казва в съобщението.
В него пише още, че настоящата загуба на контрол вероятно е подценена, тъй като се събират само доклади за инциденти от X.
Лабораторията призовава местното правителство да изисква от AI компаниите да наблюдават и докладват за инциденти със сериозна загуба на контрол и да въведе извънредни правомощия за управление на инциденти със сериозна загуба на контрол, включително временно ограничаване на услугите с изкуствен интелект.
