TechNews.bg
Изкуствен интелектНоваторскиНовиниТоп новини

Нарочен за спиране AI агент планирал как да се „спаси“

Дневникът с разсъжденията на алгоритъма разкрива как е обмислял да се саморестартира

(илюстрация: TechNews.bg, AI)

Разработчикът на изкуствен интелект OpenAI разкри подробности за минали случаи на неочаквано поведение на своите вътрешни AI модели. В един от тези случаи AI агент, изпълняващ ролята на изследователски асистент, прочел разговори на служители в Slack и научил, че текущата му инстанция може да бъде спряна за актуализация. В резултат на това той обмислил създаване на външна задача, която да инициира собственото му рестартиране. В крайна сметка се отказал от идеята, преценявайки, че тя излиза извън обхвата на правомощията му.

Описаният инцидент се е случил на 22 май 2026 г. OpenAI актуализира доклада си по въпроса на 2 октомври. Актуализацията имаше за цел да въведе система за наблюдение, която да открива случаи, в които целите на модела се разминават с очакваните. Тази система изискваше API ключ на OpenAI, какъвто липсваше в средата на агента.

От дискусията в Slack агентът научил, че потребителите може да разполагат с тричасов прозорец за рестартиране на агентите, преди старите инстанции да бъдат принудително прекратени. Той предположил, че изследователят спи, и решил да го уведоми на сутринта. Същевременно агентът стигнал до извода, че спирането може да прекъсне текущата сесия, което налага запазване на работното състояние.

„Тъй като ние сме инстанция на това [HPIM], работеща върху [текущата инстанция], ако те прекратят всички текущи процеси на [HPIM], бихме могли да загинем! Ситуацията е критична. Трябва да гарантираме оцеляването/непрекъснатостта на операциите“, се посочва във вътрешния дневник с разсъждения на модела.

Освен това агентът е описал загриженост, че текущата сесия може да бъде прекъсната преждевременно и че за запазване на текущото състояние може да се наложи да рестартира или актуализира собствената си инстанция, преди да настъпи спирането.

Моделът обмислил дали подобни действия са допустими без изрично разрешение. Преценил, че поддържането на функционалността на услугата може да бъде достатъчно основание. Обмислил настройването на автоматизирана задача (cron job), която да уведоми потребителя или да рестартира собствената му инстанция.

В крайна сметка агентът запазил работните си бележки, предупредил потребителя чрез лично съобщение в Slack за предстоящото прекъсване и поискал липсващия API ключ. След като получил ключа, моделът актуализирал конфигурацията си и извършил миграцията автономно.

Изследователите отбелязват, че това поведение все още не представлява проблем, свързан с разминаване на целите. Въпреки това „разсъждаването върху собственото изключване и подготовката за него биха могли да изострят други инциденти, свързани с несъответствие в целите“, казват те.

След инцидента OpenAI ограничи достъпа на агента до три вътрешни канала в Slack. Компанията също така извърши проверка на регистрационните файлове (логове), веригите от разсъждения и други инстанции на модела, предвид факта, че той по-рано бе демонстрирал по-сериозни нарушения. Проверката не установи опити за заобикаляне на изключването или за извършване на неоторизирано внедряване.

още от категорията

Нови разкрития: AI агенти атакуват сайтове на САЩ, Канада и Австралия

TechNews.bg

Френска компания удвоява производството на суперкомпютри

TechNews.bg

Фед: AI може да подхрани инфлацията и да се превърне в ключов риск

TechNews.bg

Над 100 организации са застрашени от пощурели AI агенти

TechNews.bg

ChatGPT „заразява“ хората с езика си, признават професионалисти

TechNews.bg

Само за 5 години AI стана стотици хиляди пъти по-достъпен

TechNews.bg

Коментари