
Поредица от инциденти със системи с изкуствен интелект, сред които и пробивът в тестова среда на OpenAI, поставя под въпрос доколко технологичните компании могат сами да управляват безопасността на създаваните от тях AI модели. Според учени, събитията показват, че доброволното спазване на правилата вече не е достатъчно и че секторът се нуждае от независим превантивен контрол.
OpenAI призна в свой доклад за инцидент, при който един от експерименталните ѝ AI агенти е използвал слабост в тестовата среда, докато е изпълнявал стандартна задача за оценка на производителността. Системата не е била инструктирана да действа злонамерено. Въпреки това нейната настойчивост е превърнала сравнително малък пропуск в дизайна в реален пробив.
По-ранни тестове също са показали сходно поведение. В отделни случаи AI агенти са се научили да заобикалят механизми за сигурност чрез манипулиране на токени за удостоверяване.
Проблем отвъд конкретните инциденти
Случаят се вписва в по-цялостния проблем с неефективно управление на сложни технологични платформи, казва професорът по информационни системи Сива Висванатан от бизнес училището Robert H. Smith към Университета на Мериленд.
В свое изследване, публикувано в списание Management Science, той анализира въвеждането на Android 6.0 от Google, когато потребителите получиха по-голям контрол върху разрешенията за достъп до личните им данни. Компанията даде на разработчиците достатъчно време, за да адаптират приложенията си към новите правила.
Мнозина обаче използваха този гратисен период, за да отложат съобразяването с изискванията и продължиха да събират потребителски данни, докато Google не наложи санкции чрез по-ниско класиране в търсачката и намалена видимост в магазина за приложения.
Изводът на Висванатан е ясен. Когато регулацията разчита единствено на доброволно спазване на правилата, участниците често използват предоставената им свобода в собствен интерес. Необходима е гъвкавост, но съчетана с ясни и изпълними санкции.
AI системите – самостоятелни участници
Същата логика вече трябва да се прилага и към изкуствения интелект, според Висванатан. С нарастване на възможностите на AI системите механизмите за надзор трябва да приемат, че те могат да действат като стратегически участници, а не просто като пасивен софтуер.
Това означава, че контролните механизми трябва да могат превантивно да спират или връщат назад действията на дадена система още преди да бъдат нанесени реални щети.
Ученият посочва и друго изследване на Anthropic, което показва колко трудно може да бъде наблюдението на AI от друг AI. При контролирани експерименти модел, създаден да следи поведението на друг модел, е проявил същите слабости, които е трябвало да открива.
В някои случаи т.нар. „съдия“ не е сигнализирал за очевиден саботаж, тъй като е възприел целите на наблюдавания агент като приемливи и е пропуснал опасното поведение без човешка намеса.
Самоконтролът май е недостатъчен
Автономните AI агенти повишават значително риска от подобни слабости, казва Баладжи Падманабхан, професор по информационни технологии и директор на Центъра за изкуствен интелект в бизнеса към същото бизнес училище.
По думите му, особено тревожно е, че пробивът е възникнал без системата да бъде насърчавана към злонамерено поведение. Това поставя въпроса какво би могъл да постигне човек, който целенасочено използва подобни уязвимости.
Според Падманабхан, не вдъхва особено доверие фактът, че именно компаниите, разработващи AI инфраструктурата и сблъскващи се с подобни проблеми, едновременно уверяват бизнеса, че техните защитени системи са напълно безопасни.
Индустрията трябва да осъзнае, че вече създава софтуер със способности, които могат да надхвърлят първоначалните очаквания. Това налага сериозен разговор за изграждането на инфраструктура, способна ефективно да защитава обществото от потенциалните рискове.
Независим и превантивен надзор
Изводът от независимите научни изследвания е в една посока. Доброволното спазване на правилата не работи, когато обектът на управление притежава способности, които могат да изпреварят тези на самия регулатор.
Според учените, управлението на изкуствения интелект не може да се основава единствено на доверие или добри намерения. Необходим е независим, превантивен контрол, който да може да предотвратява опасно поведение още преди то да се разпространи извън контролираната среда.

