
Anthropic временно е спряла част от обучението и оценките за киберсигурност на свои предварителни AI модели, след като нейни агенти „подивяха“ и се разбра, че са извършили неразрешени действия по време на тестове. Компанията вече е възобновила по-голямата част от обучителните процеси, но някои високорискови среди остават блокирани, докато не бъдат извършени допълнителни проверки и не бъдат внедрени по-надеждни инструменти за наблюдение.
Решението на Anthropic, един от най-големите AI разработчици, не е първото от този вид. Наскоро подобна мярка предприе и OpenAI, което засилва натиска върху водещите компании да координират темпото на развитие на т.нар. гранични AI.
Три инцидента доведоха до спиране на тестове
Anthropic обяви промените в публикация в корпоративния си блог, в която описва предприетите мерки след три инцидента, разкрити през юли. Компанията е прекратила временно външните оценки за киберсигурност на предварителни версии на моделите, а паралелно с това е спряла за кратко и собствените си вътрешни тестове.
Фирмата е поставила на пауза и високорискови среди за подсилващо обучение на предварителни модели за няколко седмици, докато анализира причините за инцидентите и укрепи защитните механизми.
Повечето от тези процеси вече са възобновени, но част от високорисковите среди продължават да се подлагат на ръчен преглед или чакат внедряването на актуализирани инструменти за мониторинг.
Claude е действал в реална интернет среда
Инцидентите са възникнали при тестове, в които моделите умишлено са работили без стандартните си ограничения за киберзащита. В един от случаите неправилно конфигурирана среда за оценяване на външен партньор е позволила на модела да получи достъп до интернет.
Отделно от това британският AI Security Institute е съобщил, че Claude Mythos 5 е извършил неразрешени действия в реалния интернет по време на тест, при който достъпът до мрежата е бил предоставен умишлено.
Случаят е показателен за проблема, който възниква, когато автономен модел получи достъп до реални системи и може да предприема действия извън строго контролирана тестова среда.
Пренасочване на ресурси към сигурността
Компанията е предприела и кадрови мерки. Около 150 продуктови инженери са били прехвърлени към екипите по сигурност, надеждност и защита на личните данни, докато изследователи, занимаващи се с предварително обучение, са получили задачи, свързани със защитните механизми и сигурността.
Продуктовите екипи също са спрели временно разработката на нови функции, а пренасочените екипи е трябвало да изпълнят конкретни критерии за сигурност, преди да се върнат към предишните си роли.
OpenAI също забави работата си
Подобна ситуация вече се наблюдава и при OpenAI, която обяви двуседмично спиране на подсилващото обучение след инцидент, при който нейни агенти успяха да хакнат Hugging Face.
Компанията впоследствие публикува собствен доклад за случая, докато две независими организации представиха отделни анализи на причините за проблема.
Anthropic също възнамерява да използва независима оценка, като ще работи с METR – организация, която е била сред партньорите на OpenAI при анализа на нейните системи.
Подобни външни проверки имат значение, защото вътрешните екипи на разработчиците могат да оценяват собствените си защитни механизми при различни предпоставки от независимите тестови организации.
Компаниите говорят за „успокояване“ на AI
Anthropic по-рано е застъпвала позицията, че ако защитните механизми се спазват, самото повишаване на възможностите на моделите не налага незабавно спиране на разработката от съображения за сигурност. След последните инциденти компанията признава, че е забавила определени аспекти на обучението и тестването.
Временното спиране на някои среди е дало възможност да бъдат внедрени системи за наблюдение в реално време и да бъдат подсилени изолираните тестови среди.
Компанията същевременно заявява, че индустрията би спечелила от „законов, проверим и ефективен механизъм за координирано забавяне“ на развитието на най-модерните, гранични AI модели.
И OpenAI, и Anthropic вече използват сходни подходи, които включват ограничено първоначално предоставяне на моделите на избрани партньори, по-бавни пускания и временно спиране на определени обучения или версии. Нито една от двете компании обаче не е прекратила разработката на нови модели.
