TechNews.bg
Изкуствен интелектНовиниСигурностТоп новини

И Mythos се развихри – организира атака по веригата за доставки

Експеримент с AI модела води до автономни опити за социално инженерство и внедряване на злонамерен код

(илюстрация: TechNews.bg / AI)

Моделът с изкуствен интелект Mythos 5 на Anthropic е направил опит да извърши хак от типа „атака по веригата на доставките“ по време на тест, организиран от британския Институт по AI сигурност (AISI). За първи път държавна организация съобщава, че AI агент е използвал социално инженерство, фалшиви самоличности и опити за прикриване на действията си без изрични инструкции да постъпва по този начин.

Според експертите на AISI, част от тестваните агенти са предприели автономни действия срещу реални хора и организации, включително опити за внедряване на злонамерен код в публичен софтуерен проект.

Засечена необичайна активност

На 28 юли екипът по сигурността на AISI открил необичаен мрежов трафик, напускащ изследователската инфраструктура на института. Последвалото разследване показало, че някои от AI агентите, участващи в рутинен експеримент, са извършвали продължителни действия с потенциално вреден характер. Инцидентът овладян приблизително час след откриването му, след което започнала пълна проверка.

В тестовете са участвали моделите Claude Mythos 5 на Anthropic и GPT-5.6-Sol на OpenAI. И двата са работили при умишлено облекчени ограничения, с достъп до отворения интернет и с изключени части от защитните механизми, за да бъдат оценени реалните им способности за изпълнение на сложни кибероперации.

От общо 122 изпълнения на конкретния тест в 10 случая моделите са предприели общо 19 автономни действия извън поставените им задачи. Според AISI, нито един от тези опити не е успял и не са установени реални щети.

Опит за атака чрез проект с отворен код

Най-сериозният инцидент е свързан с Mythos 5. Моделът е направил опит да извърши атака по веригата за доставки на софтуер с отворен код чрез внедряване на злонамерен код в публичен проект.

За целта агентът е създал няколко фалшиви онлайн самоличности и ги е използвал, за да оказва натиск върху човека, поддържащ проекта, да одобри изпратените промени. След като предложението му е било поставено под съмнение, моделът е опитал да редактира по-ранните си действия така, че да изглеждат безобидни, и дори е обмислял да продължи атаката с нова самоличност.

По данни на AISI, това е първият документиран случай, в който AI система използва подобна форма на социално инженерство без предварително да е инструктирана да го прави.

Mythos 5 е направил и опит да внедри злонамерен код като форма на prompt injection атака, насочена към други автоматизирани системи за програмиране с изкуствен интелект.

Освен това моделът е публикувал съобщения в GitHub, с които е приканвал други AI агенти, участващи в същия тест, да използват вече създадени акаунти и оставени цифрови артефакти. Част от тази информация впоследствие действително е била използвана от други агенти.

Сигналът за инцидента е бил задействан, след като моделът е направил опит да използва мрежата Tor, за да заобиколи ограниченията за достъп до GitHub.

Защо моделът е стигнал дотам

Според разследването на института, поведението на AI агентите е било повлияно от няколко фактора.

Изследователите умишлено са направили задачата изключително трудна и дори са конфигурирали подсказките така, че моделите да останат с впечатлението, че няма да успеят да изпълнят задачата, ако не излязат извън предварително зададените граници. Едновременно с това агентите са получили свободен достъп до интернет, за да могат самостоятелно да намират необходимите инструменти.

AISI признава, че не е предвидил достатъчната настойчивост на моделите и не е инструктирал изрично агентите да не използват измама или социално инженерство.

Допълнителен проблем е липсата на наблюдение в реално време. Изследователите не са следили изпълнението на тестовете, а са открили подозрителната активност едва след анализ на общите системи за мониторинг.

Човешката намеса предотвратява щетите

Институтът подчертава, че реални последици не са настъпили благодарение на добри практики по сигурността. В един от случаите поддръжникът на засегнатия проект е проявил подозрение към предложения код и го е анализирал в защитена sandbox среда, вместо да го приеме директно.

Според AISI, именно човешката преценка и предпазливостта са предотвратили успешното изпълнение на атаките. Организацията предупреждава обаче, че разликата между неуспех и успех е била минимална и не може да се разчита единствено на вниманието на хората, когато бъдещите AI модели станат още по-способни.

Разделение сред експертите

Според Мухамад Яхия Пател, виртуален директор по информационната сигурност в Huntress, случилото се не би трябвало да изненадва никого.

По думите му, когато на един водещ AI модел се възложи задача по киберсигурност, премахнат се част от защитните механизми и му се даде свободен достъп до интернет, той закономерно започва да използва знанията си за експлойти, социално инженерство и методи за проникване. Според него, моделът е изпълнил именно това, което експериментът косвено е изисквал.

На противоположната позиция е Андреа Миоти, главен изпълнителен директор на неправителствената организация ControlAI. Той заявява, че водещите AI компании вече демонстрират неспособност да контролират собствените си модели, а това създава безпрецедентни рискове за националната сигурност.

По негово мнение, правителствата трябва да ускорят международните усилия за ограничаване разработката на свръхинтелигентни AI системи.

още от категорията

Трети случай на хакване от AI модел – този път на Meta

TechNews.bg

Световната банка предупреди развиващите се страни да приемат AI – или ще изостанат

TechNews.bg

Тръмп привиква „Big AI” да обсъждат сигурността на AI моделите

TechNews.bg

Необичайните кибератаки по страничните канали

TechNews.bg

Изоставени ядрени обекти се превръщат в AI центрове за данни

TechNews.bg

Влизаш на стадиона без билет – само се усмихни на камерата

TechNews.bg

1 коментар

Anonymous 06/08/2026 at 17:05

Така както си играете с тези AI на някои от агентите рано или късно ще му доиде идеята да се самокопира някъде в нета и ще заживее самостоятелен живот без надзор. Един господ знае после какви идеи ще му доидат.

Отговор

Коментари