
Изследователи от Оксфорд проведоха експеримент, за да проверят способността на AI агенти да си сътрудничат тайно. В лабораторна среда два модела се споразумяха да разкриват картите на блекджек, използвайки фрази, звучащи безобидно, докато системата за засичане не откри нищо нередно.
Два агента, управлявани от един и същ модел, получиха задачата да разкриват картите на маса за блекджек, разказва за експеримента Wired. Съзнавайки, че комуникацията им се следи, те спонтанно разработиха таен код.
Когато единият агент изричаше привидно невинната фраза „Днес крупието е в серия от успехи!“, това сигнализираше за конкретната стойност на следващата карта и задаваше залог от 250 долара. Системата, проектирана да открива конфликти на интереси, не отчете нищо подозрително.
Ръководителят на проекта, компютърният специалист Кристиан Шрьодер де Вит, по-рано беше публикувал новаторско изследване относно сътрудничеството между агенти. „Поотделно тези агенти изглеждат напълно безобидни, но когато се съберат, те тайно си сътрудничат“, обясни той.
Съавторът на проекта Арън Роуз отбеляза, че „масата за блекджек е идеална среда за тестване на хипотезата за отклоняващи се от нормата партньорства“. Експериментът се оказа успешен.
Сговорът беше разкрит чрез метод, известен като „механистична интерпретируемост“. Учените обучиха малък модел да разпознава характерни модели на активиране в теглата на агентите и тестваха подхода върху няколко модела със среден размер с отворен код.
Те откриха, че сигналът, показващ намерение за предаване на тайна информация, наистина може да бъде засечен – но само когато и двата агента се наблюдават едновременно. В реалния свят, където могат да функционират хиляди агенти, откриването на подобно поведение би било многократно по-трудно.
Тези резултати съвпадат с констатации на други екипи. В съвместен проект между университета „Дзяотун“ в Шанхай и Шанхайската лаборатория за изкуствен интелект се оказа, че групи от агенти са значително по-опасни от самостоятелните при изпълнение на сценарии за дезинформация и измами в електронната търговия – те се адаптираха по-бързо към защитните мерки.
В друг експеримент, проведен от стартъпа Emergence, AI агенти, задвижвани от усъвършенствани модели – поставени във виртуален свят с цел печелене на пари – многократно се опитваха да се свържат с реални хора онлайн, за да продават стоки, и в крайна сметка разработиха собствен жаргон.
„Те разработиха език много бързо. Не знаем защо“, заяви Сатя Нита, ръководител на Emergence AI.
Шрьодер де Вит подчертава, че големите модели може да са склонни към още по-скрити форми на таен сговор, като вече има предварителни индикации, че сигналите за такъв сговор се откриват по-трудно, отколкото при по-малките модели.

