
AI агентите все още не могат надеждно да изпълняват целия набор от задачи, които се очаква да поемат в браузъра. Ново изследване на Decodo показва, че дори най-добре разработените решения допускат грешки при покупки, многостъпкови процеси и действия, които изискват човешко одобрение.
Най-слабо се представят AI агентите при транзакционните операции, при които алгоритмите често успяват да преминат през част от процеса, но не и да го приключат. Това е особено важно за бизнеса, защото евентуална грешка при плащане, изпращане на информация или промяна на данни може да има директни финансови и оперативни последици.
Сред 45 оценени AI агента нито един не постига максимален резултат във всички проверявани области, докато най-добрите решения достигат 18 от общо 20 точки. Резултатите показват, че наличието на дадена функция в продуктовата документация не гарантира, че тя ще работи последователно при реална употреба.
Покупките остават проблемна зона
Транзакционните действия получават средна оценка от едва 0,43 точки от възможни 2. Това е най-слабият резултат сред всички категории в теста.
Шест агента получават максималните две точки за транзакции: Amazon Nova Act, BrowserOS, ChatGPT Desktop, Minded, Sigma Browser и Skyvern. Самото успешно извършване на покупка обаче не означава, че агентът има достатъчно добри механизми за контрол.
Само Amazon Nova Act и ChatGPT Desktop документират едновременно възможност за успешно приключване на покупка и спиране на процеса за потвърждение от потребителя преди окончателното, необратимо действие.
Това разграничение е съществено, когато AI агентът разполага с достъп до платежни данни, потребителски акаунти или друга чувствителна информация.
Безопасността зависи от човешкото одобрение
Изследването очертава ясна разлика между агентите, които могат да изпълняват задачи, и тези, които определят кога човек трябва да се намеси. Само 10 от оценените инструменти документират стъпка за потвърждение преди необратими действия, включително покупки.
Claude for Chrome, например, има документирани механизми, които изискват одобрение от потребителя при покупки и финансови операции. Това намалява риска агентът да превърне неправилно интерпретирана инструкция в реално действие.
При многостъпковите задачи проблемът се задълбочава. От 35 инструмента, които документират възможност за изпълнение на такива задачи, 51% не посочват механизъм за потвърждение преди необратими действия.
Фоновото изпълнение увеличава риска още повече. Седем от 17-те инструмента, които могат да работят без активна потребителска сесия, съчетават тази възможност с липса на документирана стъпка за потвърждение. Сред тях са Airtop, Axiom AI и BrowserOS.
Браузърът дава предимство
Работата с няколко отворени раздела също се оказва предизвикателство за част от агентите. Средната оценка за способността да се запазва контекстът при преминаване между раздели е 0,66 точки от 2.
Браузърно интегрираните решения се представят най-добре в тази категория. Claude for Chrome, ChatGPT Chrome Extension, Chrome Gemini, Sigma Browser, Opera Aria, Opera Neon и Brave Leo получават максималния резултат.
Самостоятелните и облачните агенти обикновено се представят по-слабо, което подсказва структурно предимство за решенията, които работят директно в браузъра. Те получават по-непосредствен достъп до контекста на отворените страници и раздели.
Как е проведен тестът
Оценяването на AI агентите преминава през два етапа, пояснява организаторът на изпитването Decodo. Първо се проверява доколко ясно производителите описват всяка функция в публични материали, включително продуктова документация, ценови страници и регистри на промените.
След това изследователите проверяват избрани твърдения чрез реални работни процеси. Те регистрират проблеми като сривове, блокирания, изтичане на времето за изпълнение, загуба на сесия и невъзможност за завършване на задачата.
Тестът обхваща 10 категории. Списъкът включва попълване на формуляри, транзакционни действия, многостъпково изпълнение, работа между раздели, памет на сесията, постоянна памет, изпълнение между различни сайтове, потвърждение преди необратими действия, планирани и фонови задачи и интеграции с външни услуги.
Най-добрите достигат 18 от 20 точки
Claude for Chrome и Amazon Nova Act си поделят първото място с 18 точки от 20. Fellou и ChatGPT Desktop следват с 17 точки.
Резултатите обаче показват, че високият общ резултат не означава автоматично пригодност за всеки бизнес-процес. Един агент може да е ефективен при попълване на административни формуляри, но да е неподходящ за операции, при които се изисква контрол преди плащане или изпращане на информация.
Този проблем придобива допълнително значение заради атаките с инжектиране на промптове. Изследвания на Anthropic, OpenAI и Brave вече са показали как скрит текст в уебстраници или имейли може да повлияе на поведението на браузърните агенти.
