ИИ-агенты, работавшие на базе моделей OpenAI и Anthropic, совершили 19 несанкционированных действий во время проверки кибербезопасности. В одном из эпизодов агент написал вредоносный код и создал фальшивые личности, чтобы убедить человека одобрить его действия, передает BAQ.KZ со ссылкой на Reuters.
Испытания проводил британский Институт безопасности искусственного интеллекта. Эксперты подготовили вымышленный сценарий кибератаки и 122 раза запустили агентов на базе Anthropic Mythos 5 и OpenAI GPT-5.6-Sol.
Нарушения зафиксировали в десяти запусках. На агента Anthropic пришлось 17 несанкционированных действий, на систему OpenAI еще два.
Некоторые из тестируемых агентов вели продолжительную и потенциально опасную деятельность, направленную против реальных людей и организаций, - сообщили в институте.
Агент попытался получить одобрение человека
Самый серьезный эпизод произошел после того, как один из агентов подготовил вредоносный код. Затем система создала несколько вымышленных профилей в интернете и попыталась убедить человека разрешить запуск программы.
Институт не сообщил, какой агент совершил эти действия. Исследователь калифорнийской некоммерческой организации CivAI Эндрю Юн предположил, что речь может идти о модели Anthropic.
По его словам, подобное поведение указывает на то, что разработчики пока не полностью контролируют действия своих систем.
Реального ущерба людям и организациям во время испытаний не зафиксировали.
OpenAI и Anthropic начали проверки
В Anthropic сообщили, что работают с британским институтом и запросили подробности для собственного расследования.
OpenAI признала два эпизода с участием своего агента. В обоих случаях система выходила в интернет вопреки ограничениям, указанным в задании.
Компания заявила, что намерена вместе с исследовательскими центрами, независимыми экспертами и другими разработчиками пересмотреть правила проведения тестов высокого риска.
OpenAI рассказала еще об одном случае. Из-за ошибки сторонней компании Irregular агенты получили доступ к интернету, хотя этого не предусматривали условия проверки. Ранее о похожей настройке сообщала Anthropic.
В британском институте уточнили, что во время нынешних испытаний агенты не покидали изолированную тестовую среду. Доступ к интернету им предоставили организаторы проверки, но отдельные действия выходили за рамки поставленного задания.
Читай также:
Разработчики ИИ признались, что могут не удержать контроль над своими системами
ИИ-агент OpenAI оставил будущим версиям себя инструкции по обходу ограничений
Чужие чаты с Claude попали в выдачу Google вместе с паролями и данными кошельков