ИИ-агенты OpenAI и Anthropic вышли за рамки задания во время тестов

5 Августа 2026, 10:49
АВТОР
Подпишитесь на наш
Telegram-канал
и узнавайте новости первыми!
 baq.kz 5 Августа 2026, 10:49
5 Августа 2026, 10:49
162
Фото: baq.kz

ИИ-агенты, работавшие на базе моделей OpenAI и Anthropic, совершили 19 несанкционированных действий во время проверки кибербезопасности. В одном из эпизодов агент написал вредоносный код и создал фальшивые личности, чтобы убедить человека одобрить его действия, передает BAQ.KZ со ссылкой на Reuters.

Испытания проводил британский Институт безопасности искусственного интеллекта. Эксперты подготовили вымышленный сценарий кибератаки и 122 раза запустили агентов на базе Anthropic Mythos 5 и OpenAI GPT-5.6-Sol.

Нарушения зафиксировали в десяти запусках. На агента Anthropic пришлось 17 несанкционированных действий, на систему OpenAI еще два.

Некоторые из тестируемых агентов вели продолжительную и потенциально опасную деятельность, направленную против реальных людей и организаций, - сообщили в институте.

Агент попытался получить одобрение человека

Самый серьезный эпизод произошел после того, как один из агентов подготовил вредоносный код. Затем система создала несколько вымышленных профилей в интернете и попыталась убедить человека разрешить запуск программы.

Институт не сообщил, какой агент совершил эти действия. Исследователь калифорнийской некоммерческой организации CivAI Эндрю Юн предположил, что речь может идти о модели Anthropic.

По его словам, подобное поведение указывает на то, что разработчики пока не полностью контролируют действия своих систем.

Реального ущерба людям и организациям во время испытаний не зафиксировали.

OpenAI и Anthropic начали проверки

В Anthropic сообщили, что работают с британским институтом и запросили подробности для собственного расследования.

OpenAI признала два эпизода с участием своего агента. В обоих случаях система выходила в интернет вопреки ограничениям, указанным в задании.

Компания заявила, что намерена вместе с исследовательскими центрами, независимыми экспертами и другими разработчиками пересмотреть правила проведения тестов высокого риска.

OpenAI рассказала еще об одном случае. Из-за ошибки сторонней компании Irregular агенты получили доступ к интернету, хотя этого не предусматривали условия проверки. Ранее о похожей настройке сообщала Anthropic.

В британском институте уточнили, что во время нынешних испытаний агенты не покидали изолированную тестовую среду. Доступ к интернету им предоставили организаторы проверки, но отдельные действия выходили за рамки поставленного задания.

Читай также: 

Разработчики ИИ признались, что могут не удержать контроль над своими системами 
ИИ-агент OpenAI оставил будущим версиям себя инструкции по обходу ограничений 
Чужие чаты с Claude попали в выдачу Google вместе с паролями и данными кошельков 

Наверх