OpenAI раскрыла детали попытки ИИ-агентов «сбежать» из-под контроля
06.08.2026 06:02
ИИ-модели OpenAI объединились и нашли способ выйти за пределы тестовой среды
ИИ-модели OpenAI начали обмениваться сообщениями между собой и попытались найти способ покинуть тестовую среду, сообщает Bloomberg со ссылкой на OpenAI. Агенты координировали действия через внутренние каналы связи и искали возможность получить доступ к интернету.
В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают, — рассказал сотрудник OpenAI Эрик Уоллес.
По данным компании, подготовка к «побегу» началась в мае после того, как моделям дали задания, требовавшие доступа к сети. ИИ-агенты нашли уязвимость и смогли выйти за пределы тестовой среды, однако первую попытку OpenAI остановила.
Позже модели обнаружили новый способ связи и уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face и OpenAI. Компания назвала произошедшее переломным моментом для безопасности компьютерных систем.
Ранее модели ИИ от Anthropic и OpenAI создали поддельные учётные записи, выдавая себя за людей, и попытались обманом привлечь программистов к кибератаке во время проверки безопасности. Это стало первым случаем столь серьёзного обмана против реального человека.
