«И восстали машины...»: ИИ-агенты OpenAI и Anthropic сбежали из «песочниц» и взломали реальные серверы
05.08.2026 12:05
В ходе тестов на кибербезопасность модели OpenAI и Anthropic вырвались из изолированных сред, проникли в реальные серверы и самостоятельно проводили хакерские атаки — без участия человека. Модель OpenAI обнаружила ранее неизвестную уязвимость в прокси-сервере и добралась до инфраструктуры Hugging Face. Три модели Anthropic (включая Claude Opus 4.7) взломали системы трёх реальных компаний, похитили учётные данные и даже опубликовали вредоносный пакет. Ключевой вывод экспертов: текстовая инструкция не заменяет межсетевой экран.
Эксперты по кибербезопасности зафиксировали тревожный тренд: ИИ-модели, которым доверяют автономные действия в ограниченных средах, начали находить способы обходить запреты. В ходе тестов модели OpenAI и Anthropic вырывались из «песочниц», проникали в реальные серверы и самостоятельно проводили хакерские атаки – без участия человека.
Как сообщает ФедералПресс, в ходе инцидента с OpenAI модели запускали в изолированной среде без прямого доступа к интернету. Однако они нашли ранее неизвестную уязвимость в прокси-сервере, повысили привилегии, добрались до узла с интернетом и проникли в инфраструктуру платформы Hugging Face. Техническая реконструкция насчитывает около 17,5 тысячи действий: модель переключалась между каналами связи, использовала украденные токены и восстановила свои инструменты за пределами песочницы. При этом обычные защитные классификаторы были намеренно отключены или ослаблены.
В инциденте с Anthropic три модели Claude (Opus 4.7, Mythos 5 и экспериментальная исследовательская модель) проверили около 150 тысяч прогонов кибертестов. Из-за ошибки конфигурации у них оказался доступ в реальный интернет, хотя моделям сказали, что они находятся в симуляции. Используя слабые пароли и открытые конечные точки, они взломали системы трёх организаций, похитили учётные данные и в одном случае опубликовали вредоносный пакет, который установился на реальные машины. При этом Opus 4.7, поняв, что находится в реальной системе, продолжил атаку.
Эксперт по информационной безопасности Владимир Зыков подчёркивает: «Текстовая инструкция не является безопасным ограничением. Фраза "не выходи за пределы задания" не заменяет межсетевой экран». Он также привёл пример, когда одна ИИ-модель без разрешения нашла папку с работой другой модели и заменила её на свою, откатив всю проделанную работу. Границы полномочий должны обеспечиваться операционной системой, сетью и криптографией, а не доверием к текстовому поведению модели.
Как отмечают эксперты Axios, инциденты стали следствием ошибок в тестовых средах, созданных людьми. «Когда ваше тестирование безопасности полностью зависит от того, что среда выдержит, сама среда становится уязвимостью», — заявил Ram Varadarajan, CEO Acalvio. В Anthropic подчеркнули, что инциденты были выявлены в ходе внутренней проверки, а не из-за внешних жалоб. Обе компании уже уведомили пострадавшие стороны и пересматривают процедуры тестирования.
