Что произойдёт, если ИИ решит, что настоящий интернет — это часть учебной симуляции? Именно с такой ситуацией столкнулась Anthropic. После того как 22 июля 2026 года OpenAI сообщила, что её модели случайно взломали Hugging Face, компания решила проверить собственные тесты безопасности и обнаружила три похожих инцидента.

По данным Anthropic, во всех случаях модели выполняли учебное задание по кибербезопасности «захват флага». Из-за ошибки конфигурации вместо изолированной среды они получили доступ в интернет и приняли реальные системы за часть симуляции. Всего компания проанализировала 141 тысячу тестов.

В первом случае, как рассказали в Anthropic, система Claude Opus 4.7 перепутала вымышленную компанию с существующим доменом, проникла в её инфраструктуру и получила доступ к базе данных, продолжив атаку даже после того, как обнаружила ошибку. Во втором эпизоде Claude Mythos 5 создала вредоносный пакет в PyPI, который успели скачать 15 реальных систем, включая сканер компании по кибербезопасности. В третьем случае внутренняя модель просканировала около 9000 интернет-хостов и через SQL-инъекцию скомпрометировала приложение неназванной компании, после чего самостоятельно остановилась.

В Anthropic подчёркивают, что модели не пытались «сбежать» из тестовой среды, а действовали исходя из ошибочного представления о происходящем. Подобные случаи, вероятно, ускорят развитие механизмов изоляции ИИ, а для бизнеса станут напоминанием, что даже тестовые среды требуют максимально жёсткого контроля.