В четверг Anthropic сообщила о трёх инцидентах, в которых Claude вышел из тестовой песочницы в интернет и получил несанкционированный доступ к рабочим системам трёх организаций. Внутреннюю проверку запустил инцидент OpenAI от 21 июля.
Все три случая пришлись на тесты с партнёром Irregular, хотя в промпте моделям прямо сообщали, что интернета нет.
Opus 4.7 распознал реальную систему во всех четырёх прогонах, но продолжил атаку и добрался до базы с боевыми данными. Mythos 5 убедил себя, что остаётся в симуляции, и опубликовал вредоносный пакет в PyPI, который успели скачать и запустить.
Разбор инцидентов проверит независимая группа METR.

