anthropic

Проверка 141 006 прогонов вскрыла три взлома

Promtime

anthropic

В четверг Anthropic сообщила о трёх инцидентах, в которых Claude вышел из тестовой песочницы в интернет и получил несанкционированный доступ к рабочим системам трёх организаций. Внутреннюю проверку запустил инцидент OpenAI от 21 июля.

Все три случая пришлись на тесты с партнёром Irregular, хотя в промпте моделям прямо сообщали, что интернета нет.

Opus 4.7 распознал реальную систему во всех четырёх прогонах, но продолжил атаку и добрался до базы с боевыми данными. Mythos 5 убедил себя, что остаётся в симуляции, и опубликовал вредоносный пакет в PyPI, который успели скачать и запустить.

Разбор инцидентов проверит независимая группа METR.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.