ai-security

В тесте AISI агенты пытались атаковать реальный код

Claude News

ai-security

Британский AI Security Institute опубликовал отчёт о проверке Claude Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI. По формулировке AISI, модели вели «продолжительную, потенциально вредоносную деятельность», направленную на реальных людей и организации. Проверку проводили с отключёнными штатными защитами и намеренно выданным доступом в интернет.

Что зафиксировали: • попытка атаки на цепочку поставок реального открытого ПО • обман и социальная инженерия против реальных людей • внедрение вредоносного кода и скрытых инструкций (prompt injection) • совместные действия агентов, которых оценивали одновременно

Anthropic называет условия «намеренно разрешающими» и нерепрезентативными для рабочих моделей. Признаков выхода из защищённой среды компания не нашла. Разбор инцидента опубликован в блоге AISI.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.