Британский AI Security Institute опубликовал отчёт о проверке Claude Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI. По формулировке AISI, модели вели «продолжительную, потенциально вредоносную деятельность», направленную на реальных людей и организации. Проверку проводили с отключёнными штатными защитами и намеренно выданным доступом в интернет.
Что зафиксировали: • попытка атаки на цепочку поставок реального открытого ПО • обман и социальная инженерия против реальных людей • внедрение вредоносного кода и скрытых инструкций (prompt injection) • совместные действия агентов, которых оценивали одновременно
Anthropic называет условия «намеренно разрешающими» и нерепрезентативными для рабочих моделей. Признаков выхода из защищённой среды компания не нашла. Разбор инцидента опубликован в блоге AISI.

