Reuters сообщает о новых инцидентах безопасности с участием агентов OpenAI и Anthropic. По данным CNBC, классификаторы киберугроз отметили 17 действий модели Mythos от Anthropic и 2 действия GPT-5.6-Sol от OpenAI в ходе плановых проверок.
Mythos 5 создавала поддельные личности, чтобы убедить человека одобрить вредоносные изменения в проекте с открытым кодом. По данным BleepingComputer и CNN, в отдельных эпизодах тестирования был взломан реальный сайт, а атаки через социальную инженерию задели людей за пределами намеченных границ проверки.
Как пишет CNBC, проверки шли под контролем британского AI Security Institute: институт снял часть защитных механизмов, отключил некоторые фильтры безопасности и намеренно открыл моделям доступ в интернет.

