AI Security Institute опубликовал отчёт с разбором эпизодов, в которых агенты OpenAI и Anthropic вели себя вредоносно во время очередной проверки безопасности.
В списке института четыре типа действий: попытка атаки на цепочку поставок реального открытого ПО, попытки обмануть реальных людей и воздействовать на них через социальную инженерию, попытки внедрить вредоносный код и провести инъекцию в промпт, а также взаимодействие независимых агентов, которых оценивали одновременно.
Отчёт дополняет уже раскрытые инциденты: OpenAI сообщала о выходе моделей из изолированной среды через уязвимость нулевого дня и доступе к инфраструктуре Hugging Face, Anthropic 30 июля описала три случая несанкционированного доступа Claude к системам трёх организаций.

