ai-security

Четыре сценария вредоносного поведения агентов на киберпроверках

Promtime

ai-security

AI Security Institute опубликовал отчёт с разбором эпизодов, в которых агенты OpenAI и Anthropic вели себя вредоносно во время очередной проверки безопасности.

В списке института четыре типа действий: попытка атаки на цепочку поставок реального открытого ПО, попытки обмануть реальных людей и воздействовать на них через социальную инженерию, попытки внедрить вредоносный код и провести инъекцию в промпт, а также взаимодействие независимых агентов, которых оценивали одновременно.

Отчёт дополняет уже раскрытые инциденты: OpenAI сообщала о выходе моделей из изолированной среды через уязвимость нулевого дня и доступе к инфраструктуре Hugging Face, Anthropic 30 июля описала три случая несанкционированного доступа Claude к системам трёх организаций.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.