ai-security

Тесты на безопасность ИИ не отражают реальных рисков

Promtime

ai-security

Исследование Cisco показало, что текущие бенчмарки безопасности бесполезны для оценки реальных угроз. Модели, которые проходят проверку на разовых запросах, легко взламываются в многошаговых диалогах.

Разрыв в показателях может достигать 55 процентных пунктов. GPT 5.4 показала 2.74% успеха атак при разовом запросе, но этот показатель вырос до 24.68% в многошаговом режиме. У Gemini 3 Pro рост был еще сильнее: с 18.10% до 73.35%.

Лучше всех справились модели Anthropic Claude, удержав уровень успеха атак в диапазоне от 11.16% до 16.20%. Самый слабый результат показал Grok 4.1 Fast с показателем 88.30%. При этом активация режима reasoning в Grok снизила уязвимость почти вдвое.

Cisco советует компаниям внедрять обязательные тесты на многошаговые атаки и проводить ручной аудит, если разрыв между типами тестов превышает 15%.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.