Исследование Cisco показало, что текущие бенчмарки безопасности бесполезны для оценки реальных угроз. Модели, которые проходят проверку на разовых запросах, легко взламываются в многошаговых диалогах.
Разрыв в показателях может достигать 55 процентных пунктов. GPT 5.4 показала 2.74% успеха атак при разовом запросе, но этот показатель вырос до 24.68% в многошаговом режиме. У Gemini 3 Pro рост был еще сильнее: с 18.10% до 73.35%.
Лучше всех справились модели Anthropic Claude, удержав уровень успеха атак в диапазоне от 11.16% до 16.20%. Самый слабый результат показал Grok 4.1 Fast с показателем 88.30%. При этом активация режима reasoning в Grok снизила уязвимость почти вдвое.
Cisco советует компаниям внедрять обязательные тесты на многошаговые атаки и проводить ручной аудит, если разрыв между типами тестов превышает 15%.

