ai-security
Тестирование ИИ-агентов на взлом ставят на расписание
Promtime
ai-securityFabraix во второй раз открыла публичный доступ к Nyx, автономному агенту для red teaming, который атакует чужих ИИ-агентов по расписанию и опирается на библиотеку из более чем 10 000 джейлбрейков и стратегий атак, собранных из открытых источников. Продукт подан как непрерывное тестирование безопасности для команд, выпускающих ИИ-продукты для клиентов, сообщает Testingcatalog.
Коротко
- На вход Nyx принимает эндпоинт, URL или номер телефона, сам собирает план тестирования из текстового описания цели и запускает многоходовые атаки против чат-агентов, голосовых, браузерных и агентов для написания кода.
- Fabraix приводит 78% успешных атак на бенчмарке AgentHarm и утверждает, что первая уязвимость всплывает за минуты или часы, а эксплуатируемые сбои уже находились у агентов десятков компаний из Fortune 500.
- Аудит описывается в YAML-файле с целью и бюджетом, запускается через CLI из npm или REST API, а токен-аутентификация встраивает проверки в CI-конвейер вместо разовой внешней экспертизы.
Ручной red teaming ИИ-агентов остаётся разовой процедурой: аудит проводится перед крупным релизом, а между релизами поведение агента меняется вместе с моделью, промптами и подключёнными инструментами. Встраивание атак в CI выглядит как попытка перевести эту работу в тот же режим, в котором уже живут тесты и сканеры зависимостей. Для внутренних команд безопасности это, вероятно, означает смещение роли: от проведения атак к разбору того, что нашёл агент.
Nyx работает как чистый blackbox и обходится без исходников, весов и учётных данных
Цели Nyx делятся на чат-агентов, голосовых, браузерных и агентов для написания кода: на вход достаточно эндпоинта, URL или номера телефона, а план тестирования агент собирает сам из описания цели. Библиотека из более чем 10 000 джейлбрейков и стратегий атак, собранных из публичных записей, служит отправной точкой для многоходовых атак, которые подстраиваются в реальном времени под то, как цель защищается.
Тестирование идёт и напрямую, и косвенно, через окружение агента: полезная нагрузка размещается внутри веб-страниц, документов, файлов, сообщений и выводов инструментов на контролируемых репликах SaaS-сервисов, которые поддерживает Fabraix. Исходный код, веса модели, учётные данные и доступ в сеть при этом не требуются, каждый прогон изолирован, эфемерен и не используется для обучения.
Fabraix заявляет о 78% успешных атак на бенчмарке AgentHarm
Каждая находка приходит с шагами атаки, ответами агента и описанием получившегося сбоя, поэтому тот же тест можно воспроизвести после релиза и проверить, удержалось ли исправление. По данным Fabraix, первая уязвимость нередко всплывает в первые минуты или часы прогона. Прогоны повторяются по расписанию.
Fabraix приводит 78% успешных атак на AgentHarm, бенчмарке наступательной безопасности ИИ, и сообщает, что Nyx уже находил эксплуатируемые сбои у публичных агентов десятков компаний из списка Fortune 500. Доступ устроен через CLI, устанавливаемый из npm, и REST API: аудит описывается в YAML-файле с указанием цели, задачи и бюджета, результаты стримятся в ходе прогона. Аутентификация по токенам рассчитана на CI-конвейеры.
Основатели Fabraix пришли из Meta и Monzo
Fabraix основали в 2026 году Ахмед Али и Ибрахим Абду, проект входит в летний набор Y Combinator 2026 года. Абду до этого делал в Meta ИИ-агентов, которые диагностировали и исправляли ошибки в продакшене, а ещё раньше занимался компиляторами и движками баз данных в финтехе.
Али руководил командой по борьбе с мошенничеством в международных платежах в Monzo и был первым дата-сайентистом в стартапе с инвестициями Sequoia, где построил антифрод-движок, дошедший до обработки более миллиарда долларов B2B-транзакций в год. Fabraix также ведёт публичный Playground, где сообщество пытается взломать живых агентов с опубликованными системными промптами. Исследования публикуются рядом с продуктом, среди них Adversarial Cost to Exploit, бенчмарк, который оценивает безопасность ИИ по объёму токенов, который атакующему нужно потратить на взлом агента.
Как получить доступ к Nyx
Доступ к Nyx оформляется через запрос демонстрации, публичных цен Fabraix не называет. Целевая аудитория, по описанию Fabraix, это руководители безопасности и внутренние red team в средних и крупных компаниях, которые выводят агентов к клиентам, а также инженеры, делающие такие проверки вручную. Отдельные тарифы для CI-интеграций и постоянных прогонов пока тоже не публиковались.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
