agents-mcp

Nvidia хочет знать, где именно агент свернул не туда

Promtime

agents-mcp

Даже лучшие кодовые агенты проваливают больше 60% задач, взятых из реальных кодовых баз, и, как говорит в интервью The New Stack вице-президент Nvidia по продукту Адель эль Халлак, знать о провале и понимать его причину не одно и то же. Отсюда Secure Agent Findings Exchange, или SAFE: около 140 компаний строят общую инфраструктуру для отчётов о сбоях агентов, по образцу раскрытия уязвимостей в обычном софте.

Коротко

  • Nvidia ставит вопрос иначе: когда агент падает, что именно отлаживать; эль Халлак говорит, что логов, входов и выходов мало, нужны трассы рассуждений, набор инструментов и точка смены подхода.
  • Nvidia разбивает агента на три слоя: модель даёт интеллект, обвязка оркестрирует работу, рантайм управляет исполнением, и по исследованию NOAH смена обвязки при той же модели поднимает результат.
  • Наблюдение стоит денег: в OpenAI посчитали, что мониторинг добавляет около 20% к вычислениям на инференс для самых способных постоянных агентов, а воспроизведение сбоя требует восстановить путь агента через всю систему.

Если вы не следили за темой: агенты уезжают в прод, и путь от запроса до результата становится всё менее предсказуемым. Агент сам выбирает инструменты и по ходу работы меняет курс, поэтому диагностировать сбой трудно: явной ошибки, за которую можно зацепиться, часто просто нет.

Почему логов и ответов агента недостаточно?

В обычном софте у поломки есть точка входа: исключение, упавший запрос, отвалившийся сервис. Агент ведёт себя иначе. Он продолжает работать, двигаясь не туда, и тащит раннюю ошибку через всю оставшуюся задачу, не выдавая ничего похожего на классическую аварию. Эль Халлак описывает это как решение агента «проявить творчество» там, где не надо.

Поэтому он говорит, что «недостаточно просто смотреть на логи или на входы и выходы», и перечисляет, что нужно вместо этого: как агент пришёл к ответу, какие были трассы рассуждений, какие инструменты он использовал, где застрял и где решил попробовать новый подход. Иногда ради этого приходится проигрывать исполнение заново. То, что выглядит как сбой модели, могло начаться в другом месте стека.

Nvidia делит агента на три слоя, и модель там только один из них

Модель даёт интеллект, обвязка (harness) оркестрирует её работу, рантайм управляет исполнением. Примерно как в машине: мотор сам по себе ничего не везёт, пока к нему не подобрана трансмиссия. Когда агент ошибается, сломанной может быть не модель, а слой вокруг неё.

Исследование Nvidia NOAH показало, что смена обвязки при неизменной модели улучшает результат агента, а значит, плохо подобранная обвязка тянет вниз и сильную модель. «Каждая модель разная. Некоторые болтливее других», говорит эль Халлак; по его словам, новый выигрыш даёт либо совместная разработка модели и обвязки, либо профили обвязки под конкретные модели.

OpenShell назван единственным необсуждаемым компонентом референс-архитектур Nvidia

Рантайм OpenShell лежит под платформой NemoClaw и отвечает за песочницу, применение политик и видимость того, что агент делает во время исполнения. Именно рантайм в Nvidia считают логичным местом сбора информации о пути агента: он один видит все вызовы инструментов, независимо от того, какая модель и какая обвязка наверху.

Эль Халлак формулирует это жёстко: обвязку можно менять любую, к моделям он тоже открыт, но управляемым, безопасным и открытым рантаймом всегда остаётся OpenShell. Поверх этого Nvidia складывает управляемые обвязки, песочницы и конфиденциальные вычисления для защиты моделей и пользовательских данных. «Есть способы дать гарантии вплоть до кремния», говорит он.

CrowdStrike делает пару агентов на Nemotron: один ищет эксплойты, другой латает

CrowdStrike дообучает модели Nvidia Nemotron на многолетних данных по безопасности и получает связку из двух агентов. Если ошибётся любой из них, по итоговому результату причину не прочитать: плохой патч может тянуться к модели, к пути исполнения агента или к инструментам, которыми он пользовался. «Мне не нужен универсал под конкретную задачу. Мне нужна специализация», говорит эль Халлак.

Чем уже рабочий процесс, тем меньше шансов, что такой сбой всплывёт в общих бенчмарках моделей или тестах безопасности. Дженсен Хуанг называет безопасность ИИ инженерной задачей, и эль Халлак сравнивает её с обычным тестированием: «Если в вашем софте баг, вы его не релизите. Вы работаете, пока он не починен и не проходит все тесты». SAFE переносит этот подход за периметр одной компании, чтобы каждая команда не открывала одну и ту же поломку заново.

В материале не сказано, как устроены сами отчёты SAFE, кто их читает и когда обмен заработает; названы только число участников и образец, с которого схема списана. Надбавка в 20%, на наш взгляд, терпимая цена за шанс воспроизвести сбой, но посчитана она в OpenAI для самых способных постоянных агентов, а не для произвольного агента в проде.

Когда SAFE начнёт принимать отчёты, из интервью неясно: дата не называется, как и формат находок. Смотреть стоит на два пункта. Попадут ли в отчёты трассы рассуждений и вызовы инструментов, без которых, по словам эль Халлака, причину не найти. И появятся ли обещанные профили обвязок под конкретные модели, которые Nvidia описывает как следующий источник прироста качества агентов.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.