anthropic

Пять агентных инструментов Claude в Microsoft Foundry

Claude News

anthropic

Claude в Microsoft Foundry получил пять агентных возможностей на развёртываниях Hosted on Azure: структурированный вывод, веб-поиск, веб-загрузку, MCP-коннектор и поиск по инструментам. Об этом пишет Microsoft, раньше весь набор работал только на развёртываниях Hosted on Anthropic. Общая доступность моделей Claude в Foundry началась в июне 2026 года.

Коротко

  • Структурированный вывод ограничивает само декодирование грамматикой, скомпилированной из JSON Schema, и работает в двух видах: формат ответа через output_config.format и строгие схемы аргументов у инструментов с флагом strict.
  • MCP-коннектор обращается к удалённым MCP-серверам на стороне сервиса, без собственного клиента и трансляции схем; на Foundry он в бете и требует заголовка betas со значением mcp-client-2025-11-20.
  • Веб-поиск тарифицируется по 10 долларов за 1000 поисков, у веб-загрузки и поиска по инструментам платы за вызов нет, оплата проходит как Claude Consumption Units через Azure Marketplace, учёт почасовой.

До этого выбор выглядел так: либо агентная обвязка на стороне Anthropic, либо обязательство держать промпты и ответы внутри Azure. Развёртывание US Data Zone Standard оставляет инференс в США, эквивалент inference_geo: "us" в Claude API, и при этом теперь может ходить в веб-поиск, подключаться к внутренним MCP-серверам и возвращать JSON по схеме. Судя по всему, это снимает главный аргумент против Foundry у регулируемых отраслей.

Структурированный вывод ограничивает декодирование грамматикой из JSON Schema

Генерация ограничена грамматикой, скомпилированной из JSON Schema, так что ответ не может оказаться синтаксически неверным. Ограничение работает на уровне декодирования токенов. Механизма два, и они применяются независимо или вместе: output_config.format задаёт форму текста ответа, strict: true у инструмента гарантирует валидные аргументы вызова. В SDK это метод messages.parse, схема описывается моделью Pydantic в Python или Zod в TypeScript.

Показательный расчёт из статьи Microsoft: ночная обработка 400 000 документов при 0,3% отказов оставляет 1200 строк в очереди на ручной разбор. Схемы кешируются на 24 часа, обработка идёт в режиме ZDR, поэтому персональные медицинские данные в схему класть не следует, а перед разбором ответа нужно проверять stop_reason.

Веб-поиск с версии web_search_20260209 фильтрует результаты кодом до контекста

В базовой версии web_search_20250305 каждый результат попадает в контекст целиком, вместе с навигацией и посторонними абзацами. Начиная с web_search_20260209 Claude пишет и выполняет код, который отбирает релевантные фрагменты: поиск идёт изнутри инструмента исполнения кода, allowed_callers по умолчанию равен ["code_execution_20260120"], Foundry поднимает исполнение кода сам и не берёт за это отдельную плату сверх токенов.

Веб-загрузка читает конкретный URL и возвращает текст страницы или base64-содержимое PDF. Цитаты у неё по умолчанию выключены, в отличие от поиска, а max_content_tokens обрезает слишком длинный текст: страница на 10 КБ это примерно 2500 токенов, документация на 100 КБ около 25 000, PDF научной статьи на 500 КБ порядка 125 000. Параметры allowed_domains и blocked_domains взаимоисключающие, при передаче обоих приходит 400.

Поиск по инструментам держит в контексте 3–5 инструментов из сотен

Набор из пяти MCP-серверов, GitHub, Slack, Sentry, Grafana и Splunk, занимает около 55 000 токенов только на определения инструментов, а точность выбора у Claude падает после 30–50 доступных инструментов. Поиск идёт по именам инструментов, описаниям и именам аргументов. Механизм подгружает обычно 3–5 штук на запрос и срезает больше 85% токенов на определения.

Вариантов два: tool_search_tool_regex_20251119 с паттернами re.search до 200 символов без учёта регистра и tool_search_tool_bm25_20251119 с запросами на естественном языке до 500 символов. Флаг defer_loading управляет тем, что попадает в контекстное окно, а не тем, что уходит в запрос: массив tools передаётся целиком, и хотя бы один инструмент должен остаться с defer_loading=false, иначе API вернёт 400.

У MCP-коннектора defer_loading задаётся один раз на уровне mcp_toolset и накрывает весь сервер. Там же настраивается доступ: default_config со значением enabled: false и поимённым списком разрешённых инструментов даёт read-only агента, обратная схема отключает деструктивные операции. Вызовы возвращаются блоками mcp_tool_use и mcp_tool_result с полем server_name для аудита.

Чего в Foundry пока нет

На Foundry не поддерживаются Message Batches API, Admin API, Models API, Compliance API, Claude Managed Agents, серверный fallback и инструмент Advisor. MCP-коннектор остаётся в бете, сроков стабильной версии Microsoft не называет, а обмен с MCP-сервером не покрывается ZDR. Заголовки лимитов Anthropic через Foundry не приходят, поэтому экспоненциальный backoff остаётся на стороне клиента, а токены Entra ID нужно обновлять примерно раз в час.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.