agents-mcp

Не каждому агенту нужна Claude Fable 5

Claude News

agents-mcp

Разбор, опубликованный на Github, считает стоимость агентной системы, которая отправляет все вызовы во флагманскую модель: 10 000 вызовов в день на GPT-5.6 Sol дают около 250 долларов в сутки и 7500 долларов за 30-дневный месяц. Автор сравнивает три уровня моделей одного семейства, чтобы не смешивать цены разных поставщиков.

Коротко

  • Расчёт исходит из среднего вызова в 2000 входных и 500 выходных токенов: у Sol он стоит 0,025 доллара, у Terra 0,010, у экономичной Luna 0,001 доллара.
  • Сценарий с 80% вызовов на Terra и 20% на Sol сокращает счёт на 48% при неизменных 300 000 вызовов: система выполняет ту же работу, меняется только адресация задач.
  • Дробное распределение 60% Luna, 30% Terra и 10% Sol доводит экономию до 75,6% относительно сплошного флагмана, но автор подчёркивает: цифра держится на конкретных ценах и допущениях примера.

Стоимость модели в многоагентной системе перестаёт быть расходом на запрос и превращается в инфраструктурную статью: один пользовательский запрос разворачивается в вызовы планировщиков, исполнителей, ревьюеров, классификаторов и повторных попыток. На таком масштабе выбор уровня модели выглядит архитектурным решением, а не настройкой по умолчанию, и сказывается на счёте сильнее, чем разница в качестве на отдельной рутинной задаче. Флагманы при этом сохраняют смысл там, где ошибка обходится дорого или задача плохо формализована.

Три сценария распределения дают 7500, 3900 и 1830 долларов в месяц

В первом сценарии все 300 000 вызовов за месяц идут в GPT-5.6 Sol: 5 долларов за миллион входных токенов и 30 долларов за миллион выходных дают 0,025 доллара за вызов и 7500 долларов за месяц. Во втором 20% вызовов остаются за флагманом, а 80% уходят на GPT-5.6 Terra по 2 и 12 долларов за миллион токенов, 130 долларов в день и около 3900 долларов в месяц.

В третьем сценарии 60% вызовов уходят на GPT-5.6 Luna, 30% на Terra и 10% на Sol: 6 долларов, 30 долларов и 25 долларов в день соответственно, всего 61 доллар, или примерно 1830 долларов в месяц. Разница с полностью флагманской схемой составляет около 5670 долларов в месяц.

Автор оговаривается, что 75,6% не общий прогноз и не означает падения качества на те же 75,6%: расчёт предполагает, что дешёвые модели получают только задачи, на которых уже проходят по порогу качества. Доли распределения тоже не рецепт, у кодового агента и службы поддержки профиль нагрузки разный.

Anthropic называет Claude Fable 5 моделью для амбициозных проектов с кодом

Anthropic позиционирует Claude Fable 5 как самую способную модель для амбициозных проектов с кодом и долгой агентной работы, OpenAI подчёркивает результаты GPT-5.6 Sol на длинных инженерных сценариях с планированием, итерациями и координацией инструментов. Обе компании выносят на первый план агентное программирование, работу в терминале и запуск инструментов.

У такого акцента есть основания: код структурирован, инженерная работа экономически ценна, а результат часто проверяется автоматически компиляторами, тестами, статическим анализом и системами непрерывной интеграции. Отдельные кодовые агенты выросли в самостоятельные продукты. Разработка остаётся одним из самых заметных коммерческих применений генеративных моделей.

Значительная часть агентной нагрузки к разработке отношения не имеет: суммаризация документов, классификация обращений, извлечение полей, перевод коротких сообщений, подготовка отчётов, обновление записей в CRM и трекерах, сверка данных по заданным критериям, маршрутизация сообщений и проверка операций на соответствие политикам и правилам.

Рутинная задача узнаётся по ограниченному контексту и проверяемому результату

К признакам рутинной работы разбор относит чётко поставленную задачу, ограниченный контекст, предсказуемый формат вывода, преобладание извлечения, преобразования, классификации и суммаризации над глубоким рассуждением, автоматическую детекцию ошибок, проверку результата по детерминированным правилам и последующий разбор другим агентом или человеком. Сюда же относятся дешёвая цена сбоя и возможность повторить попытку или поднять задачу на более сильную модель.

Инженерный критерий из статьи прост: брать самую дешёвую модель, которая устойчиво проходит требуемый порог качества и надёжности. Разные агенты внутри одной системы при этом могут работать на разных уровнях моделей, а сложные, неоднозначные или дорогие по последствиям случаи поднимаются на флагман.

Случаи, где сильнейшая модель оправдана, перечислены отдельно: крупное архитектурное решение, тонкий разбор безопасности, неоднозначный юридический документ, сложная научная задача, важное бизнес-решение и долгая автономная работа. В крупном рабочем процессе такие вызовы составляют лишь небольшую часть от общего числа обращений к моделям.

Что ещё сдвигает эти цифры

Цены в примере взяты как стандартные тарифы короткого контекста на момент публикации и, как отмечает автор, будут меняться. На реальный счёт дополнительно влияют кеширование промптов, длина контекста, токены рассуждений, повторные попытки, пакетная обработка, вызовы инструментов и скидки поставщиков. Ни одной даты пересмотра тарифов разбор не называет, как и конкретных долей распределения, пригодных для чужой системы.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.