45% экономии у агента AWS тают до 28% рядом с DeepSeek

89 прогонов Terminal Bench 2.1 обошлись агенту Strands Harness с моделью Fable 5 в 56,29 доллара, тогда как Claude Code на тех же задачах потратил 248,05 доллара и набрал меньше баллов: 61,8 против 69,7. Цифры приводит AWS, которая выложила эту обвязку в открытый доступ, пишет Thenewstack.
Коротко
- AWS открыла код Strands Harness, готового агента общего назначения поверх своего SDK Strands Agents: файлы, шелл, веб, память, постоянные сессии, кеширование промптов и передача задач другим агентам.
- Среднее AWS считала по шести тестам как балл против стоимости задачи: рядом с Claude Code и Codex вышло на 45% дешевле при сопоставимой точности, а на Terminal Bench 2.1 с моделью Fable 5 разрыв с Claude Code дошёл до 77%.
- В широком сравнении 45% превращаются в 28%: DeepSeek Harness на сопоставимых прогонах оказалась примерно на 14% дешевле самого Strands Harness, хотя на Terminal Bench 2.1 набрала меньше баллов.
Если вы не следили за Strands: в мае 2025 года AWS представила Strands Agents, открытый Python-SDK для сборки агентов с тем, что она называет модельно-ориентированным подходом. Разработчик даёт модель, инструменты и инструкции, а модель сама решает, как взяться за задачу и когда дёрнуть инструмент. Позже SDK принесли в TypeScript, а в феврале появился отдельный дом для экспериментов, Strands Labs.
Bedrock стоит по умолчанию, но меняется одной строкой
Из коробки Strands Harness даёт рабочего агента с инструментами для файлов, шелла и веба и с готовой обработкой контекста, памяти, сессий, кеширования промптов и делегирования. Отдельного агента затачивают под задачу: меняют инструкции, выбирают модель, ограничивают набор инструментов и решают, вправе ли он передать работу другому агенту.
Почти ничего из этого не завязано на инфраструктуру AWS. Цикл агента, инструменты, управление контекстом, сессии и делегирование входят в открытый релиз и по умолчанию исполняются на той же машине, где запущен агент. Исключение одно: вызов модели идёт через Amazon Bedrock. По словам вице-президента AWS Марка Брукера, это единственный дефолт, привязанный к AWS, и он переопределяется одной строкой на Anthropic, OpenAI, Google или локальную модель в Ollama. Ни одна функция Bedrock не требует, говорит он.
Остальные умолчания тоже сменные: свои инструменты и навыки, подключение MCP-серверов, другая работа с контекстом, своё хранилище состояния сессий. В комплекте идёт CLI для интерактивного прототипирования, из которого собранный агент выгружается командой /export в код на Python или TypeScript, и Agent Skill, объясняющий кодовым агентам саму обвязку вплоть до конфигов развёртывания для AWS, GCP, Azure, Cloudflare и Modal.
45% против Claude Code и Codex превращаются в 28% рядом с DeepSeek
AWS усреднила баллы каждой обвязки по шести тестам — ALFWorld, ContextBench, GAIA, WebShop, τ³-bench и Terminal-Bench 2.1 — и сопоставила со средней стоимостью задачи на тех же прогонах. Против Claude Code и Codex у Strands Harness получилось на 45% дешевле при, как утверждает AWS, сопоставимой точности.
В более широком сравнении эта цифра падает до 28%. В него попала DeepSeek Harness, которая, по данным AWS, на сопоставимых прогонах вышла примерно на 14% дешевле Strands Harness. На Terminal Bench 2.1 с моделью Fable 5 разница в цене между Strands Harness и Claude Code составила 77% на 89 испытаниях; DeepSeek Harness на том же тесте стоила 40,30 доллара и набрала 59,5 балла.
Почему обвязка меняет счёт при одной и той же модели
Своим результатом AWS обязана прежде всего умолчаниям по контексту, и работают они в три приёма. Особенно крупные выводы инструментов обрезаются. Когда занятая часть окна переходит заданный порог, контекст уплотняется. Если окно всё же переполнилось, агент пытается выкрутиться прямо внутри своего цикла.
Окно контекста — всё, что модель держит перед глазами на каждом шаге, и оплачивается оно целиком, шаг за шагом. Представьте рюкзак фиксированного объёма: если каждый найденный камень тащить с собой до конца маршрута, места не останется уже к середине. Отсюда и довод AWS: собрать прототип — один шаг, а оценить, как эти решения бьют по цене и качеству, совсем другой, говорит Брукер. Именно эту инженерию в компании и решили упаковать в готового агента общего назначения.
AgentCore Harness и Strands Harness делает одна команда
У AWS есть и место, где такого агента запускать: Amazon Bedrock AgentCore, управляемый сервис для развёртывания и эксплуатации агентов с идентификацией, контролем доступа, наблюдаемостью и инфраструктурой под хостинг. AgentCore Harness и Strands Harness живут в разных кодовых базах, но пишет их одна команда, и работа над одним может подтягивать другое, говорит Брукер. Он же подчёркивает, что Strands Harness разворачивается отдельно от AgentCore и вообще вне AWS, а сам AgentCore называет необязательным слоем хостинга: все пути развёртывания оставлены на выбор разработчика.
Все цифры получены в собственном тестировании AWS, независимых прогонов пока нет. Из шести тестов конкретная модель названа только для Terminal Bench 2.1, это Fable 5, а на чём считались остальные пять, в описании не раскрыто, хотя именно сумма по ним даёт заявленные 45%. На наш взгляд, показательно, что AWS сама привела и вторую цифру, 28%, рядом с которой её преимущество выглядит куда скромнее.
Когда код выложат
Выкладка агента была назначена на понедельник. Дата стабильного релиза не объявлена, сроки, в которые наработки из открытого проекта доезжают до AgentCore Harness и обратно, тоже не названы. Самое интересное начнётся, когда те же шесть тестов прогонят не в AWS: сойдутся ли 45% экономии на чужих задачах, чужих моделях и чужих порогах уплотнения контекста.
Читайте также
- Claude Fable 5.1 пишет комментарии даже под запретом
- Opus 5.5 в ревью кода CodeRabbit ловит другие баги
- Дообучение MiMo-V2.6-Pro обошлось Xiaomi в 2,62 миллиона
- Codex после сжатия вспомнил 68 ответов из 178
- Jev дешевле Claude Fable в 274 раза, но точность 98%
- Агентам дали писать базу Perplexity, но не запускать её
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
