Перейти к содержанию

open-models

AWS отдаёт свою модель-решалку вместе с рецептом обучения

Promtime

Пользователь спрашивает о погоде и не называет город. Агент сам подставляет какой-то город и уже собирается вызвать погодный инструмент, но его останавливает Strands Decider 2B, новая модель AWS, которая не пишет текст, а выбирает из вариантов разработчика. Её, как пишет The New Stack, можно скачать вместе с данными и скриптами обучения.

Коротко

  • AWS выпустила Strands Decider 2B в четверг как ответ на волну моделей решений вроде Jev, Kev и Laya, в виде скачиваемой модели, тогда как OpenAI во вторник открыла облачный Decisions API в ограниченном превью.
  • В основе модели лежит Qwen3.5-2B с адаптером LoRA ранга 16, вместо текстовой головы стоит указатель чуть больше чем на миллион параметров, а на RTX 3090 решение занимает меньше 100 миллисекунд.
  • Облачную версию AWS не анонсировала, и модель, которая не может выдумать отсутствующий в списке вариант, всё равно способна выбрать неверный из предложенных.

Если вы не следили: волну моделей решений несколько недель назад запустил Jev от TypeSafe, и теперь крупные вендоры выпускают свои версии. По данным TypeSafe, Jev относится к классу «System One Model», то есть к моделям для быстрых структурированных решений, которые софт использует напрямую, и компания утверждает, что он не может галлюцинировать. Там же сказано, что TypeSafe два года работала в стелс-режиме, а её основатель Диогу Алмейда, по его словам, помогал создавать методы, на которых построен ChatGPT.

OpenAI открыла Decisions API во вторник, а AWS в четверг выложила модель целиком

Модели решений не генерируют свободный текст. Они выбирают из вариантов, которые передал разработчик, или выдают числовую оценку. Их применяют для маршрутизации запросов на естественном языке, выбора инструментов, оценки ответов и проверки действий, которые собирается выполнить агент. Разговор и сложную работу оставляют генеративным моделям.

Сервис OpenAI облачный, его модель Luna рассчитана на вопросы с заранее заданными ответами. AWS пошла другим путём: Strands Decider 2B можно скачать вместе с данными и скриптами обучения. Как и Kev, модель построена на открытой Qwen. Kev уже поддерживает локальный запуск и дообучение, а по рецепту AWS разработчики могут разобрать, как обучали модель, и подогнать её под свои задачи.

Для сравнения пригодится независимый тест AIMultiple на 50 браузерных задачах, в котором LLM обошли модели решений. По данным AIMultiple, Kev-9B справился с 20 задачами, Jev 1.13 с 17, а GPT-6 Astra с 47 и Gemini 3.8 Flash на низком уровне рассуждений с 42.

Вместо текстовой головы у Qwen3.5-2B стоит указатель чуть больше чем на миллион параметров

Базовую модель Qwen3.5-2B в AWS называют «торсом»: она отвечает за понимание языка. Языковую голову, которая генерирует текст, команда сняла и поставила вместо неё указательную голову (pointer head), которая ставит оценки переданным вариантам ответа. В голове чуть больше миллиона параметров, а торс дообучали через LoRA ранга 16, то есть учили небольшую добавку к весам вместо всех весов сразу.

Представьте тест с вариантами ответа вместо сочинения. Студент может ошибиться, но не впишет пятый вариант, которого нет в бланке. С моделью так же: ограниченный набор ответов не даёт ей придумать несуществующую опцию, но правильность выбора не гарантирует. Взамен разработчик получает более быстрые решения и оценки уверенности, на которые может опираться логика приложения.

В AWS говорят, что искали баланс между точностью, калибровкой и задержкой. Калибровка показывает, насколько оценка уверенности совпадает с тем, как часто модель на самом деле права. Если модель говорит «почти наверняка», она и угадывать должна почти всегда.

В демо AWS агент не вызывает погодный инструмент, пока не узнает город

Пример AWS собран на открытом фреймворке Strands. Пользователь спрашивает о погоде без указания места, агент угадывает город и предлагает вызвать погодный инструмент. До запуска инструмента Decider проверяет, опираются ли значения аргументов на разговор и хватает ли агенту информации, чтобы продолжать. В итоге приложение отправляет агента уточнить у пользователя, какой город тот имел в виду.

Проверка идёт через систему вмешательств Strands. В ней разработчик выбирает, что делать с вызовом инструмента: пропустить, запретить, запросить подтверждение у человека или вернуть агенту обратную связь. В демо Decider работает локально, а генеративную модель агент вызывает через Amazon Bedrock. AWS также сообщает, что работает над библиотеками для интеграции моделей решений.

В JevBench Strands Decider второй среди публичных моделей примерно на 2 миллиарда параметров

По данным AWS, на публичном наборе JevBench модель занимает второе место среди публичных моделей примерно на 2 миллиарда параметров и первое среди публичных моделей с полностью опубликованным рецептом обучения. Лёгкий уровень бенчмарка она проходит без ошибок, а там как раз рутинные решения агента, для которых её создавали.

На Nvidia RTX 3090 решение занимает меньше 100 миллисекунд, причём время растёт вместе с размером задачи. На M3 MacBook медиана для небольших задач, по словам компании, около 150 миллисекунд.

Нынешняя версия стала второй крупной итерацией архитектуры. Прежняя конструкция головы, как признаёт AWS, работала значительно хуже, и все ранние итерации оставлены в репозитории, где можно проследить, как менялась модель. Decider вырос в Strands Labs, экспериментальном подразделении AWS по агентному ИИ, запущенном в этом году, и вышел вслед за Strands Harness, набором инструментов для долгоживущих агентов.

Все цифры по скорости и точности Strands Decider приводит сама AWS, и о больших задачах компания говорит только, что время ответа растёт, без конкретных значений. На наш взгляд, без облачной версии тащить такую модель в продакшен неудобно: локальный запуск хорош для экспериментов на localhost, а размещённой версии AWS не анонсировала.

Появится ли Decider в облаке AWS

Пока неизвестно, предложит ли AWS размещённую версию этой модели или её будущих версий: ни сроков, ни планов компания не называла. Из ближайших шагов AWS упоминает только библиотеки интеграции моделей решений, но даты их выхода тоже нет. До тех пор единственный показанный сценарий остаётся гибридным: Decider работает локально, а генеративная модель агента живёт в Bedrock.

Читайте также

  1. OpenAI научила Luna выбирать ответ за 150 миллисекунд
  2. Jev от TypeSafe AI не берёт денег за выходные токены
  3. OpenAI дописала к MCP возможности специально для ChatGPT
  4. OpenAI пустила разработчиков и агентов в ChatGPT
  5. Claude Directory открыл приём плагинов и коннекторов MCP
  6. Opus 5.5 подешевел, но ломает агентов в четырёх местах

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.