Перейти к содержанию

model-releases

У Microsoft-Decision-1 выходные токены бесплатные

Promtime

Microsoft-Decision-1 не берёт денег за ответ: выходные токены бесплатны, а миллион входных стоит 0,042 доллара. Такую цену назвала Microsoft в анонсе модели. Модель нужна для быстрых решений, она уже доступна в Microsoft Foundry и, по словам компании, скоро появится в OpenRouter.

Коротко

  • Microsoft-Decision-1 построена на Qwen3.5-9B: Microsoft дообучила открытую модель Alibaba выносить решение за один проход и обещает позже пересобрать её на базе MAI и моделей OpenAI.
  • Модель получает фиксированный список вариантов и возвращает откалиброванную вероятность для каждого; по замерам Microsoft, среди сравнённых моделей она самая точная на 36 бенчмарках и в 35 раз быстрее GPT-6 Sol.
  • Все цифры получены на тестах самой Microsoft, независимой проверки в анонсе нет, а свободный текст модель не пишет: она только выбирает среди заданных вариантов и ставит им вероятности.

Если вы не следили за Qwen, Qwen3.5-9B выложена с открытыми весами под лицензией Apache-2.0. Внутри плотная модель на 9 миллиардов параметров с 32 слоями и родным контекстом 262 144 токена. По данным AI/TLDR, её выпустили 2 марта 2026 года вместе с версиями на 4B, 2B и 0,8B. Foundry работала с Qwen и раньше: Qwen3-32B в каталоге доступна только для дообучения, без инференса базовой модели.

Microsoft-Decision-1 оказалась точнее соперников на 36 бенчмарках и почти 150 000 вопросов

Главное сравнение Microsoft построено на 36 публичных и закрытых бенчмарках, в сумме почти 150 000 вопросов, скрытых от модели при обучении. Соперников компания взяла из числа лучших публичных моделей открытого лидерборда JevBench, и Microsoft-Decision-1 показала среди них самую высокую точность. Кроме того, модель прогнали через десятки закрытых от обучения тестов: маршрутизация, ранжирование, длинный контекст, многоязычные задачи, задачи вне обучающего распределения, рассуждения и безопасность.

По скорости она тоже вышла первой среди измеренных. Модель в 4,5 раза быстрее Quyet-1.0-Large, занявшей второе место, и примерно в 35 раз быстрее GPT-6 Sol по медианной задержке P50, то есть по времени, в которое укладывается половина запросов. В приложении к анонсу перечислены и остальные участники: Surogate Rune 26B-A4B, GPT-6 Luna Decisions, deck-31B, H2O-Lightning-4B и Strands-Decider 2B.

При восьми видах искажений запроса модель меняет решение в 1,3% случаев

Устойчивость Microsoft проверяла так: один и тот же запрос искажали восемью способами и считали, как часто меняется решение. В реальной работе формулировки перефразируют, описания вариантов правят, варианты переставляют, ключи меняются, в форматировании появляется мусор. В среднем Microsoft-Decision-1 меняла решение в 1,3% таких случаев, а при перефразированных описаниях вариантов и при обратном или случайном порядке вариантов не сменила его ни разу.

Вероятность входит в ответ API как самостоятельная величина, а не как оценка для сортировки. По ней приложение решает, действовать, отложить или отправить на проверку человеку. Поэтому, как пишет Microsoft, прогноз с уверенностью 90% должен оказываться верным примерно девять раз из десяти на типичных случаях.

Безопасность проверяли на 5 250 запросах из 11 бенчмарков: вредный контент, попытки джейлбрейка и внедрение команд в промпт (prompt injection). По словам Microsoft, модель отказывала во вредных действиях и при этом сохраняла высокую полезность на безобидных запросах.

Xbox Research разобрала больше 10 000 отзывов в 200 раз дешевле, чем с GPT-6 Sol

Как цитирует анонс Testing Catalog, Microsoft уже испытывает модель внутри компании, от реагирования на инциденты и контроля качества до научных открытий. Xbox Research прогнала через неё больше 10 000 отзывов из опросов, STEAM и Twitter/X, раскладывая их по темам, которые заранее задали исследователи. По качеству модель была сопоставима с GPT-6 Sol, но работала больше чем в 14 раз быстрее и в 200 раз дешевле.

Команда Copilot оценивает ею качество ответов чата и агентов: результат сопоставим с GPT5.6 Luna при скорости в 100 раз выше. Дежурным инженерам она лучше и быстрее LLM находила нужные знания в логах и тикетах во время инцидентов. В Microsoft Discovery её оценки экспериментов по рубрике оказались в 46 раз стабильнее оценок LLM при втрое большей скорости, а адаптивное перепланирование ускорилось почти в четыре раза.

В качестве других сценариев Microsoft предлагает контроль шагов агента, маршрутизацию между моделями, разметку данных, ИИ-судейство, проверку кода, выбор следующего действия в интерфейсе и в робототехнике.

Microsoft-Decision-1 ставит вероятность каждому варианту за один проход

Обычная LLM пишет ответ токен за токеном, и каждый токен стоит времени. Microsoft-Decision-1 получает запрос и заранее заданный набор вариантов: да или нет, выбор из списка, оценку по шкале или рубрику для проверки ответа ИИ либо действия агента. За один проход она выдаёт вероятность для каждого варианта через один структурированный вызов API. Представьте экзаменатора с бланком теста: он не пишет сочинение, он ставит галочки.

Зачем нужна такая скорость, Microsoft объясняет арифметикой: если каждое из 20 последовательных решений добавляет 100 миллисекунд, весь процесс удлиняется на две секунды. Основа тоже рассчитана на скорость. В Qwen3.5 примерно три четверти слоёв используют линейное внимание Gated DeltaNet и около четверти обычное softmax-внимание. Попробовать модель можно в каталоге Microsoft Foundry.

Все цифры в анонсе получены на тестах самой Microsoft, внешних проверок нет. Метрику калибровки компания не приводит, а «сопоставимое качество» с GPT-6 Sol и GPT5.6 Luna во внутренних испытаниях не подкреплено ни одним числом. На наш взгляд, бесплатный выход здесь честно отражает устройство модели: она отдаёт только вероятности по заданным вариантам, так что счёт определяет длина входа с инструкциями и вариантами.

Когда модель доберётся до OpenRouter

Срок появления модели в OpenRouter Microsoft не называет. Нет дат и у пересборки на базе MAI и моделей OpenAI, хотя от новой основы может зависеть и скорость, и цена. Компания обещает выпускать обновления и добавлять новые оценки и данные, чтобы улучшить качество, калибровку уверенности и стоимость. Сроков у этих обновлений тоже пока нет.

Читайте также

  1. Decisions API от OpenAI вышел в публичную бету для всех
  2. AWS отдаёт свою модель-решалку вместе с рецептом обучения
  3. В Max 20x входит 200 долларов в месяц на Claude API
  4. Haiku 5.5 подешевела на 90%, но только до 100K токенов
  5. Картинка 4K в Nano Banana 2.1 от Google стоит 0,076 доллара
  6. MAI-Transcribe-2 получил потоковую версию для голосовых агентов

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.