open-models

Переводчик Cohere не рассуждает, и это ради экономии

Promtime

open-models

Инструкция по технике безопасности читается нормально на первой странице и успевает уехать к десятой: так сооснователь Cohere Ник Фросст описывает состояние машинного перевода длинных документов в разговоре с Thenewstack. На прошлой неделе компания выложила North Small Translate, MoE-модель перевода на 50 языков с весами под лицензией CC BY-NC 4.0.

Коротко

  • Веса North Small Translate доступны бесплатно в трёх квантизациях и только для некоммерческого использования; коммерческое развёртывание Cohere предлагает через Model Vault, собственную управляемую среду инференса.
  • По данным самой Cohere, на бенчмарке WMT26 All Languages модель набирает 83,60 против 81,56 у Qwen 3.5 397B A17B, 81,37 у DeepL NextGen и 68,20 у Google Translate.
  • Часть сравнений в этом сегменте проверить нельзя: не каждый вендор раскрывает число параметров своих моделей, а цифры на WMT26 и на тесте длинного контекста приводит сама Cohere.

Если вы не следили, перевод у Cohere не новая тема. North Small Translate продолжает линейку Tiny Aya и Command A Translate. Сам подход со смесью экспертов в переводе тоже с историей: по обзору IntuitionLabs, в 2020 году Google масштабировала разреженные смеси в архитектуре GShard до трансформера на 600 миллиардов параметров из 2048 экспертов, и лучший результат он показал именно на многоязычном переводе.

На WMT26 модель набирает 83,60, а на тесте длинных документов 48,9

В отчётной оценке Cohere North Small Translate идёт первой на бенчмарке WMT26 All Languages: 83,60 против 81,56 у Qwen 3.5 397B A17B, 81,37 у DeepL NextGen, 79,46 у Gemma 4 31B (on), 76,50 у GLM 5.2 FP8 и 68,20 у Google Translate.

Отдельно Фросст приводит собственный тест компании на длинном контексте: 48,9 у North Small Translate, 21,3 у Google Translate, 19,4 у Gemma 4 31B. Компания заявляет, что в среднем по разным измерениям качества перевода обходит открытые модели сопоставимого размера до 1 триллиона параметров и API-переводчики.

Версий две. Стандартная работает в один проход и рассчитана на объём; агентная тратит больше токенов и даёт 84,36 против 83,60 на WMT26. По словам Фросста, разница окупается, когда на входе договор или процедура безопасности, в остальных случаях выгоднее экономить.

Модель принимает Markdown и JSON и держит глоссарий терминов

Заявлено 50 языков: 32 высокоресурсных и ещё 18. Кроме собственно перевода модель умеет то, из чего состоит реальный переводческий процесс: структурированные документы в Markdown или JSON, следование инструкциям по тону и формату, глоссарии с конкретной терминологией, и всё это работает внутри модели, без обвязки вокруг.

Архитектура та же, что в прежних моделях Cohere; прирост, по описанию компании, дало пост-обучение: обучение с подкреплением и новые датасеты специально под задачи перевода. Разрабатывали модель вместе с RWS, в настройке участвовали исследовательские и научные команды Language Weaver и лингвисты компании.

Фросст добавляет, что генеративные модели перевода дают лучшее качество и управляемость по тону и форматированию, но обычно обходятся заметно дороже привычных в коммерческих задачах NMT-систем.

Веса отдают бесплатно, а коммерческую лицензию продают через Model Vault

Скачать веса можно бесплатно в трёх квантизациях под CC BY-NC 4.0, то есть для некоммерческого использования. Тем, у кого нет подходящего железа, доступны Hugging Face Space и API. Коммерческое развёртывание идёт отдельно, через Model Vault, управляемую самой Cohere среду инференса.

Позиционируют North Small Translate как часть стратегии суверенного ИИ, адресованной организациям, которым важно, где работают модели и что происходит с данными. Фросст формулирует риск прямо: как только HR-политики или регулируемые документы уходят в сторонний API, данные покидают ваше здание, и контроль над ними неизбежно снижается.

Девять лет масштабировали архитектуру, придуманную ради перевода, а машинный перевод всё ещё сломан для большинства языков мира, говорит Фросст. Универсальные модели, по его словам, доводят задачу до определённой точки и останавливаются, а следующий этап корпоративного ИИ здесь меньше размером, специализированнее и живёт внутри ваших стен.

Почему нерассуждающая модель дешевле в токенах

Фросст объясняет экономию тем, что модель нерассуждающая: она опирается на выученные статистические закономерности, без пошагового разбора задачи, и поэтому тратит меньше токенов. Качество вытягивает многопроходный цикл: модель переводит, перечитывает свой вывод, находит ошибки и правит их; тем же циклом её учили.

Смесь экспертов устроена так: по описанию в документации Hugging Face, плотные слои заменяют набором «экспертов» и маленькой сетью-маршрутизатором, которая решает, какому эксперту отдать очередной токен. Похоже на регистратуру в поликлинике: пациента отправляют к одному-двум врачам, остальные кабинеты в этот момент простаивают.

Отсюда и цифры: 218 миллиардов параметров всего, активны 25 миллиардов. Cohere указывает на меньший расход вычислений и памяти по сравнению с другими моделями. Правда, память экономится не целиком: по документации Hugging Face, все эксперты всё равно держатся в VRAM.

Все цифры в этой истории приводит сама Cohere, включая тест на длинном контексте, который компания придумала сама; независимой проверки в анонсе нет. Компания и сама оговаривается, что часть сравнений в сегменте непроверяема, потому что не все вендоры раскрывают число параметров. Странно, на наш взгляд, что веса раздают бесплатно и сразу в трёх квантизациях, а коммерческий путь при этом ровно один, через собственную среду Cohere.

Кто проверит 83,60 со стороны

Пока 83,60 и 48,9 остаются цифрами самой Cohere. Открытый constrained-трек WMT, по описанию задачи на Statmt, ограничен моделями меньше 20 миллиардов параметров с обязательной публикацией весов, и модель на 218 миллиардов в эту рамку не проходит; где и когда её прогонят независимо, в анонсе не сказано. Сроков, когда коммерческая лицензия появится не только через Model Vault, компания тоже не называет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.