Дообучение MiMo-V2.6-Pro обошлось Xiaomi в 2,62 миллиона

Дообучение MiMo-V2.6-Pro заняло меньше шести дней, 30 шагов обучения с подкреплением и около 2,62 миллиона долларов, для младшей Flash тот же этап стоил примерно 850 000 долларов. Обе модели Xiaomi выложила открыто, и, по публикации в Threads, Pro встала на шестое место в Artificial Analysis Intelligence Index.
Коротко
- Xiaomi выложила в открытый доступ пару омнимодальных моделей MiMo-V2.6, Pro и Flash: код, зрительные задачи и работа за компьютером, плюс отдельный режим Pro-UltraSpeed для задач, чувствительных к задержке.
- Pro набрала 46,32 балла в Artificial Analysis Intelligence Index v4.3, и Xiaomi называет результат лучшим среди открытых моделей в сравнении, выше Kimi K3 и Qwen3.8 Max.
- Паритет с Claude Opus 5 и GPT-5.6 Sol на большинстве агентских бенчмарков и прирост на DeepSWE v1.1 с 58,4 до 72,57 у Pro заявляет сама Xiaomi, а UltraSpeed стоит в десять раз дороже.
Если вы не следили за MiMo: линейка началась в апреле 2025 года с модели MiMo-7B и вывела Xiaomi из телефонов, умных устройств и электромобилей в фундаментальные модели. Команду возглавляет Ло Фули, бывшая исследовательница DeepSeek. По данным Wikipedia, MiMo-V2-Pro публично представили 18 марта 2026 года: больше триллиона параметров всего, 42 миллиарда активных и окно в миллион токенов; в том же месяце Лэй Цзюнь объявил, что за три года Xiaomi вложит в ИИ не менее 8,7 миллиарда долларов.
В индексе Artificial Analysis у Pro 46,32 балла и шестое место
Оценка относится к версии индекса v4.3, и Xiaomi называет её лучшим результатом среди открытых моделей в этом сравнении, выше Kimi K3 и Qwen3.8 Max. Там же компания добавляет, что на большинстве агентских бенчмарков Pro идёт наравне с Claude Opus 5 и GPT-5.6 Sol.
Второй набор цифр относится к отложенному тесту по разработке DeepSWE v1.1: у Flash результат поднялся с 48,8 до 65,68, у Pro с 58,4 до 72,57. Задачи этого теста не входили в обучающий набор, поэтому прирост на нём показательнее, чем на тренировочных задачах.
По данным RuntimeWire, средний pass rate на обучающих задачах вырос в относительном выражении на 25% у Flash и на 12% у Pro; там же уточняют, что эти цифры взяты из собственной оценки Xiaomi и независимо пока не повторялись.
В Vibe World модель собирает 3D-сцены и управляет рукой Franka Panda
Обе модели омнимодальны изначально. Из картинки, видео или текстового промпта MiMo-V2.6 координирует агентов, которые строят интерактивную 3D-сцену и затем визуально её проверяют; эту часть Xiaomi называет Vibe World. В том же списке умений: ассеты для Blender, управление рукой Franka Panda по картинке с камер, фронтенды и презентации, сборка видео, музыка в виде партитур и MIDI.
Из исследовательских демонстраций Xiaomi показала отбор материалов для захвата PFAS-соединений и помощь в формализации теоремы на Lean 4, больше 6 000 строк кода, проверенного ядром. Для сценариев, где важна задержка, есть Pro-UltraSpeed: до 20 раз быстрее вывод при том же качестве. Pro в серии заявлена как самая способная модель, а Flash как более дешёвый баланс интеллекта и эффективности.
Почему роутер заморозили на время обучения
Роутер распределяет токены между экспертами внутри модели, и если он меняется вместе со всем остальным, поведение уползает в сторону. Xiaomi зафиксировала его, чтобы ограничить дрейф, а против взлома награды применила состязательную проверку, поиск аномалий и перекрёстную сверку верификаторов.
Сам прогон уложился в шесть дней: 30 шагов обучения с подкреплением и около 750 000 траекторий на каждую модель, по 1 568 задач на обновление, с контекстами вплоть до миллиона токенов. По данным RuntimeWire, на каждую задачу приходилось 16 прогонов, то есть 3,5–3,7 миллиарда обучающих токенов за шаг, а код, агентские, зрительные и кибербезопасные задачи мешали в один прогон вместо отдельной модели под каждую категорию.
Там же описан главный трюк с оценкой: оценщики сравнивают удачные траектории между собой и перераспределяют награду в пользу более качественных путей, потому что бинарный тест «прошло или нет» не отличает короткое надёжное решение от расточительного, которое случайно сработало. Примерно как преподаватель, который не ставит зачёт всем решившим подряд, а ранжирует сами решения.
Flash стоит 0,14 доллара за миллион входных токенов
Цены в API остались на уровне V2.5. У Flash это 0,14 доллара за миллион некэшированных входных токенов и 0,28 доллара за миллион выходных, у Pro 0,435 и 0,87 доллара соответственно. UltraSpeed, который Xiaomi предлагает для работы в реальном времени, стоит дороже в десять раз.
Pro и Flash уже доступны в AI Studio, MiMo Code, MiMo Desktop, на собственной платформе MiMo API и в OpenRouter; открытую выкладку обеих моделей подтверждают сайт Xiaomi и страницы OpenRouter. MiMo Desktop выходит из раннего доступа сразу с обеими моделями. Вместе с весами Xiaomi публикует технический отчёт, обучающие среды и код обучения с подкреплением, называя релиз воспроизводимой проверкой масштабированного RL и самоулучшения моделей.
Сравнения с Claude Opus 5 и GPT-5.6 Sol, как и прирост на DeepSWE v1.1, идут от самой Xiaomi, а размеров моделей и лицензии, под которой открыты веса, в описании релиза нет. На наш взгляд, десятикратная наценка за UltraSpeed при обещанном ускорении до 20 раз оправдана только для узкого класса задач, где задержка стоит дороже токенов.
Что можно перепроверить по RL-коду
Отчёт, среды и код обучения выложены, так что заявку на воспроизводимость можно проверять руками: повторить 30 шагов, сверить траектории и посмотреть, держатся ли цифры DeepSWE v1.1 на чужом железе. Открытый вопрос: во сколько такой прогон обойдётся команде без инфраструктуры Xiaomi. Когда результаты появятся у независимых групп, в релизе не сказано.
Читайте также
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
