Перейти к содержанию

open-models

Large 4 от Mistral: API сегодня, веса в конце октября

Promtime

У Mistral Large 4 триллион параметров, но на каждый запрос из них работают только 49 миллиардов. Модель с прозвищем «Le Chonk» уже доступна через API, а открытые веса обещаны к концу октября, сообщила компания в посте Mistral в Threads.

Пока веса не выложены, Mistral проверяет модель на атаки. В проверке участвуют эксперты по кибербезопасности, отобранные партнёры и госорганы, и работают они с отдельной версией, у которой ослаблена модерация и расширены возможности в кибербезопасности.

Коротко

  • Mistral открыла публичное превью Large 4 в Mistral Studio: модель умеет следовать инструкциям, рассуждать и выполнять агентные задачи, а изображения понимает с самого начала обучения.
  • Внутри смесь экспертов на 1 триллион параметров с 49 миллиардами активных; по данным Mistral, модель набирает 93% в Cybench, а миллион входных токенов стоит 1,36 доллара.
  • Почти все результаты бенчмарков пока опубликовала сама Mistral, а веса выйдут только после проверки на атаки, которую проводят на версии с ослабленной модерацией.

Если вы не следили: Large у Mistral давно служит флагманской линейкой, и четвёртая версия стала первым релизом на деньги раунда Series D размером 3 миллиарда евро. Параллельно Mistral продаёт корпоративным клиентам Forge, платформу для обучения, настройки и обучения с подкреплением собственных моделей. Large 4 собрали в той же среде, которую Forge предлагает заказчикам.

Mistral приводит для Large 4 93% в Cybench и 61,7% в DeepSWE v1.1

Mistral называет Large 4 лучшей открытой моделью из США и Европы по сводным бенчмаркам и нацеливает её на разработку ПО, кибербезопасность, финансы, право, науку и производство. По данным компании, которые приводит Testing Catalog, модель набирает 61,7% в DeepSWE v1.1 и 59,9% в AutomationBench.

В кибербезопасности, о которой гендиректор Mistral говорил в интервью Reuters, у модели 93% в Cybench. На одном из тестов Artificial Analysis Cyber Index, где нужно воспроизвести уязвимость и выпустить к ней патч, результат 82%. Защищается Large 4 тоже неплохо: на тесте B3 от Lakera она отразила 93,3% атак.

С картинками отрыв скромнее. В Dense 200 на визуальную привязку, то есть на умение найти на изображении объект по описанию, у Large 4 42%, у GPT-6 Astra 41%. По словам Mistral, сторонние оценки ставят модель выше GPT-6 Astra в юридических и финансовых задачах, а в бенчмарке Legal Agent от Harvey она обходит все открытые модели.

Large 4 обучили с нуля на 3 800 GPU NVIDIA Grace Blackwell

Mistral обучала Large 4 с нуля в собственных европейских дата-центрах на 3 800 GPU NVIDIA Grace Blackwell, и те же дата-центры сейчас обслуживают превью. Обучающие данные охватывали больше 160 языков, включая все официальные языки Евросоюза.

Как пишет Testing Catalog, нынешний конвейер обучения с подкреплением на 3 000 GPU выдаёт около 33 миллиардов токенов в сутки. После фильтрации и маскирования из них остаётся примерно 16 миллиардов токенов ответов, на которых модель можно учить. Large 4 станет базой для нового семейства специализированных моделей, где Mistral обещает совместить открытые веса, развёртывание на своих серверах и больший контроль заказчика над моделью.

Миллион входных токенов Large 4 стоит 1,36 доллара

В API превью стоит 1,36 доллара за миллион входных токенов и 4,18 доллара за миллион выходных. Модель работает с таблицами, документами, графиками, техническими чертежами, PDF и большими геопространственными изображениями. Её обещают в нескольких регионах, в том числе в европейском развёртывании, которое Mistral целиком обслуживает сама по европейскому праву.

Для команд безопасности запланированы частное облако и установка на серверах заказчика. Перед выкладкой весов модель проходит проверку атаками: специалисты по кибербезопасности, отобранные партнёры и госорганы получают ту же модель с ослабленной модерацией и расширенными возможностями в кибербезопасности.

Из триллиона параметров на каждый токен работают 49 миллиардов

Large 4 построена как смесь экспертов (mixture of experts). Сеть разбита на много блоков-экспертов, а небольшой маршрутизатор для каждого токена выбирает несколько подходящих. Остальные блоки в этот момент простаивают, поэтому знаний в модели на триллион параметров, а вычислений на токен примерно как у модели на 49 миллиардов.

Похоже на кухню большого ресторана: поваров десятки, но каждое блюдо готовят двое-трое, кто умеет именно его. Нативная мультимодальность означает, что изображения и документы модель видела вместе с текстом с самого начала обучения, и зрение ей не пристраивали отдельным модулем потом.

Почти все цифры выше опубликовала сама Mistral, а «сторонние оценки» пересказаны её же словами, без методики и без названий тестов. Формулировка «лучшая открытая модель из США и Европы» выносит за скобки открытые модели из других стран, и, на наш взгляд, сравнение с ними сказало бы о Large 4 больше. Пока веса не выложены, открытость модели проверить нельзя.

Чем закончится проверка до выкладки весов

Открытые веса Mistral обещает к концу октября, точный день не назван. Неизвестно и то, могут ли итоги проверки на атаки сдвинуть сроки или изменить состав релиза. Лицензию весов и даты для частного облака и установки на своих серверах компания тоже пока не называет. Если вы ждёте веса, поставьте напоминание на конец месяца.

Читайте также

  1. Новая модель Mistral обходит китайские в отдельных областях
  2. Немецкая Kolibri с окном в 1M токенов вышла под Apache 2.0
  3. Ideogram 4.5 заточили под правку и обещают открыть веса
  4. Дообучение MiMo-V2.6-Pro обошлось Xiaomi в 2,62 миллиона
  5. Переводчик Cohere не рассуждает, и это ради экономии
  6. V4.1 Flash: 552 миллиарда параметров и Encoder-Decoder

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.