Large 4 от Mistral: API сегодня, веса в конце октября
У Mistral Large 4 триллион параметров, но на каждый запрос из них работают только 49 миллиардов. Модель с прозвищем «Le Chonk» уже доступна через API, а открытые веса обещаны к концу октября, сообщила компания в посте Mistral в Threads.
Пока веса не выложены, Mistral проверяет модель на атаки. В проверке участвуют эксперты по кибербезопасности, отобранные партнёры и госорганы, и работают они с отдельной версией, у которой ослаблена модерация и расширены возможности в кибербезопасности.
Коротко
- Mistral открыла публичное превью Large 4 в Mistral Studio: модель умеет следовать инструкциям, рассуждать и выполнять агентные задачи, а изображения понимает с самого начала обучения.
- Внутри смесь экспертов на 1 триллион параметров с 49 миллиардами активных; по данным Mistral, модель набирает 93% в Cybench, а миллион входных токенов стоит 1,36 доллара.
- Почти все результаты бенчмарков пока опубликовала сама Mistral, а веса выйдут только после проверки на атаки, которую проводят на версии с ослабленной модерацией.
Если вы не следили: Large у Mistral давно служит флагманской линейкой, и четвёртая версия стала первым релизом на деньги раунда Series D размером 3 миллиарда евро. Параллельно Mistral продаёт корпоративным клиентам Forge, платформу для обучения, настройки и обучения с подкреплением собственных моделей. Large 4 собрали в той же среде, которую Forge предлагает заказчикам.
Mistral приводит для Large 4 93% в Cybench и 61,7% в DeepSWE v1.1
Mistral называет Large 4 лучшей открытой моделью из США и Европы по сводным бенчмаркам и нацеливает её на разработку ПО, кибербезопасность, финансы, право, науку и производство. По данным компании, которые приводит Testing Catalog, модель набирает 61,7% в DeepSWE v1.1 и 59,9% в AutomationBench.
В кибербезопасности, о которой гендиректор Mistral говорил в интервью Reuters, у модели 93% в Cybench. На одном из тестов Artificial Analysis Cyber Index, где нужно воспроизвести уязвимость и выпустить к ней патч, результат 82%. Защищается Large 4 тоже неплохо: на тесте B3 от Lakera она отразила 93,3% атак.
С картинками отрыв скромнее. В Dense 200 на визуальную привязку, то есть на умение найти на изображении объект по описанию, у Large 4 42%, у GPT-6 Astra 41%. По словам Mistral, сторонние оценки ставят модель выше GPT-6 Astra в юридических и финансовых задачах, а в бенчмарке Legal Agent от Harvey она обходит все открытые модели.
Large 4 обучили с нуля на 3 800 GPU NVIDIA Grace Blackwell
Mistral обучала Large 4 с нуля в собственных европейских дата-центрах на 3 800 GPU NVIDIA Grace Blackwell, и те же дата-центры сейчас обслуживают превью. Обучающие данные охватывали больше 160 языков, включая все официальные языки Евросоюза.
Как пишет Testing Catalog, нынешний конвейер обучения с подкреплением на 3 000 GPU выдаёт около 33 миллиардов токенов в сутки. После фильтрации и маскирования из них остаётся примерно 16 миллиардов токенов ответов, на которых модель можно учить. Large 4 станет базой для нового семейства специализированных моделей, где Mistral обещает совместить открытые веса, развёртывание на своих серверах и больший контроль заказчика над моделью.
Миллион входных токенов Large 4 стоит 1,36 доллара
В API превью стоит 1,36 доллара за миллион входных токенов и 4,18 доллара за миллион выходных. Модель работает с таблицами, документами, графиками, техническими чертежами, PDF и большими геопространственными изображениями. Её обещают в нескольких регионах, в том числе в европейском развёртывании, которое Mistral целиком обслуживает сама по европейскому праву.
Для команд безопасности запланированы частное облако и установка на серверах заказчика. Перед выкладкой весов модель проходит проверку атаками: специалисты по кибербезопасности, отобранные партнёры и госорганы получают ту же модель с ослабленной модерацией и расширенными возможностями в кибербезопасности.
Из триллиона параметров на каждый токен работают 49 миллиардов
Large 4 построена как смесь экспертов (mixture of experts). Сеть разбита на много блоков-экспертов, а небольшой маршрутизатор для каждого токена выбирает несколько подходящих. Остальные блоки в этот момент простаивают, поэтому знаний в модели на триллион параметров, а вычислений на токен примерно как у модели на 49 миллиардов.
Похоже на кухню большого ресторана: поваров десятки, но каждое блюдо готовят двое-трое, кто умеет именно его. Нативная мультимодальность означает, что изображения и документы модель видела вместе с текстом с самого начала обучения, и зрение ей не пристраивали отдельным модулем потом.
Почти все цифры выше опубликовала сама Mistral, а «сторонние оценки» пересказаны её же словами, без методики и без названий тестов. Формулировка «лучшая открытая модель из США и Европы» выносит за скобки открытые модели из других стран, и, на наш взгляд, сравнение с ними сказало бы о Large 4 больше. Пока веса не выложены, открытость модели проверить нельзя.
Чем закончится проверка до выкладки весов
Открытые веса Mistral обещает к концу октября, точный день не назван. Неизвестно и то, могут ли итоги проверки на атаки сдвинуть сроки или изменить состав релиза. Лицензию весов и даты для частного облака и установки на своих серверах компания тоже пока не называет. Если вы ждёте веса, поставьте напоминание на конец месяца.
Читайте также
- Новая модель Mistral обходит китайские в отдельных областях
- Немецкая Kolibri с окном в 1M токенов вышла под Apache 2.0
- Ideogram 4.5 заточили под правку и обещают открыть веса
- Дообучение MiMo-V2.6-Pro обошлось Xiaomi в 2,62 миллиона
- Переводчик Cohere не рассуждает, и это ради экономии
- V4.1 Flash: 552 миллиарда параметров и Encoder-Decoder
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
