open-models
Granite 4.2 остались плотными и научились рассуждать
Promtime
open-modelsВо вторник IBM представила семейство Granite 4.2 из трёх открытых моделей на 3, 8 и 30 миллиардов параметров, обученных с нуля как плотные декодерные трансформеры с рассуждениями. О релизе пишет Thenewstack, отмечая, что веса опубликованы под лицензией Apache 2.0.
Коротко
- Рассуждения в Granite 4.2 отключаются, а для простых запросов предусмотрен режим с низким расходом токенов, при котором модель тратит на ответ минимальное число токенов размышления.
- Предобучение прошло в пять этапов на 15 триллионах токенов, включая триллион синтетического кода из конвейера CodeAlchemy; окно контекста доведено до 512 000 токенов при нативных 128K в опубликованной конфигурации.
- Версии на 8 и 30 миллиардов параметров дополнительно прошли агентное обучение с подкреплением: они вызывают инструменты, правят и запускают код, работают в терминале и ищут в вебе.
Разворот IBM выглядит показательным: при запуске Granite 4.1 рассуждения объявлялись слишком дорогими для корпоративных задач, теперь они стали центром релиза, хотя и остаются опциональными. Ставка на плотную архитектуру идёт против движения индустрии к гибридам Mamba, и, судя по всему, IBM рассчитывает на предсказуемость адаптации моделей под конкретные задачи, а не на рекорды в бенчмарках. Для команд, которые разворачивают агентов локально, такой выбор означает более простой путь к дообучению и умеренные требования к железу.
Granite 4.2 остаётся плотным трансформером на одном внимании
Granite 4.0 включала обычные плотные модели, плотные гибриды и гибридные MoE. С Granite 4.1 IBM вернула основное семейство к плотному трансформеру на одном внимании и заявила, что новое поколение обходит предыдущее, используя более простую и потому более гибкую архитектуру для дообучения под прикладные задачи.
Granite 4.2 продолжает эту линию: все три модели плотные, декодерные и обучены с нуля. Сама IBM пробовала гибридный путь в поколении 4.0 и от него отказалась. Часть индустрии двигается в другую сторону, к гибридам Mamba и внимания, как в семействе Nemotron 3 у Nvidia.
IBM называет 4.2 релизом, ориентированным на рассуждения. Модели работают в режимах с размышлением и без него, а для простых вопросов предусмотрен режим с низкими затратами, в котором расходуется небольшое число токенов рассуждения. При запуске Granite 4.1 в IBM утверждали, что рассуждающие модели недостаточно эффективны и для части задач вроде следования инструкциям и вызова инструментов корпоративным пользователям выгоднее модели без рассуждений.
Предобучение заняло 15 триллионов токенов и пять этапов
Предобучение шло на 15 триллионах токенов в пять этапов. Отдельная фаза длинного контекста довела семейство до 512 000 токенов, хотя опубликованная конфигурация нативно поддерживает 128K. В обучающий набор вошёл триллион токенов синтетического кода, сгенерированного конвейером IBM CodeAlchemy, при этом общий уровень моделей в программировании остаётся средним.
Конвейер обучения общий для всей линейки, но модели на 8 и 30 миллиардов параметров прошли дополнительный этап агентного обучения с подкреплением: вызов инструментов, правка и запуск кода, работа в терминале, поиск в вебе. Модель на 3 миллиарда параметров вызывать инструменты умеет, но этот этап не проходила. В IBM отмечают, что вместе с выравниванием через RLHF такой подход даёт модели, лучше приспособленные к сложной многошаговой агентной работе.
Qwen 3.8 27B обходит Granite 4.2 по всем бенчмаркам
В бенчмарках Granite 4.2 не устанавливает рекордов. Модель на 8 миллиардов параметров часто подходит вплотную к результатам 30-миллиардной и при этом запускается практически на любом современном Mac и даже на части относительно недорогих видеокарт Nvidia RTX. Qwen 3.8 27B обходит модели IBM по всем направлениям, особенно в программировании, где результаты Granite неровные.
Granite 4.2 работает только с текстом. Сопоставимые по размеру Qwen 3.8 27B, Muse Glimmer 30B и Gemma 4 31B от Google мультимодальны, тогда как у IBM зрение вынесено в отдельную модель Granite Vision 4.1 4B.
В IBM делают ставку на поведение моделей в высоконагруженных агентных сценариях. В сообщении о релизе IBM пишет, что от систем ИИ теперь ждут не только внятных ответов: они должны планировать, обращаться к приложениям и надёжно выполнять сложные задачи, оставаясь достаточно лёгкими для эксплуатации.
Речевые модели и Granite Vision
Одновременно с Granite 4.2 IBM выпустила две новые модели распознавания речи в семействе Granite Speech. Мультимодальной версии в новой линейке пока нет: зрение остаётся за Granite Vision 4.1 4B, сроки её обновления IBM не называет. Опубликованная конфигурация нативно поддерживает 128K, о выпуске варианта с нативным окном 512 000 токенов не сообщается.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
