open-models

Открытые веса как раннее превью архитектуры Qwen4

Promtime

open-models

Alibaba выпустила Qwen3.8-Flash, открытую мультимодальную MoE-модель на 125 млрд параметров с 6 млрд активных на токен. В блоге релиза Alibaba назвала её «ранним превью архитектуры, которая используется в Qwen4». Релиз, о котором сообщил Thenewstack, идёт вслед за Qwen3.8 Max, вышедшим в начале месяца.

Коротко

  • Alibaba сравнивает релиз с Qwen3-Next, который до выхода Qwen3.5 показал разработчикам связку Gated DeltaNet и Gated Attention, позже использованную в сериях Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8.
  • Модели потребовалось, по заявлению Alibaba, около одной девятой ресурсов на обучение при более высоком качестве, чем у втрое более крупного Qwen3.7-Plus, что снижает и стоимость инференса.
  • Alibaba утверждает, что возможности флагманского уровня становятся доступны в повседневных нагрузках и на железе, которое у разработчиков уже есть; один из инженеров сообщил о запуске модели на RTX 4090.

Открытая публикация архитектуры до выхода флагманского семейства выглядит как ставка на то, что сообщество отладит новые компоненты раньше, чем на них будет построен Qwen4: разработчики получают время подготовить код и инфраструктуру. Для рынка важнее другое: если заявленные соотношения качества и стоимости подтвердятся, планка для моделей среднего размера смещается, а конкуренция между открытыми и закрытыми моделями в агентных задачах вероятно обострится.

Qwen3.8-Flash-Next активирует 6 млрд параметров из 125 млрд на токен

Alibaba описывает обновления по четырём направлениям: внимание, остаточные связи, эмбеддинги и оптимизация. Гибридная схема внимания объединяет Gated DeltaNet, который сжимает историю, с Qwen Sparse Attention, где лёгкий сжатый индексатор отбирает релевантный контекст и существенно снижает стоимость вычисления внимания на длинных последовательностях.

Механизм Gated Residual расширяет пути передачи данных между слоями и укрепляет межслойный обмен информацией и стабильность обучения. Техника N-gram Embedding наращивает ёмкость модели при минимальных дополнительных вычислениях, а оптимизатор Muon повышает эффективность обучения крупных моделей. Alibaba формулирует итог так: возможности модели растут при одновременной оптимизации вычислительной эффективности, ёмкости и стабильности обучения.

Основная модель насчитывает 125 млрд параметров и дополнена 51 млрд параметров N-gram-эмбеддингов, на токен активируется 6 млрд. Нативно поддерживается контекст в 262 144 токена, с YaRN он расширяется до 1 000 000. Такая конфигурация относит модель к разреженным MoE, где на каждом шаге работает лишь малая доля весов.

На SWE-bench Pro модель набрала 62.5 против 53.4 у Claude-Opus-4.6 (Max)

Alibaba приводит результаты в агентном программировании, длинных агентных задачах и мультимодальном интеллекте: SWE-bench Pro, CoWorkBench для длительной офисной работы, Toolathlon Verified для работы с инструментами, MathVision для визуальной математики, AndroidWorld для агентного использования мобильных устройств и ERQA для воплощённого интеллекта. Сравнение идёт с DeepSeek-V4-Flash и Claude-Opus-4.6.

В SWE-bench Pro Qwen3.8-Flash-Next получил 62.5 балла, тогда как Qwen3.8-27B набрал 61.7, DeepSeek-V4-Flash-0731 56.0, Qwen3.7-Plus 55, а Claude-Opus-4.6 (Max) 53.4. Alibaba заявляет о «превосходных возможностях в программировании и офисных задачах» и оптимальном балансе способностей, задержки и стоимости. Модель подаётся и как ставка на производительность, и как ставка на соотношение цены и качества.

По утверждению Alibaba, обучение потребовало около одной девятой ресурсов при более высоком качестве, а в сравнении с Qwen3.7-Plus, который втрое больше по размеру, существенно снижаются затраты и на обучение, и на инференс. Открытые веса, по замыслу Alibaba, позволяют сообществу изучить механику архитектуры до того, как на ней будет построено семейство Qwen4.

Alok сообщил о 21 токене в секунду на одной RTX 4090 с 24 ГБ

Открытые веса Qwen3.8-Flash-Next выложены на Hugging Face и ModelScope, это исследовательская версия для разработчиков. Продакшен-вариант Qwen3.8-Flash построен на той же архитектуре и работает через QwenCloud API с 1 млн токенов по умолчанию и встроенными официальными инструментами. Модель доступна и на QwenWork, платформе рабочих ИИ-агентов Alibaba.

Инженер-мехатроник Alok написал в X, что запустил Qwen3.8-Flash-Next 125B A6B с окном контекста 250 000 токенов на одной RTX 4090 с 24 ГБ памяти: 21 токен в секунду на декодировании и 364 токена в секунду на префилле, без MTP, без dflash и без квантизации KV-кэша. По его словам, барьер видеопамяти для таких моделей фактически снят.

Разработчик под ником Embedding Shapes на Hacker News настроен иначе: он жалуется, что модели по-прежнему ошибаются в базовых вещах. «Мне бы очень хотелось, чтобы локальные модели уже сегодня заменяли удалённые, и врать о своём опыте мне незачем», написал он, добавив, что для профессиональной локальной разработки Qwen 3.8 пока недостаточно.

Сколько стоит и когда ждать Qwen4

Доступ к Qwen3.8-Flash открыт через API Model Studio и Qwen Cloud: 0,16 доллара за миллион входных токенов и 0,47 доллара за миллион выходных, внутри Китая цена вывода составляет 3 юаня. В QwenWork переработанный «стандартный режим» сокращает расход токенов на задачу на 75% и примерно вдвое ускоряет генерацию.

Дату выхода Qwen4 Alibaba не называет. По наблюдениям комментаторов, о которых пишет Thenewstack, семейство ожидается до конца года, возможно уже в сентябре; предположения касаются оптимизации под сложные 3D-задачи, дальнейшего развития MoE и нативной мультимодальности, но пока публичных подтверждений этим версиям нет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.