model-releases
Qwen3.8-Omni-Flash слушает звук и смотрит видео
Promtime
Миллион токенов контекста, и в это окно можно положить видео вместе со звуковой дорожкой. 18 сентября Alibaba выложила Qwen3.8-Omni-Flash, омни-модель, которая принимает текст, картинки, аудио и видео; анонс опубликован в Threads.
Коротко
- Qwen3.8-Omni-Flash стоит отдельно от Qwen3.8-Flash, у которого окно было 262K токенов нативно и растягивалось до миллиона, а здесь миллион токенов заявлен в описании сразу.
- Кроме понимания звука и видеоряда в модель завезли вызов функций и работу с инструментами, то есть по ходу ответа она может дёргать внешние сервисы и подмешивать их результат.
- Alibaba говорит о результатах, близких к Gemini 3.8 Flash на WildClawBench-MM и UniClawBench, но цифр рядом с этим сравнением не опубликовано, так что слово «близко» проверить нечем.
Если вы не следили за линейкой, у Alibaba уже была омни-модель. Согласно техническому отчёту Qwen3-Omni на arXiv, её подавали как первую единую мультимодальную модель, которая держит уровень по тексту, изображениям, аудио и видео без просадки относительно одномодальных аналогов: открытый SOTA на 32 из 36 аудио- и аудиовизуальных бенчмарков и общий SOTA на 22, с обгоном закрытых Gemini-2.5-Pro, Seed-ASR и GPT-4o-Transcribe.
У Qwen3.8-Omni-Flash миллион токенов контекста и четыре типа входа
На вход идут текст, изображения, аудио и видео. Модель понимает звук и видеоряд, а не только текстовую расшифровку происходящего. Окно контекста заявлено в миллион токенов, и это главная цифра релиза.
Имя легко спутать с Qwen3.8-Flash, но модели разные. У того окно составляло 262K токенов нативно и растягивалось до миллиона; у омни-версии миллион указан в описании без оговорок про растяжку. Вторая заметная строчка спецификации: вызов функций и работа с инструментами, то есть модель умеет обращаться к внешнему коду прямо в ходе ответа.
Почему такую модель называют омни-моделью?
По определению из глоссария NVIDIA, омни-модель работает с несколькими типами данных сразу, от текста и картинок до аудио, видео и сигналов физического мира, внутри одной архитектуры. Там же описан механизм: для каждого типа входа есть свой энкодер, который переводит его в общее внутреннее представление, обычно в токены, и дальше одна система рассуждает уже поверх них, связывая увиденное в кадре с услышанным в дорожке.
Отличие от привычного конвейера, где отдельно работают распознавание речи, зрение и язык с промежуточными преобразованиями между ними, в глоссарии NVIDIA описано как архитектурное. Бытовая аналогия: вместо двух людей, один из которых слушает запись, а другой пересказывает картинку, за фильмом следит один человек.
Вызов функций отвечает за то, чего модель не знает
Как описано в документации Qwen на Readthedocs, вызов функций задаёт общий протокол общения модели с внешними системами: приложение передаёт набор функций, модель решает, нужна ли какая-то из них и с какими аргументами, приложение выполняет вызов и возвращает результат обратно в диалог, если разговор продолжается.
Зачем это нужно, там же объясняют через ограничения самих языковых моделей: они не знают того, чего не было в обучающих данных, включая события после окончания обучения, и учатся через правдоподобие, из-за чего плохо справляются с задачами с жёстким набором правил вроде вычислений. Для моделей Qwen3 в документации рекомендуют шаблоны работы с инструментами в стиле Hermes.
Alibaba сравнивает модель с Gemini 3.8 Flash на WildClawBench-MM и UniClawBench
Это единственное заявление о производительности, которое идёт вместе с релизом: результаты названы близкими к Gemini 3.8 Flash на двух бенчмарках, WildClawBench-MM и UniClawBench.
Для контекста, как это выглядит на стороннем измерении. По данным лидерборда BenchLM, на 18 сентября 2026 года лучшей моделью Alibaba там числилась Qwen3.8 Max с 73,2 балла по BenchAlign v5, дальше шли Qwen3.7 Max (66,9) и Qwen3.8-27B (64,3), и составители отмечали заметный разрыв между лидерами и остальным полем. В этой тройке Qwen3.8-Omni-Flash не значится.
Сравнение с конкретным конкурентом без единого числа проверить нечем: не опубликованы ни баллы, ни условия прогонов на WildClawBench-MM и UniClawBench. Странно, на наш взгляд, называть чужую модель как точку отсчёта и не показать разрыв, особенно когда речь о слове «близко». Не названы и цена доступа, и режим публикации весов.
Когда появятся баллы и веса
Дальше интересны две вещи. Первая: выложат ли Alibaba цифры по двум названным бенчмаркам, чтобы «близко к Gemini 3.8 Flash» стало проверяемым утверждением. Вторая: под какой лицензией разойдётся модель. Предыдущее поколение, по техническому отчёту Qwen3-Omni на arXiv, ушло в открытый доступ под Apache 2.0 тремя вариантами, включая отдельный Captioner для описания произвольного аудио. Про Qwen3.8-Omni-Flash таких условий пока не объявлено.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
