meta
Потоковая расшифровка Meta: 3,1% ошибочных слов
Promtime
Meta Superintelligence Labs выпустила Muse Voice Transcribe, модель потокового распознавания речи, которая на англоязычном бенчмарке AA-WER Streaming показала 3,1% ошибок в словах и обошла GPT Live Transcribe, Gemini 3.5 Transcribe Live, а также модели Cartesia и ElevenLabs. Запуск состоялся во вторник, подробности привело издание The New Stack.
Коротко
- Аудио поступает отрезками по 80 миллисекунд, 12,5 отрезка в секунду, и на каждом шаге модель выбирает: выдать текстовый токен или маркер next audio, запросив следующий фрагмент звука.
- Meta заявляет, что модель различает более 20 говорящих, обучена более чем на 70 языках и удерживает контекст разговоров длительностью свыше часа.
- Доступ к модели открыт через Meta Model API, а также в приложении Meta AI для Mac и в среде разработки Muse Code, тариф API составляет $3,00 за 1 000 аудиоминут.
Преимущество в 0,3 процентного пункта на одном англоязычном тесте выглядит скорее заявкой, чем закрепленной позицией: в сегменте с такой плотностью запусков таблица лидеров переписывается быстро. Более устойчивым кажется другое: у Meta есть собственные продукты, которым потоковая расшифровка нужна постоянно, и это дает лаборатории повод развивать модель независимо от текущего места в рейтинге. Отказ от публикации весов при этом оставляет независимую проверку качества сторонним бенчмаркам и самому API.
На англоязычном тесте 3,1% ошибок в словах, на бенчмарках по говорящим 17,5%
На бенчмарке AA-WER Streaming от Artificial Analysis, который измеряет точность потоковой расшифровки английской речи, у Muse Voice Transcribe 3,1% ошибок в словах. Cartesia Ink-2 в том же сравнении показывает 3,4%, ElevenLabs Scribe v2 Real-time 3,6%, GPT Live Transcribe 3,9%, Gemini 3.5 Transcribe Live 4%.
Разделение говорящих дается потоковым моделям заметно хуже расшифровки слов. На нескольких стандартных бенчмарках Muse Voice Transcribe ошибается в 17,5% случаев при определении, кто именно говорит, и по этому показателю опережает остальные модели реального времени, хотя абсолютный уровень ошибок в этой задаче остается высоким у всех.
Ранее Meta Superintelligence Labs выпустила Muse Spark, которая тоже переводит речь в текст, хотя и не специализируется на этой задаче. Muse Voice Transcribe рассчитана на потоковый режим, где текст появляется по ходу речи, и именно этот режим измеряет бенчмарк Artificial Analysis.
Награда за точность и награда за задержку перемножаются
Архитектурно это авторегрессионная мультимодальная модель. Звук поступает отрезками по 80 миллисекунд, то есть 12,5 отрезка в секунду, и каждый сжимается в один мягкий токен. На каждом шаге модель выбирает: выдать текстовый токен или служебный маркер next audio, который система заменяет следующим фрагментом записи.
Когда запись обрывается, маркер empty audio сообщает модели, что продолжения не будет, и она выдает удержанный текст. Поскольку модель сама решает, сколько звука услышать до фиксации слова, она управляет своей задержкой: в Meta называют это адаптивной задержкой, при которой трудные слова получают больше контекста, а простые расшифровываются почти сразу. Компромисс закрепляется на этапе обучения с подкреплением, где награда за точность и награда за задержку перемножаются, а не складываются; похожий механизм отвечает за распознавание говорящих.
Потоковые модели за несколько недель выпустили OpenAI, Google, xAI и Alibaba
Потоковое распознавание речи превратилось в один из самых плотных сегментов рынка искусственного интеллекта. За несколько недель собственные потоковые модели выпустили OpenAI, Google, xAI и Alibaba, и это наложилось на предложение специализированных разработчиков, работавших в нише раньше. В сравнении Artificial Analysis Muse Voice Transcribe соперничает в том числе с моделями специализированных разработчиков Cartesia и ElevenLabs.
Muse Voice Transcribe относится к семейству Muse Spark, и в Meta ее называют первой в лаборатории моделью восприятия аудио в реальном времени. В обучении, по заявлению Meta, разбирались в том числе случаи, когда многоязычный говорящий переключается на другой язык посреди разговора. Открытые веса Meta публиковать не будет, в отличие от линейки Muse Glimmer, сообщил представитель Meta изданию The New Stack.
Час расшифровки стоит $0,18
Подробную проверку прошли 25 языков из более чем 70, на которых обучалась модель, а сравнение точности от Artificial Analysis охватывает только английскую речь. По действующему тарифу Meta Model API один час записи обходится в $0,18. Разрыв с ближайшим результатом, у Cartesia Ink-2, на англоязычном тесте AA-WER Streaming составляет 0,3 процентного пункта.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
