meta

Потоковая расшифровка Meta: 3,1% ошибочных слов

Promtime

Meta Superintelligence Labs выпустила Muse Voice Transcribe, модель потокового распознавания речи, которая на англоязычном бенчмарке AA-WER Streaming показала 3,1% ошибок в словах и обошла GPT Live Transcribe, Gemini 3.5 Transcribe Live, а также модели Cartesia и ElevenLabs. Запуск состоялся во вторник, подробности привело издание The New Stack.

Коротко

  • Аудио поступает отрезками по 80 миллисекунд, 12,5 отрезка в секунду, и на каждом шаге модель выбирает: выдать текстовый токен или маркер next audio, запросив следующий фрагмент звука.
  • Meta заявляет, что модель различает более 20 говорящих, обучена более чем на 70 языках и удерживает контекст разговоров длительностью свыше часа.
  • Доступ к модели открыт через Meta Model API, а также в приложении Meta AI для Mac и в среде разработки Muse Code, тариф API составляет $3,00 за 1 000 аудиоминут.

Преимущество в 0,3 процентного пункта на одном англоязычном тесте выглядит скорее заявкой, чем закрепленной позицией: в сегменте с такой плотностью запусков таблица лидеров переписывается быстро. Более устойчивым кажется другое: у Meta есть собственные продукты, которым потоковая расшифровка нужна постоянно, и это дает лаборатории повод развивать модель независимо от текущего места в рейтинге. Отказ от публикации весов при этом оставляет независимую проверку качества сторонним бенчмаркам и самому API.

На англоязычном тесте 3,1% ошибок в словах, на бенчмарках по говорящим 17,5%

На бенчмарке AA-WER Streaming от Artificial Analysis, который измеряет точность потоковой расшифровки английской речи, у Muse Voice Transcribe 3,1% ошибок в словах. Cartesia Ink-2 в том же сравнении показывает 3,4%, ElevenLabs Scribe v2 Real-time 3,6%, GPT Live Transcribe 3,9%, Gemini 3.5 Transcribe Live 4%.

Разделение говорящих дается потоковым моделям заметно хуже расшифровки слов. На нескольких стандартных бенчмарках Muse Voice Transcribe ошибается в 17,5% случаев при определении, кто именно говорит, и по этому показателю опережает остальные модели реального времени, хотя абсолютный уровень ошибок в этой задаче остается высоким у всех.

Ранее Meta Superintelligence Labs выпустила Muse Spark, которая тоже переводит речь в текст, хотя и не специализируется на этой задаче. Muse Voice Transcribe рассчитана на потоковый режим, где текст появляется по ходу речи, и именно этот режим измеряет бенчмарк Artificial Analysis.

Награда за точность и награда за задержку перемножаются

Архитектурно это авторегрессионная мультимодальная модель. Звук поступает отрезками по 80 миллисекунд, то есть 12,5 отрезка в секунду, и каждый сжимается в один мягкий токен. На каждом шаге модель выбирает: выдать текстовый токен или служебный маркер next audio, который система заменяет следующим фрагментом записи.

Когда запись обрывается, маркер empty audio сообщает модели, что продолжения не будет, и она выдает удержанный текст. Поскольку модель сама решает, сколько звука услышать до фиксации слова, она управляет своей задержкой: в Meta называют это адаптивной задержкой, при которой трудные слова получают больше контекста, а простые расшифровываются почти сразу. Компромисс закрепляется на этапе обучения с подкреплением, где награда за точность и награда за задержку перемножаются, а не складываются; похожий механизм отвечает за распознавание говорящих.

Потоковые модели за несколько недель выпустили OpenAI, Google, xAI и Alibaba

Потоковое распознавание речи превратилось в один из самых плотных сегментов рынка искусственного интеллекта. За несколько недель собственные потоковые модели выпустили OpenAI, Google, xAI и Alibaba, и это наложилось на предложение специализированных разработчиков, работавших в нише раньше. В сравнении Artificial Analysis Muse Voice Transcribe соперничает в том числе с моделями специализированных разработчиков Cartesia и ElevenLabs.

Muse Voice Transcribe относится к семейству Muse Spark, и в Meta ее называют первой в лаборатории моделью восприятия аудио в реальном времени. В обучении, по заявлению Meta, разбирались в том числе случаи, когда многоязычный говорящий переключается на другой язык посреди разговора. Открытые веса Meta публиковать не будет, в отличие от линейки Muse Glimmer, сообщил представитель Meta изданию The New Stack.

Час расшифровки стоит $0,18

Подробную проверку прошли 25 языков из более чем 70, на которых обучалась модель, а сравнение точности от Artificial Analysis охватывает только английскую речь. По действующему тарифу Meta Model API один час записи обходится в $0,18. Разрыв с ближайшим результатом, у Cartesia Ink-2, на англоязычном тесте AA-WER Streaming составляет 0,3 процентного пункта.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.