open-models

Полнодуплексная модель ByteDance слушает и смотрит сразу

Promtime

open-models

Команда Seed внутри ByteDance выпустила SeedRealtime: аудио, видео и текст сведены в одну архитектуру, поэтому восприятие, решение и речь идут параллельно. Так снимается передача между отдельными модулями распознавания речи, зрения и синтеза, которая добавляет задержку и теряет контекст.

Момент ответа выбирает сама модель, без внешних правил детекции голосовой активности. Она отслеживает сцены, говорящих, паузы и посторонние разговоры, по картинке различает омофоны и связывает слово «это» с жестом или прошлым действием.

В сквозной оценке с людьми, по словам ByteDance, сбоев темпа диалога вдвое меньше, чем у каскадных систем.

Seed заявляет о полном развёртывании, но не называет ни API, ни регионы, ни цены. В планах меньшая задержка и подключение инструментов вроде поиска и бронирования.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.