Команда Seed внутри ByteDance выпустила SeedRealtime: аудио, видео и текст сведены в одну архитектуру, поэтому восприятие, решение и речь идут параллельно. Так снимается передача между отдельными модулями распознавания речи, зрения и синтеза, которая добавляет задержку и теряет контекст.
Момент ответа выбирает сама модель, без внешних правил детекции голосовой активности. Она отслеживает сцены, говорящих, паузы и посторонние разговоры, по картинке различает омофоны и связывает слово «это» с жестом или прошлым действием.
В сквозной оценке с людьми, по словам ByteDance, сбоев темпа диалога вдвое меньше, чем у каскадных систем.
Seed заявляет о полном развёртывании, но не называет ни API, ни регионы, ни цены. В планах меньшая задержка и подключение инструментов вроде поиска и бронирования.

