multimodal

90 миллисекунд до первого звука и 83 языка

Promtime

multimodal

S2.1 Pro от Fish Audio выдаёт первый звук примерно за 90 миллисекунд на стандартных вызовах, чего хватает для естественной смены реплик в живом диалоге. Модель охватывает 83 языка, сохраняя единую идентичность голоса во всех.

Подачу задают свободные теги в квадратных скобках прямо в тексте: в строку можно вписать шёпот или нервный смешок, не переключаясь на фиксированный список эмоций. Поддерживаются диалоги нескольких говорящих и клонирование голоса по образцам длиной обычно 10–30 секунд, без дообучения.

Относительно прежней S2-Pro компания заявляет прирост в качестве, задержке и пропускной способности. В агентские сценарии модель встраивается через MCP и поддержку агентских навыков.

S2.1 Pro уже работает через API Fish Audio, бесплатный уровень даёт ту же модель в рамках честного использования.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.