S2.1 Pro от Fish Audio выдаёт первый звук примерно за 90 миллисекунд на стандартных вызовах, чего хватает для естественной смены реплик в живом диалоге. Модель охватывает 83 языка, сохраняя единую идентичность голоса во всех.
Подачу задают свободные теги в квадратных скобках прямо в тексте: в строку можно вписать шёпот или нервный смешок, не переключаясь на фиксированный список эмоций. Поддерживаются диалоги нескольких говорящих и клонирование голоса по образцам длиной обычно 10–30 секунд, без дообучения.
Относительно прежней S2-Pro компания заявляет прирост в качестве, задержке и пропускной способности. В агентские сценарии модель встраивается через MCP и поддержку агентских навыков.
S2.1 Pro уже работает через API Fish Audio, бесплатный уровень даёт ту же модель в рамках честного использования.

