openai

Голосовой API умеет слушать и говорить одновременно

Promtime

openai

OpenAI открыла GPT-Live-1 в API: модель ведёт голосовой диалог в полнодуплексном режиме и, по данным OpenAI, слушает собеседника прямо во время собственной реплики. Доступ к модели через API открылся 10 сентября 2026 года, а сам режим GPT-Live до этого работал в ChatGPT.

Коротко

  • Перебивания в GPT-Live-1 обрабатывает одна модель, которая, по данным OpenAI, рассуждает над входящим и исходящим звуком вместе, а рассуждения и вызовы инструментов она может передавать бэкенд-системам.
  • Собственные голоса, поддержка телефонии и более точное следование инструкциям заявлены как часть того же запуска, который открыл разработчикам доступ к полнодуплексному голосовому режиму OpenAI в API.
  • Голос на базе GPT-Live появился в ChatGPT 8 июля 2026 года, 31 июля в его аудио добавили водяные знаки SynthID, и лишь после этого модель дошла до API.

Полнодуплексный обмен закрывает главную претензию к голосовым интерфейсам предыдущего поколения: пауза перед ответом и потерянные перебивания выдавали сборку из распознавания речи, текстовой модели и синтеза. Судя по описанию запуска, OpenAI сводит разговорный слой в одну модель, а логику и вызовы инструментов оставляет на стороне разработчика. Для телефонных сценариев, где собеседник перебивает постоянно, такая архитектура значит больше, чем очередной прирост качества синтеза, и меняет требования к тому, как устроено голосовое приложение целиком.

GPT-Live-1 открыт в API как модель для естественного голосового диалога, и OpenAI перечисляет в качестве отличий более точное следование инструкциям, собственные голоса и поддержку телефонии. Собственные голоса в голосовых API обычно означают возможность закрепить за продуктом узнаваемое звучание вместо стандартного набора пресетов, доступного всем разработчикам сразу.

Полный дуплекс в голосовых интерфейсах означает одновременную передачу звука в обе стороны, без поочерёдной смены ролей говорящего и слушающего между репликами. Перебивания в GPT-Live-1 обрабатывает одна модель, которая, по данным OpenAI, рассуждает над входящим и исходящим аудио вместе. Рассуждения и вызовы инструментов модель может передавать бэкенд-системам, следует из описания OpenAI.

В ChatGPT голос на базе GPT-Live запустили 8 июля 2026 года, за два месяца до открытия модели в API. 31 июля в аудио этого режима добавили водяные знаки SynthID: они помечают синтезированную речь так, чтобы её происхождение можно было определить программно.

Цены и лимиты не названы

Тарифы, лимиты запросов и полный список доступных голосов в описании запуска OpenAI не приводит, как и перечень стран, где работает телефонная интеграция. Неизвестно, распространяется ли маркировка SynthID на аудио, которое GPT-Live-1 отдаёт через API: о водяных знаках сообщалось применительно к голосовому режиму ChatGPT. Численных оценок прироста в следовании инструкциям в анонсе тоже нет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.