Перейти к содержанию

google

Аватар Gemini 3.8 Live не замолкает, пока ищет данные

Promtime

Самое любопытное в демонстрации Google происходит у стойки регистрации в отеле. Экранный администратор продолжает разговаривать с гостем, а агент тем временем собирает в фоне данные для заселения. Как пишет Testingcatalog, так выглядит Live Avatar, надстройка над Gemini 3.8 Live, которая уже общедоступна в Gemini Enterprise.

Коротко

  • Google добавила к живому диалогу Gemini 3.8 Live видеоперсонажа, который одновременно принимает звук и изображение, отвечает голосом и держит мимику почти в реальном времени в корпоративных сценариях.
  • Синхронизация речи с движением губ, по словам Google, работает на 97 языках, и язык можно сменить посреди разговора без потери качества видео и видимого дрейфа изображения.
  • Готовых персонажей выбирают из библиотеки, а собственный аватар по референсному изображению делают только для компаний из белого списка, и в звук и видео вшит невидимый водяной знак SynthID.

Если вы не следили: сама Gemini 3.8 Live вышла неделей раньше и отвечала за живой диалог. Live Avatar сделала команда Gemini Audio как расширение этой модели, и к готовому диалогу добавился видеопоток с низкой задержкой. В качестве целевых сценариев Google называет поддержку клиентов и сопровождение пользователя по шагам какой-нибудь процедуры.

В демонстрации с отелем аватар остаётся в кадре, пока агент вызывает инструменты

Google показала несколько роликов: разных персонажей, разговор почти в реальном времени, переключение языка внутри одной беседы и регистрацию в отеле. Анонс сопровождал пост Google Cloud Tech от 24 сентября 2026 года, где среди ключевых возможностей перечислены видеоаватары, плавный диалог и вызов инструментов. На примере с отелем стоит задержаться. Гость разговаривает с персонажем на экране, а данные для заселения тем временем подтягиваются через вызовы инструментов.

Live Avatar умеет вызывать инструменты и получать данные асинхронно, продолжая говорить. Корпоративный агент в итоге выполняет задачу и не исчезает из разговора на время запроса. В сценарии с отелем визуальный персонаж остаётся на месте, пока информация для регистрации собирается за кулисами.

Губы и мимика подстраиваются под смену языка, заявлено 97 языков

Второй упор Google делает на естественность. Аватар точно синхронизирует губы с речью, показывает естественную мимику и плавно передаёт очередь реплик, чтобы разговор ощущался ближе к встрече лицом к лицу. Передача очереди, turn-taking, описывает, кто и когда говорит: системе нужно понять, что человек закончил фразу, и вовремя вступить самой.

Нативная многоязычная синхронизация «речь в речь», по словам Google, покрывает 97 языков. Когда язык меняется посреди разговора, вслед за ним меняются движения губ и выражение лица. Систему проектировали так, чтобы переход между языками не снижал качество видео и не давал видимого дрейфа изображения, то есть лицо персонажа не должно постепенно расходиться с исходным обликом.

Фирменный персонаж по референсу доступен только из белого списка

Компании выбирают аватар из библиотеки готовых персонажей или создают фирменного по качественному референсному изображению. Google утверждает, что такой аватар сохраняет сходство с исходником, визуальный стиль или узнаваемость персонажа и при этом полностью анимирован и реагирует на собеседника. Создание собственных аватаров ограничено сильнее, чем основной продукт: сейчас для этого компании нужно попасть в корпоративный белый список.

В релиз включены защитные механизмы, которые, по формулировке Google, призваны уважать идентичность. В аудио и видео встроен водяной знак SynthID, незаметный для человека. Google объясняет, что метка нужна, чтобы сгенерированный ИИ материал оставался распознаваемым, и чтобы снизить риск дезинформации и ложного приписывания авторства.

Как аватару удаётся слушать, смотреть и говорить одновременно?

Ответ в том, что несколько процессов идут параллельно. Модель принимает от пользователя звук и изображение, ведёт диалог и сразу выдаёт видео с низкой задержкой, где губы и лицо следуют за речью. Google описывает эту связку как нативную: команда Gemini Audio соединила диалоговые возможности Gemini 3.8 Live с видеопотоком с низкой задержкой.

Вызов инструментов устроен так же параллельно. Представьте хорошего администратора на ресепшене: он спокойно беседует с гостем о дороге, пока коллега в соседней комнате проверяет бронь. Гостю не приходится стоять перед пустой стойкой, и когда данные готовы, разговор просто переходит к ним.

Чего в материалах нет, так это цифр. Google говорит о низкой задержке и работе «почти в реальном времени», но не называет ни миллисекунд, ни цены, ни списка из 97 языков, ни того, как именно устроены защитные механизмы для идентичности. На наш взгляд, аватар по одному референсному снимку с сохранением сходства и есть самая чувствительная часть релиза, и белый список для неё выглядит разумным ограничением.

Когда откроют фирменные аватары

Сроков, когда создание собственных персонажей выйдет за пределы белого списка, Google не называет. Не объявлены и цены на Live Avatar в Gemini Enterprise. Открытым остаётся вопрос, насколько заявленная синхронизация на 97 языках и асинхронные вызовы инструментов выдержат настоящие звонки в поддержку, где собеседники перебивают, шумят и переходят с языка на язык куда менее аккуратно, чем в демонстрационных роликах.

Читайте также

  1. Gemini 3.8 Live Extended Thinking подвинула GPT Live 1
  2. Gemini 3.8 Flash TTS разыгрывает диалог по сценарию
  3. Майндмэп появляется в отчёте Gemini Notebook по кнопке
  4. Custom MCP в Gemini Business идут в Public Preview
  5. Lyria 3.5 генерирует песни целиком в Gemini и AI Studio
  6. Gemini Live получил доступ к Gmail и Spark

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.