Новость

Google показал Live Avatar с генерацией говорящих лиц в реальном времени

The image is a promotional graphic for a live event called "Gemini 3.8 Live with Live Avatar". The background is a gradient of blue and white, with a stylized, abstract design that resembles a cloud or a wave. The text "Gemini 3.8 Live with Live Avatar" is prominently displayed in black, centered on the image. The text
Фото: Google

Собеседник на экране смотрит прямо в глаза, говорит без малейшей рассинхронизации губ, а когда его перебиваешь на полуслове — мгновенно замолкает и слушает. Это не заранее отрендеренный ролик и не анимация на костях, собранная моушн-дизайнером к дедлайну. Google выкатил инструмент Live Avatar для платформы Gemini 3.8 Live, шагнув в сегмент интерактивных цифровых персонажей, работающих буквально на лету.

Главная проблема генеративного видео всегда упиралась в задержку: модели требовались секунды или минуты, чтобы просчитать кадры, положить звук и свести артикуляцию. В Gemini 3.8 Live генерацию перевели в потоковый режим. Персонаж синтезирует речь, мимику и липсинк синхронно с ответом языковой модели, не заставляя зрителя ждать завершения буферизации.

Интерактивность здесь держится на двух ключевых механиках — turn-taking и асинхронном вызове инструментов. Функция turn-taking позволяет прерывать аватар в любой момент разговора: система отслеживает голос пользователя и останавливает речь модели без зависания видеопотока. Вторая механика — tool calling — решает вечную проблему пауз при обращении к внешним базам данных. Пока аватар поддерживает живой диалог и шутит, модель в фоновом режиме отправляет запросы к внешним API — например, оформляет бронь в отеле или проверяет расписание рейсов, не выпадая из кадра ни на миллисекунду.

Что умеет система и как устроен пайплайн

Инструмент изначально заточен под глобальные сценарии и работу со сложными медиапотоками:

  • Поддержка 97 языков с переключением на лету: аватар может начать реплику на одном языке и продолжить на другом без сбоев в мимике и без перезапуска сессии.
  • Библиотека готовых цифровых персонажей для быстрого развёртывания интерактивных интерфейсов.
  • Создание кастомного лица по одной качественной фотографии — без многокамерных сканов и сложного риггинга.
  • Сквозная маркировка контента: водяной знак SynthID встраивается напрямую и в аудиодорожку, и в видеоряд, позволяя безошибочно определять синтетическое происхождение материала.

Массового доступа к кастомизации пока нет. Сгенерировать собственного персонажа из портрета разрешают только через закрытый список ожидания — allowlist. По всей видимости, так разработчики страхуются от волны неконтролируемых дипфейков с реальными людьми.

Попробовать технологию прямо в браузере рядовому пользователю тоже не удастся. Функция Live Avatar запущена исключительно внутри корпоративного контура Gemini Enterprise — на платформе Agent Platform, которую раньше знали как Vertex. Тарифные планы и точную стоимость использования вычислительных мощностей компания пока держит в секрете.

В официальной документации Google очертил пять направлений, где говорящие головы должны заменить привычные интерфейсы и статичные скрипты:

  • Корпоративные амбассадоры: легальная оцифровка сотрудников или нанятых актёров с соблюдением авторских прав и юридических договоров.
  • Неигровые персонажи (NPC) для геймдева, способные вести осмысленные диалоги без заготовленного дерева реплик.
  • Навигаторы и консультанты в медицинских и сервисных учреждениях.
  • Голосовые и визуальные интерфейсы для умных очков и бортовых автомобильных систем.
  • Терминалы самообслуживания, ресепшн в отелях, отделения банков и интерактивные уличные киоски.

Для арт-директоров и специалистов визуального продакшена это сигнал о тектоническом сдвиге. До сих пор интерактив в брендинге и ритейле требовал либо дорогостоящей пререндеренной 3D-графики, либо найма живых людей на первую линию. Теперь персонаж становится динамическим слоем поверх языковой модели: достаточно настроить логику агента, скормить системе один визуальный референс и подключить к ней API бэкенда.

Если инструмент покажет стабильность за пределами демо, привычный пайплайн создания виртуальных маскотов и видеогайдов сожмётся до одного промпта и пары строчек серверного кода.

Ещё новости

Все новости →