Google показал Live Avatar с генерацией говорящих лиц в реальном времени

Собеседник на экране смотрит прямо в глаза, говорит без малейшей рассинхронизации губ, а когда его перебиваешь на полуслове — мгновенно замолкает и слушает. Это не заранее отрендеренный ролик и не анимация на костях, собранная моушн-дизайнером к дедлайну. Google выкатил инструмент Live Avatar для платформы Gemini 3.8 Live, шагнув в сегмент интерактивных цифровых персонажей, работающих буквально на лету.
Главная проблема генеративного видео всегда упиралась в задержку: модели требовались секунды или минуты, чтобы просчитать кадры, положить звук и свести артикуляцию. В Gemini 3.8 Live генерацию перевели в потоковый режим. Персонаж синтезирует речь, мимику и липсинк синхронно с ответом языковой модели, не заставляя зрителя ждать завершения буферизации.
Интерактивность здесь держится на двух ключевых механиках — turn-taking и асинхронном вызове инструментов. Функция turn-taking позволяет прерывать аватар в любой момент разговора: система отслеживает голос пользователя и останавливает речь модели без зависания видеопотока. Вторая механика — tool calling — решает вечную проблему пауз при обращении к внешним базам данных. Пока аватар поддерживает живой диалог и шутит, модель в фоновом режиме отправляет запросы к внешним API — например, оформляет бронь в отеле или проверяет расписание рейсов, не выпадая из кадра ни на миллисекунду.
Что умеет система и как устроен пайплайн
Инструмент изначально заточен под глобальные сценарии и работу со сложными медиапотоками:
- Поддержка 97 языков с переключением на лету: аватар может начать реплику на одном языке и продолжить на другом без сбоев в мимике и без перезапуска сессии.
- Библиотека готовых цифровых персонажей для быстрого развёртывания интерактивных интерфейсов.
- Создание кастомного лица по одной качественной фотографии — без многокамерных сканов и сложного риггинга.
- Сквозная маркировка контента: водяной знак SynthID встраивается напрямую и в аудиодорожку, и в видеоряд, позволяя безошибочно определять синтетическое происхождение материала.
Массового доступа к кастомизации пока нет. Сгенерировать собственного персонажа из портрета разрешают только через закрытый список ожидания — allowlist. По всей видимости, так разработчики страхуются от волны неконтролируемых дипфейков с реальными людьми.
Попробовать технологию прямо в браузере рядовому пользователю тоже не удастся. Функция Live Avatar запущена исключительно внутри корпоративного контура Gemini Enterprise — на платформе Agent Platform, которую раньше знали как Vertex. Тарифные планы и точную стоимость использования вычислительных мощностей компания пока держит в секрете.
В официальной документации Google очертил пять направлений, где говорящие головы должны заменить привычные интерфейсы и статичные скрипты:
- Корпоративные амбассадоры: легальная оцифровка сотрудников или нанятых актёров с соблюдением авторских прав и юридических договоров.
- Неигровые персонажи (NPC) для геймдева, способные вести осмысленные диалоги без заготовленного дерева реплик.
- Навигаторы и консультанты в медицинских и сервисных учреждениях.
- Голосовые и визуальные интерфейсы для умных очков и бортовых автомобильных систем.
- Терминалы самообслуживания, ресепшн в отелях, отделения банков и интерактивные уличные киоски.
Для арт-директоров и специалистов визуального продакшена это сигнал о тектоническом сдвиге. До сих пор интерактив в брендинге и ритейле требовал либо дорогостоящей пререндеренной 3D-графики, либо найма живых людей на первую линию. Теперь персонаж становится динамическим слоем поверх языковой модели: достаточно настроить логику агента, скормить системе один визуальный референс и подключить к ней API бэкенда.
Если инструмент покажет стабильность за пределами демо, привычный пайплайн создания виртуальных маскотов и видеогайдов сожмётся до одного промпта и пары строчек серверного кода.


