Новость

Google выпустила Gemini 3.8 Live с видеоаватаром для корпоративных ИИ-ассистентов

Фото: Google

Google запустила Gemini 3.8 Live с Live Avatar — надстройку над голосовым диалогом Gemini, которая добавляет ассистенту видимое лицо в реальном времени. Функция вышла спустя неделю после запуска самого Gemini 3.8 Live и уже доступна в Gemini Enterprise.

Технически это синхронная генерация видео и речи: система слушает, видит собеседника и говорит одновременно, с точной синхронизацией губ, живой мимикой и естественными паузами при смене реплик. В Google приводят пример: виртуальный аватар заселяет гостя в отель, попутно обращаясь к внутренним системам за данными о брони, — и диалог при этом не прерывается, потому что вызовы инструментов Gemini выполняет асинхронно, в фоне, продолжая разговор.

Отдельно сделали ставку на язык. Live Avatar использует нативную мультиязычную синхронизацию речи и видео и умеет на лету переключаться между 97 языками, не теряя качество картинки и не сбиваясь в синхронизации губ — то есть один и тот же аватар способен вести разговор с клиентами по всему миру без смены модели или перезаписи.

Для брендинга Google предлагает библиотеку готовых аватаров и возможность собрать собственный: разработчик загружает одну качественную референсную фотографию, и система генерирует полностью анимированного, отвечающего аватара, сохраняя внешность и стиль персонажа. Правда, создание кастомных аватаров пока доступно только по отдельному запросу для корпоративных клиентов.

Из мер предосторожности — весь сгенерированный контент помечен SynthID: незаметная глазу метка вшита прямо в аудио- и видеопоток, чтобы ИИ-контент можно было отличить от настоящего и снизить риск дезинформации.

Пока функция нацелена на энтерпрайз — клиентскую поддержку и интерактивные сценарии вроде виртуальных гидов и консультантов, а не на массового пользователя Gemini-приложения. Но сам факт, что крупная лаборатория выкатывает говорящее, смотрящее в камеру лицо как стандартную часть корпоративного ассистента, а не как демо-трюк, показывает: видеоаватары для бизнеса перестают быть нишевой технологией и становятся обычной строкой в прайсе облачных сервисов.

За проектом стоит команда Gemini Audio — в блоге его представляют исследователь Шуо-йинь Чанг и инженер Си Джей Чжэн. Пример с заселением в отель показателен: ассистент одновременно поддерживает разговор и обращается к внутренним системам за данными брони, и с точки зрения пользователя это выглядит как обычный диалог с живым собеседником, а не как переключение между чат-окном и голосовым меню. Для команд, которые уже строят motion- и видеопродукцию с генеративными инструментами, это ещё один сигнал: реалистичный говорящий аватар в реальном времени перестаёт быть отдельным сложным пайплайном рендеринга и превращается в обычный API-вызов корпоративного уровня.

Ещё новости

Все новости →