Gemini 3.8 Live
Речевые модели с параллельным рассуждением и визуальным восприятием в реальном времени

Google выкатил семейство голосовых моделей Gemini 3.8 Live, где ИИ перестал замирать перед сложным ответом. Главное инженерное новшество здесь — параллельное рассуждение: модель думает прямо во время разговора, комментирует свои действия на лету и держит непрерывный диалог, пока на фоне крутятся фоновые вычисления или сторонние скрипты.
Линейка разделена на две версии. Базовая Gemini 3.8 Live оптимизирована под скорость и масштабирование, а Gemini 3.8 Live Extended Thinking берет на себя многоступенчатые сценарии и тяжелые цепочки рассуждений.
Что умеет
- Рассуждать вслух. Версия Extended Thinking одновременно думает и говорит: предупреждает репликами вроде «Дай-ка проверю...» и проговаривает промежуточный прогресс выполнения фоновой задачи.
- Смотреть и слушать почти синхронно. Модель считывает визуальный контекст практически в реальном времени, обогащая им голосовой ответ.
- Переключать языки на лету. Система автоматически определяет и бесшовно переходит между 97 языками прямо посреди фразы.
- Дергать API без пауз в общении. Агент запускает внешние инструменты в фоне, не прерывая контакт и продолжая диалог с пользователем.
- Метить сгенерированный звук. Во все аудиопотоки встроен неслышимый цифровой водяной знак SynthID для защиты от дипфейков.
Доступ
Модели уже развернуты разработчикам через Gemini API и Google AI Studio, а также доступны через платформы вроде Agora, LiveKit и Vercel. Обычные пользователи могут найти базовую версию в поиске Search Live, а продвинутая версия подключается в Gemini Live и сервисах Google Workspace (Docs, Gmail, Keep) по подпискам Google AI Pro и Ultra. Корпоративным клиентам доступен приватный превью в Gemini Enterprise.
Для креативных команд и студий это готовая основа для живых голосовых ассистентов, умеющих разбирать брифы, перебирать референсы и дергать пайплайны продакшена прямо с голоса. Инструмент превращает диалог с софтом в непрерывную летучку.


