Gemini 3.1 Flash TTS
Генерация речи с режиссурой персонажей и сменой интонаций прямо посреди фразы

Google выкатил Gemini 3.1 Flash TTS — генератор речи, в котором дикторами можно управлять буквально как живыми актёрами у микрофона. Модель ориентирована на разработчиков сервисов, авторов видео и команды продакшена, которым надоели безжизненные синтетические голоса и не хватает тонкой драматургии в озвучке.
Что умеет
- Режиссура сцены. В системе задаётся контекст окружения и характер взаимодействия, благодаря чему персонажи сохраняют заданную манеру речи и естественно реагируют друг на друга на протяжении длинного диалога.
- Многоголосие из коробки. Поддерживает разбивку реплик между несколькими участниками беседы в рамках одного запроса.
- Текстовые аудио-теги. Инструкции на естественном языке встраиваются прямо в текст сценария: темп, акцент, тон и эмоции можно переключать даже посреди одного предложения.
- Профили голосов и заметки режиссёра. Каждому герою настраивается собственный голосовой профиль, после чего параметры фиксируются и экспортируются в код для Gemini API.
- Мультиязычность. Работает более чем на 70 языках с возможностью локализации акцентов и ритмики.
- Защитная маркировка. В генерируемый звук на аппаратном уровне вшивается невидимый водяной знак SynthID для верификации контента.
Доступ
Модель развёрнута в режиме превью для разработчиков в Google AI Studio и через Gemini API. Корпоративным клиентам доступ открыт на платформе Vertex AI, а пользователям офисного пакета Workspace инструмент предоставлен внутри видеоредактора Google Vids.
Инструмент пригодится моушн-дизайнерам, авторам видеоконтента и создателям интерактивных приложений: теперь реплику персонажа для ролика или прототипа можно переозвучить без похода в сторонний софт — достаточно вписать нужную интонацию в скобках прямо в текст.


