Gemini 3.1 Flash TTS

Генерация речи с режиссурой персонажей и сменой интонаций прямо посреди фразы

Фото: Google

Google выкатил Gemini 3.1 Flash TTS — генератор речи, в котором дикторами можно управлять буквально как живыми актёрами у микрофона. Модель ориентирована на разработчиков сервисов, авторов видео и команды продакшена, которым надоели безжизненные синтетические голоса и не хватает тонкой драматургии в озвучке.

Что умеет

  • Режиссура сцены. В системе задаётся контекст окружения и характер взаимодействия, благодаря чему персонажи сохраняют заданную манеру речи и естественно реагируют друг на друга на протяжении длинного диалога.
  • Многоголосие из коробки. Поддерживает разбивку реплик между несколькими участниками беседы в рамках одного запроса.
  • Текстовые аудио-теги. Инструкции на естественном языке встраиваются прямо в текст сценария: темп, акцент, тон и эмоции можно переключать даже посреди одного предложения.
  • Профили голосов и заметки режиссёра. Каждому герою настраивается собственный голосовой профиль, после чего параметры фиксируются и экспортируются в код для Gemini API.
  • Мультиязычность. Работает более чем на 70 языках с возможностью локализации акцентов и ритмики.
  • Защитная маркировка. В генерируемый звук на аппаратном уровне вшивается невидимый водяной знак SynthID для верификации контента.

Доступ

Модель развёрнута в режиме превью для разработчиков в Google AI Studio и через Gemini API. Корпоративным клиентам доступ открыт на платформе Vertex AI, а пользователям офисного пакета Workspace инструмент предоставлен внутри видеоредактора Google Vids.

Инструмент пригодится моушн-дизайнерам, авторам видеоконтента и создателям интерактивных приложений: теперь реплику персонажа для ролика или прототипа можно переозвучить без похода в сторонний софт — достаточно вписать нужную интонацию в скобках прямо в текст.

Сайт Gemini 3.1 Flash TTS
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд