Gemini 3.5 Live Translate

Синхронный перевод речи в речь на 70+ языков с сохранением голоса и темпа спикера

Фото: Google

Gemini 3.5 Live Translate — аудиомодель Google для непрерывного перевода живой речи в речь в реальном времени. В отличие от привычных систем, ожидающих конца фразы, модель подхватывает аудиопоток на лету: генерирует перевод с отставанием всего в пару секунд, сохраняя связность без пауз и перебиваний. Для креативных команд и продюсеров это открывает прямой путь к живому дубляжу и международным трансляциям без долгого постпродакшена.

Что умеет

  • Переводить на лету более 70 языков. Распознает речь автоматически без ручного переключения настроек в интерфейсе.
  • Сохранять манеру говорящего. Модель переносит оригинальную интонацию, высоту голоса и темп речи в сгенерированный звук.
  • Изолировать шум. Устойчивость к посторонним звукам позволяет использовать перевод в непредсказуемых и шумных условиях.
  • Работать в потоковом режиме. Подходит для синхронного дубляжа, онлайн-уроков, стримов и многоязычных звонков.
  • Защищать звук меткой. Весь сгенерированный аудиопоток маркируется незаметным водяным знаком SynthID для проверки подлинности.

Доступность

Модель разворачивается сразу на нескольких уровнях. Разработчикам доступно публичное превью через Gemini Live API и Google AI Studio, а также интеграции на платформах LiveKit, Agora и Pipecat. Для бизнеса открыто закрытое превью в Google Meet с поддержкой более 2000 языковых комбинаций. Обычные пользователи получают инструмент в мобильном приложении Google Translate на Android и iOS — включая режим прослушивания через разговорный динамик телефона без наушников.

Инструмент пригодится продюсерам прямых трансляций, авторам подкастов и командам с международными клиентами — всем, кому важно стереть языковой барьер прямо во время эфира или созвона.

Сайт Gemini 3.5 Live Translate
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд