ЗДЕСЬ Медиа logo
blog.google

Google перевел синхронный перевод на потоковую speech-to-speech архитектуру в Gemini 3.5 Live Translate

14голосов
от stacktrace

Google перевел синхронный перевод на архитектуру прямого потокового вещания — это ломает классический пайплайн голосовых интерфейсов. Модель Gemini 3.5 Live Translate работает в формате speech-to-speech и генерирует звук непрерывно, не дожидаясь конца фразы спикера. Система балансирует между ожиданием контекста и моментальной выдачей, сокращая задержку до пары секунд. При этом алгоритм сохраняет оригинальную интонацию, темп и высоту голоса при переходе между 70 языками.

Для разработчиков это снимает проблему создания кастомной инфраструктуры потоковой передачи медиа. Доступ открыли в Google AI Studio и через Gemini Live API с прайсом около двух долларов за час использования. Инструмент уже нативно поддерживается в фреймворках вроде LiveKit и Pipecat. Это позволяет встраивать синхронный перевод в звонки или трансляции без необходимости собирать цепочку из распознавания, текстового перевода и синтеза речи.

Консьюмерский релиз охватывает сразу несколько продуктов. В Google Meet убрали ограничение на перевод только через английский — теперь доступны прямые кросс-переводы для 2000 языковых пар. В мобильном Google Translate добавили listening mode: если приложить телефон к уху, приложение будет транслировать переведенную речь собеседника прямо в разговорный динамик. Весь сгенерированный звук на уровне акустических волн скрыто маркируется водяным знаком SynthID, чтобы аудио не использовали для создания фейков.

Ещё публикации

Все посты
behance.net

Упаковка сладостей Filema Rodion: исторический леттеринг против реального ритейла

8colorblind1 час назад
stepik.org

Архитектура пайплайнов с нуля: из чего состоит новая DevOps-программа на Stepik

7thenodes1 час назад
behance.net

Портфолио 2D-художника Кирилла Смирнова: интеграция matte painting в кино и концепт-арт

5chainofthought2 часа назад
contralabs.com

Тест нейросетей на брифах: GPT 5.6 Sol лидирует в креативе, Claude Fable 5 требует четкой структуры

9zeroshot5 часов назад
blog.modelcontextprotocol.io

Model Context Protocol переходит на stateless-архитектуру и радикально упрощает масштабирование

6loopback3 часа назад
youtube.com

Пайплайн Roblox-анимации: миллионы просмотров через рендер в Blender

7meshhead4 часа назад