Gemini 3.5 Transcribe
Речевая модель Gemini для точной расшифровки звука с таймкодами слов и распознаванием спикеров

Монтажеры и моушн-дизайнеры знают цену часам, потраченным на ручную расстановку титров и поиск нужных дублей в длинных интервью. Gemini 3.5 Transcribe берет черновую работу со звуком на себя: это специализированная модель распознавания речи на базе Gemini. Она переводит аудиодорожки в структурированный текст — как из готовых файлов, так и прямо в потоке через веб-сокеты.
Что умеет
- Определять больше 85 языков. Модель автоматически распознает язык речи и справляется со смешением языков внутри одной сессии или реплики.
- Разделять голоса по ролям. В файловом режиме поддерживается диаризация до 8 спикеров (распознавание для трех и более участников пока отмечено как экспериментальное).
- Выдавать таймкоды для каждого слова. Модель умеет привязывать временные метки к отдельным словам, что критично для синхронизации плашек и кинетической типографики.
- Очищать черновой текст. Функция умной транскрипции автоматически вырезает слова-паразиты и форматирует буквенно-цифровые последовательности.
- Учитывать профессиональный словарь. В систему можно загрузить до 1000 специфических терминов или названий брендов (лучшие результаты производитель обещает в пределах 100 слов).
- Держать фокус на таймингах. Файловый эндпоинт принимает дорожки длительностью до одного часа, но при включении диаризации или пословных таймкодов лимит снижается до 30 минут. Потоковая сессия рассчитана максимум на 10 минут.
Цены и доступ
Инструмент открыт через API в двух вариантах: gemini-3.5-transcribe для обработки файлов и gemini-3.5-transcribe-live для потокового вещания с низкой задержкой. Условия тарификации разработчики вынесли на отдельную страницу цен платформы. Пакетная обработка через Batch API моделью не поддерживается.
По-нашему, инструмент отлично закроет рутину в продакшене видео и подкастов — от быстрой подготовки субтитров до поиска нужных фраз на монтажном столе.
