Scribe v2 Realtime
Распознавание живой речи за 150 миллисекунд на девяноста языках через API

Пока диктор договаривает фразу, расшифровка уже ложится в таймлайн. ElevenLabs выкатила Scribe v2 Realtime — движок потокового распознавания речи, созданный для голосовых ассистентов, синхронного протоколирования встреч и интерактивных интерфейсов. Модель ориентирована на живой поток: вы отдаёте аудио чанками и забираете готовый текст практически без паузы, не дожидаясь окончания реплики.
Что умеет
- Слушать на лету. Задержка выдачи текста составляет около 150 миллисекунд (по API — менее 100 мс), что позволяет собирать интерфейсы с мгновенной реакцией на голос.
- Понимать 90 языков. Распознаёт акценты, специфические диалекты и сложную акустическую обстановку.
- Предсказывать следующие слова. Предиктивный механизм заранее рассчитывает вероятные слова и пунктуацию, отсекая задержки потока.
- Держать удар сложной терминологией. Без запинки разбирает узкоспециализированный лексикон, бренды, аббревиатуры и медицинские названия.
- Фильтровать шумы. Корректно справляется с естественной речью — словами-паразитами, паузами, эмоциональными интонациями и низким качеством входящего аудио.
- Управлять фиксацией текста. Функция Voice Activity Detection ловит начало и конец фразы, а ручной контроль коммитов позволяет разработчику решать, когда превращать буфер в окончательный текст.
- Работать с телефонией и студийным звуком. Поддерживает форматы PCM (от 8 до 48 кГц) и μ-law.
- Восстанавливать контекст. Механизм Text conditioning продолжает транскрипцию без потери смысла даже после внезапного сброса соединения.
Чего здесь пока нет — так это разделения по спикерам и работы с двухканальным аудио. В компании открыто заявляют, что диаризация в реальном времени пока хромает на неанглийских языках, поэтому в приоритет её не ставят.
Цены и доступ
Инструмент подключается через WebSocket или REST API, а также встроен опцией в платформу ElevenLabs Agents. Стоимость использования начинается от $0,28 за час аудио на годовых тарифах Business. Для корпоративных клиентов предусмотрен лимит от 30 одновременных потоков.
По-нашему, инструмент пригодится студиям интерактивного продакшена, разработчикам виртуальных ведущих и создателям голосовых ассистентов — везде, где задержка в секунду ломает контакт со зрителем.

