Cohere Transcribe
Открытая 2B-модель распознавания речи на 14 языках с рекордной точностью и локальным запуском

Команда Cohere выпустила Transcribe — модель распознавания речи на два миллиарда параметров под свободной лицензией Apache 2.0. Систему обучали с нуля: конформерный энкодер снимает акустические признаки со спектрограммы, а компактный трансформер-декодер собирает чистый текст. Модель задумывали под боевой продакшен, где важны не лабораторные рекорды, а устойчивость к шумам переговорных комнат, разным микрофонам и сильным акцентам.
Что умеет
- Точно транскрибирует аудио на 14 языках: английском, французском, немецком, итальянском, испанском, португальском, греческом, нидерландском, польском, китайском (мандарин), японском, корейском, вьетнамском и арабском.
- Показывает среднюю ошибку WER на уровне 5,42% на тестах Open ASR Leaderboard, опережая Whisper Large v3 и ElevenLabs Scribe v2.
- Уверенно разбирает многоголосые записи, спонтанные диалоги и акустику залов заседаний.
- Демонстрирует высокий коэффициент RTFx в классе моделей от одного миллиарда параметров — минуты звука превращаются в текст за секунды.
- Работает на локальных видеокартах и компактных edge-устройствах без необходимости держать огромный серверный кластер.
Цены и доступ
Веса выложены в открытый доступ на Hugging Face, запускать модель на собственных мощностях можно бесплатно. Для быстрых экспериментов компания дает бесплатный доступ через API с лимитами частоты запросов. Корпоративным клиентам доступна платформа Model Vault с защищенным облачным инференсом: тариф рассчитывается за час работы инстанса, а долгосрочные контракты идут со скидкой.
Transcribe пригодится видеопродакшенам, агентствам и разработчикам голосовых ассистентов, которым надо быстро готовить черновики субтитров или разбирать созвоны с клиентами. Модель можно запереть внутри защищенного студийного контура, не переживая за утечку закрытых брифов.

