РазноеплатноMistral AI

Voxtral Transcribe 2

Семейство моделей распознавания речи с открытыми весами и таймкодами для видео

Фото: mistral.ai

Mistral выпустила Voxtral Transcribe 2 — линейку моделей для перевода аудио в текст, которая пригодится командам постпродакшена, разработчикам голосовых интерфейсов и создателям подкастов. В семейство входят пакетный обработчик файлов Voxtral Mini Transcribe V2 и потоковая модель Voxtral Realtime. Последняя распространяется с открытыми весами по лицензии Apache 2.0, весит 4 миллиарда параметров и запускается локально на пользовательских устройствах без передачи данных наружу.

Что умеет

  • Потоковая расшифровка. Архитектура Voxtral Realtime транскрибирует звук по мере поступления с настраиваемой задержкой вплоть до суб-200 миллисекунд.
  • Разметка спикеров. Функция диаризации автоматически определяет, кто именно говорит, и фиксирует границы реплик в интервью или митингах.
  • Пословные таймкоды. Модель проставляет временные метки к каждому отдельному слову, упрощая генерацию субтитров и точный монтаж звука.
  • Подсказки по контексту. В систему можно загрузить список до 100 терминов или имён собственных, чтобы алгоритм не ошибался в редких фамилиях и профессиональном сленге.
  • Поддержка 13 языков. Линейка распознаёт русский, английский, испанский, французский, немецкий, итальянский, португальский, китайский, японский, корейский, арабский, хинди и нидерландский.
  • Длинные дорожки и сложный фон. Пакетный обработчик принимает файлы длительностью до 3 часов за раз и справляется с шумными записями.

Цены и доступ

Проверить работу алгоритмов можно через аудио-песочницу в Mistral Studio или в Le Chat, куда загружаются файлы до 1 ГБ в форматах MP3, WAV, M4A, FLAC и OGG. Через API доступ к пакетной модели Voxtral Mini Transcribe V2 стоит $0,003 за минуту аудио, а потоковая версия Voxtral Realtime обойдётся в $0,006 за минуту. Веса Realtime доступны для бесплатного скачивания на Hugging Face.

Для видеомонтажёров и саунд-дизайнеров это готовый способ нарезать черновые субтитры и синхронизировать дорожки без ручной возни со стенограммами.

Сайт Voxtral Transcribe 2
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд