Muse Voice Transcribe
Потоковое распознавание речи с разметкой более 20 спикеров и поддержкой смены языков на лету

Восемь человек спорят в одной комнате, перебивают друг друга, сыплют терминами и перескакивают с китайского на английский прямо посреди фразы — обычная запись брейншторма, превращающаяся в кошмар для расшифровки. Модель Muse Voice Transcribe из семейства Muse Spark создана Meta Superintelligence Labs как раз для таких живых разговоров. Авторегрессионная мультимодальная система обрабатывает звук на лету порциями по 80 миллисекунд и разбирает, кто именно произнес конкретную реплику.
Что умеет
- Потоковое распознавание и адаптивная задержка. Модель превращает каждый звуковой фрагмент в мягкий токен и с помощью обучения с подкреплением сама решает, сколько миллисекунд подождать ради контекста, балансируя между скоростью отклика и точностью расшифровки.
- Разделение голосов. Система прямо в потоке различает свыше 20 говорящих без постобработки, расставляя специальные метки смены собеседника.
- Фиксация границ речи. Определяет момент начала и конца высказывания, отсекая паузы между фразами.
- Поддержка смеси языков. Обучена более чем на 70 языках (25 из них детально проверены) и считывает переключение между речами внутри одного предложения.
- Контекстная настройка. Повышает точность разбора специфических названий, локаций и терминов с помощью подсказок по ключевым словам.
- Длинные дорожки. Без пауз принимает непрерывные аудиозаписи продолжительностью более одного часа.
Модель пригодится продакшенам и креативным командам на многочасовых созвонах, записях фокус-групп и летучках с иностранными коллегами, где люди говорят одновременно и на смеси диалектов.


