РазноеMeta Superintelligence Labs

Muse Voice Transcribe

Потоковое распознавание речи с разметкой более 20 спикеров и поддержкой смены языков на лету

Фото: research.meta.ai

Восемь человек спорят в одной комнате, перебивают друг друга, сыплют терминами и перескакивают с китайского на английский прямо посреди фразы — обычная запись брейншторма, превращающаяся в кошмар для расшифровки. Модель Muse Voice Transcribe из семейства Muse Spark создана Meta Superintelligence Labs как раз для таких живых разговоров. Авторегрессионная мультимодальная система обрабатывает звук на лету порциями по 80 миллисекунд и разбирает, кто именно произнес конкретную реплику.

Что умеет

  • Потоковое распознавание и адаптивная задержка. Модель превращает каждый звуковой фрагмент в мягкий токен и с помощью обучения с подкреплением сама решает, сколько миллисекунд подождать ради контекста, балансируя между скоростью отклика и точностью расшифровки.
  • Разделение голосов. Система прямо в потоке различает свыше 20 говорящих без постобработки, расставляя специальные метки смены собеседника.
  • Фиксация границ речи. Определяет момент начала и конца высказывания, отсекая паузы между фразами.
  • Поддержка смеси языков. Обучена более чем на 70 языках (25 из них детально проверены) и считывает переключение между речами внутри одного предложения.
  • Контекстная настройка. Повышает точность разбора специфических названий, локаций и терминов с помощью подсказок по ключевым словам.
  • Длинные дорожки. Без пауз принимает непрерывные аудиозаписи продолжительностью более одного часа.

Модель пригодится продакшенам и креативным командам на многочасовых созвонах, записях фокус-групп и летучках с иностранными коллегами, где люди говорят одновременно и на смеси диалектов.

Сайт Muse Voice Transcribe
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд