РазноеплатноMicrosoft

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Фото: microsoft.ai

Текст появляется на экране быстрее, чем диктор успевает перевести дыхание. MAI-Transcribe-2-Streaming — модель потокового перевода речи в текст от Microsoft, заточенная под минимальную задержку и синхронный отклик. Вместо утомительного ожидания тишины в конце реплики система выдает первые черновые варианты уже через 100 миллисекунд после поступления звука. По мере поступления контекста движок на лету уточняет формулировки и сразу закрепляет стабильный результат, отображая слова в расшифровке вдвое быстрее прямых конкурентов.

Что умеет

  • Расшифровывать поток на 60 языках. Модель поддерживает непрерывное автоматическое определение языка говорящего прямо во время монолога.
  • Выдавать промежуточный текст за 100 мс. Сверхбыстрый черновой вывод позволяет диалоговым ботам запускать логику рассуждений и вызывать нужные программные инструменты еще до того, как собеседник договорит фразу.
  • Сохранять максимальную точность. Решение занимает первую строчку в бенчмарках Artificial Analysis по точности черновых и финальных расшифровок, удерживая границу Парето в соотношении качества и скорости.
  • Бесшовно связываться с голосовым синтезом. Разработана как прямая пара для речевых генераторов серии MAI-Voice, сокращая паузы при живом общении.

Цены и доступ

Ознакомительный тариф составляет 0,54 доллара за час аудиопотока до конца года. Модель доступна для работы через Microsoft Foundry, Vercel, Azure Voice Live и среду MAI Playground с готовым демонстрационным агентом Chatter. Также команда готовит интеграцию с платформой LiveKit.

Разработка пригодится создателям интерактивных медиа, сервисов поддержки и голосовых ассистентов, где лишние доли секунды разрушают иллюзию естественного диалога. В задачах моментальной диктовки или живого субтитрования прямых эфиров модель избавляет зрителей от запаздывания текста за звуковой дорожкой.

Сайт MAI-Transcribe-2-Streaming
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд

Разное

Eleven v4

Новая модель озвучки ElevenLabs, которая слышит паузы и эмоции сценария, а не просто читает текст