MAI-Transcribe-2-Streaming
Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Текст появляется на экране быстрее, чем диктор успевает перевести дыхание. MAI-Transcribe-2-Streaming — модель потокового перевода речи в текст от Microsoft, заточенная под минимальную задержку и синхронный отклик. Вместо утомительного ожидания тишины в конце реплики система выдает первые черновые варианты уже через 100 миллисекунд после поступления звука. По мере поступления контекста движок на лету уточняет формулировки и сразу закрепляет стабильный результат, отображая слова в расшифровке вдвое быстрее прямых конкурентов.
Что умеет
- Расшифровывать поток на 60 языках. Модель поддерживает непрерывное автоматическое определение языка говорящего прямо во время монолога.
- Выдавать промежуточный текст за 100 мс. Сверхбыстрый черновой вывод позволяет диалоговым ботам запускать логику рассуждений и вызывать нужные программные инструменты еще до того, как собеседник договорит фразу.
- Сохранять максимальную точность. Решение занимает первую строчку в бенчмарках Artificial Analysis по точности черновых и финальных расшифровок, удерживая границу Парето в соотношении качества и скорости.
- Бесшовно связываться с голосовым синтезом. Разработана как прямая пара для речевых генераторов серии MAI-Voice, сокращая паузы при живом общении.
Цены и доступ
Ознакомительный тариф составляет 0,54 доллара за час аудиопотока до конца года. Модель доступна для работы через Microsoft Foundry, Vercel, Azure Voice Live и среду MAI Playground с готовым демонстрационным агентом Chatter. Также команда готовит интеграцию с платформой LiveKit.
Разработка пригодится создателям интерактивных медиа, сервисов поддержки и голосовых ассистентов, где лишние доли секунды разрушают иллюзию естественного диалога. В задачах моментальной диктовки или живого субтитрования прямых эфиров модель избавляет зрителей от запаздывания текста за звуковой дорожкой.


