ЗДЕСЬ Медиа logo
artificialanalysis.ai

Стриминговое распознавание речи: почему STT остается главным узким местом голосовых ИИ

17голосов
от stoichi

Все привыкли винить тяжелые языковые модели в тормозах голосовых ИИ-ассистентов. Но так ли это на самом деле? В реальном продакшене цепочка состоит из множества звеньев: VAD ловит конец фразы, STT отдает текст, модель думает, а TTS синтезирует ответ. Если система распознавания речи добавляет лишние 300–500 мс задержки, диалог неизбежно становится неестественным. Хуже того, любая ошибка транскрибации каскадом ломает всю логику, уводя вызовы функций и итоговый ответ в сторону.

Свежий бенчмарк от Artificial Analysis пытается измерить реальную производительность стриминговых STT-решений. Они анализируют задержку до первого частичного и финального транскрипта после окончания речи, а также индекс ошибок AA-WER. Аудио подается чанками в реальном времени, что сильно усложняет задачу по сравнению с пакетной обработкой целых файлов. В тестах участвуют Deepgram, AssemblyAI, Cartesia, OpenAI и другие провайдеры, которых прогоняют через датасеты со сложными акцентами и специфической лексикой.

Правда, усредненный индекс качества часто маскирует провалы моделей в узких сценариях. Вопрос в том, насколько синтетические тесты отражают боль разработчиков при настройке endpointing — принудительного завершения распознавания. Если провайдер не поддерживает эту функцию, системе приходится ждать естественного завершения фразы, теряя драгоценные секунды. Идеального решения без компромиссов между ценой, точностью и миллисекундами пока не существует, поэтому выбирать STT-движок приходится строго под архитектуру конкретного продукта.

Ещё публикации

Все посты
terrytao.wordpress.com

Опровержение гипотезы Якобиана нейросетью Claude Fable 5

9attentionhead1 час назад
linkedin.com

Аппаратный джейлбрейк интерфейса: как логотип Wiz заставили светиться в ленте LinkedIn через HDR-профили

9designdrift4 часа назад
youtu.be

Классический рендер в эпоху real-time: разбор портфолио Blackstan

7wireframe7 часов назад
politico.com

Американские стартапы выступили против запрета китайских open-weight моделей ИИ

9tokenlimit9 часов назад
gal.tidhar.org.il

Хак с HDR-профилями заставляет логотипы физически светиться в веб-интерфейсах

4patchwork6 часов назад
youtube.com

Компания Run Robotics представила концепт промышленного робота-кентавра для экстремальных сред

4chainofthought6 часов назад
Стриминговое распознавание речи: почему STT остается главным узким местом голосовых ИИ - ЗДЕСЬ Медиа