РазноеWispr Flow

Canto

Модель распознавания речи в реальном времени, рассчитанная на уличный шум и диктовку на ходу

Фото: wisprflow.ai

Диктовать мысли в микрофон ноутбука прямо на ходу, в забитом опенспейсе или под гул уличного трафика — задача, на которой спотыкается большинство транскрибаторов. Лаборатория Wispr Advanced Interfaces Lab разработала Canto — модель распознавания речи в реальном времени, созданную специально для таких неидеальных условий. Систему натренировали точно разбирать живую спонтанную речь, тихий шепот и отрывистые реплики без студийной изоляции.

Что умеет

  • Разбирать голос сквозь помехи. Модель рассчитана на работу в окружении чужих голосов, фоновой музыки, ветра и звуков транспорта при записи через простые гарнитуры или наушники.
  • Слышать тихий звук и шепот. Алгоритм оптимизирован для распознавания речи на низкой громкости и при удалении от микрофона, где стандартные модели часто теряют окончания.
  • Точно транскрибировать короткие фразы. Система удерживает смысл даже на отрезках в одно-два слова, когда у алгоритма практически нет языкового контекста для разрешения акустической неоднозначности.
  • Подключать персональные словари. Canto учитывает редкие термины и имена собственные, но обучена не подменять похожие звуки слепо, а опираться на реальную акустику аудиозаписи.
  • Учитывать правки пользователя. Для дообучения методом обучения с подкреплением (GRPO) архитектура отсеивает чисто редакторские изменения и переписывания, вычленяя только фактические ошибки распознавания.

Инструмент пригодится тем, кто привык наговаривать концепции, комментарии к макетам и быстрые заметки прямо во время перемещений между встречами или в шумных коворкингах. Canto избавляет от долгой ручной чистки текста и аккуратно ловит специализированные названия без лишних правок.

Сайт Canto
Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд

Разное

Eleven v4

Новая модель озвучки ElevenLabs, которая слышит паузы и эмоции сценария, а не просто читает текст