Canto
Модель распознавания речи в реальном времени, рассчитанная на уличный шум и диктовку на ходу
.jpg)
Диктовать мысли в микрофон ноутбука прямо на ходу, в забитом опенспейсе или под гул уличного трафика — задача, на которой спотыкается большинство транскрибаторов. Лаборатория Wispr Advanced Interfaces Lab разработала Canto — модель распознавания речи в реальном времени, созданную специально для таких неидеальных условий. Систему натренировали точно разбирать живую спонтанную речь, тихий шепот и отрывистые реплики без студийной изоляции.
Что умеет
- Разбирать голос сквозь помехи. Модель рассчитана на работу в окружении чужих голосов, фоновой музыки, ветра и звуков транспорта при записи через простые гарнитуры или наушники.
- Слышать тихий звук и шепот. Алгоритм оптимизирован для распознавания речи на низкой громкости и при удалении от микрофона, где стандартные модели часто теряют окончания.
- Точно транскрибировать короткие фразы. Система удерживает смысл даже на отрезках в одно-два слова, когда у алгоритма практически нет языкового контекста для разрешения акустической неоднозначности.
- Подключать персональные словари. Canto учитывает редкие термины и имена собственные, но обучена не подменять похожие звуки слепо, а опираться на реальную акустику аудиозаписи.
- Учитывать правки пользователя. Для дообучения методом обучения с подкреплением (GRPO) архитектура отсеивает чисто редакторские изменения и переписывания, вычленяя только фактические ошибки распознавания.
Инструмент пригодится тем, кто привык наговаривать концепции, комментарии к макетам и быстрые заметки прямо во время перемещений между встречами или в шумных коворкингах. Canto избавляет от долгой ручной чистки текста и аккуратно ловит специализированные названия без лишних правок.


