Sonic-3.6 & Ink-2
Связка генерации и распознавания речи для голосовых агентов с откликом до 90 миллисекунд.

Диалог с виртуальным собеседником часто спотыкается о технические паузы: пока одна модель слушает, а вторая собирается с мыслями, иллюзия живого общения рушится. Cartesia собрала распознавание и синтез речи в общий пайплайн на базе моделей пространства состояний (SSM). Дуэт моделей Sonic-3.6 и Ink-2 изначально спроектирован для голосовых ассистентов, которым критически важна мгновенная реакция.
Что умеет
- Генерировать речь быстрее 90 миллисекунд. Модель Sonic-3.6 выдает аудиопоток практически в реальном времени, избавляя от неловкого ожидания ответа.
- Транскрибировать звук с задержкой в 100 миллисекунд. Ink-2 мгновенно расшифровывает реплики и аппаратно отслеживает переключение говорящих в беседе.
- Подключаться через один интерфейс. Синтез и распознавание работают в рамках одного API, избавляя от необходимости сшивать решения от конкурирующих провайдеров.
- Удерживать длинный контекст. Архитектура SSM обеспечивает устойчивость на длинных дистанциях и высокую производительность без просадок в точности.
Для тех, кто проектирует интерактивные инсталляции, диалоговые интерфейсы или озвучивает игровых персонажей на лету, связка решает давнюю проблему нестыковки разных модулей. Пожалуй, инженерам удалось сократить временной лаг до той черты, где синтетический голос наконец звучит вовремя.


