Cartesia Sonic-3.6
Сверхбыстрая генерация речи с задержкой до 90 мс, клонированием за 10 секунд и поддержкой 44 языков

Задержка меньше девяноста миллисекунд — это быстрее моргания, поэтому синтезированная речь встраивается в диалог без неловких зависаний. Cartesia спроектировала модель Sonic-3.6 вокруг скорости и естественных пауз: система считывает эмоциональный подтекст текста и подстраивает подачу самостоятельно, не превращая реплику в механический бубнеж.
Что умеет
- Синтезирует речь на 44 языках и диалектах — от американского английского и бразильского португальского до эмиратского арабского и хинди.
- Клонирует тембр по короткому аудиосэмплу длиной всего в десять секунд, сохраняя особенности звучания голоса.
- Встраивает невербальные реакции: в расшифровку можно вставить метку смеха прямо перед нужным словом.
- Переносит эмоции и характер спикера при локализации исходной дорожки на другой язык.
- Корректирует произношение редких терминов, фамилий и брендовых названий через пользовательские словари.
- Обеспечивает интеграцию через API со сквозным шифрованием и соблюдением протоколов HIPAA, SOC 2 Type 2, GDPR и PCI.
Цены и доступ
Модель разворачивается в облаке и доступна через интерфейс разработчика или API. Условия коммерческого внедрения и тарифы согласуются через команду продаж Cartesia.
Нас подкупило, как аккуратно модель обращается с полутонами и контекстом: возможность добавить естественный смешок решает вечную проблему бездушных закадровых голосов. Для продакшенов и студий, собирающих интерактивные инсталляции, диалоговых ассистентов или многоязычные презентации, это способ озвучить проект без многочасовых смен у студийного микрофона.


