Chatterbox Turbo
Быстрый опенсорсный синтез речи с клонированием голоса за 5 секунд и контролем эмоций

Пять секунд чистого звука — всё, что требуется этой легковесной модели на 350 миллионов параметров, чтобы повторить чужой голос. Resemble AI выпустили Chatterbox Turbo под свободной лицензией MIT. Нейросеть генерирует речь в шесть раз быстрее реального времени на видеокарте с задержкой около 75 миллисекунд, поэтому легко встраивается в стриминговые пайплайны и интерактивные медиапроекты.
Что умеет
- Клонирование голоса за пять секунд. Модель работает в режиме zero-shot: ей не нужно дообучение или тонкая настройка промптов, достаточно короткого аудиофрагмента на входе.
- Регулировка выразительности. Интенсивность подачи настраивается одним параметром — от нейтрального бубнежа до нарочито драматичной интонации.
- Текстовые теги реакций. В скрипт можно вписывать теги вроде
[sigh],[gasp],[cough],[laugh],[whisper]и[breath]. Модель воспроизведет смех, шепот или вздох тем же тембром, избавляя от склейки сэмплов вручную. - Защита психоакустическим знаком. В каждую секунду сгенерированного аудио встроен водяной знак PerTh. Человек его не слышит, но алгоритмы распознают метку для проверки подлинности контента.
- Скрипты конвертации. В репозиторий вшиты готовые инструменты для трансформации одного голоса в другой.
Цены и доступ
Модель бесплатна и лицензирована под MIT — код и веса разрешено использовать в коммерческих и закрытых разработках. Пакет устанавливается через терминал командой pip install chatterbox-tts, файлы лежат на GitHub и Hugging Face. Протестировать генерацию без локальной сборки можно прямо в веб-интерфейсе Resemble AI.
Инструмент пригодится моушн-дизайнерам, саунд-продюсерам и разработчикам интерактивных инсталляций, которым срочно нужны живые реплики персонажей. Когда синтетический голос умеет естественно вздыхать и усмехаться посреди фразы, черновая озвучка наконец-то перестает звучать как автоответчик.

