Qwen3-TTS
Синтез речи по текстовому описанию, клонирование за три секунды и поддержка 10 языков
Собрать дикторскую дорожку для черновой сборки ролика или озвучить раскадровку на десятке языков — задача, на которую в продакшене уходят часы поиска референсов. Семейство Qwen3-TTS переносит этот процесс в локальный код или скрипт: это речевые модели на 0.6B и 1.7B параметров, способные генерировать звук с задержкой от 97 миллисекунд и на лету подстраивать эмоции под текстовые указания.
Что умеет
- Синтез голоса по описанию: версия 1.7B-VoiceDesign собирает новый тембр по обычному текстовому описанию персонажа.
- Быстрое клонирование: базовые модели 0.6B-Base и 1.7B-Base копируют голос с входящей аудиозаписи длиной от трёх секунд.
- Библиотека готовых тембров: модели CustomVoice содержат девять проработанных голосов разного возраста, пола и диалектов.
- Управление интонацией: версия 1.7B-CustomVoice меняет тон, подачу и эмоции через текстовые инструкции — например, можно потребовать злость или радость.
- Десять языков: система поддерживает русский, английский, китайский, японский, корейский, немецкий, французский, португальский, испанский и итальянский.
- Потоковая генерация: архитектура Dual-Track отдаёт первый аудиопакет сразу после ввода первого символа со сквозной задержкой до 97 мс.
Цены и доступ
Веса моделей и токенизатор Qwen3-TTS-Tokenizer-12Hz открыты для загрузки на Hugging Face и ModelScope. Запустить генерацию локально можно через Python-библиотеку qwen-tts с ускорением FlashAttention 2, развернуть через vLLM или отправлять запросы в облачный DashScope API.
Набор выручит моушн-дизайнеров, саунд-продюсеров и видеомонтажёров, когда нужно оперативно озвучить черновой монтаж или собрать многоязычные вариации ролика без ожидания студийной записи. Собрать персонажа по короткому текстовому описанию и сразу услышать результат прямо в таймлайне — именно та скорость, к которой быстро привыкаешь.
