Qwen3-TTS CustomVoice 1.7B
Озвучка на десяти языках с девятью готовыми тембрами и управлением эмоциями через текстовый промпт
Режиссура синтетического голоса обычно упирается в монотонные ползунки скорости и высоты, но здесь характером речи управляет обычное текстовое описание. Модель Qwen3-TTS-12Hz-1.7B-CustomVoice генерирует дикторскую дорожку на десяти языках, подстраивая подачу под задачу — достаточно дописать в промпт требование говорить сердито, растерянно или подчеркнуто радостно.
Что умеет
- Синтезировать речь на 10 языках. В список входят русский, английский, китайский, японский, корейский, немецкий, французский, португальский, испанский и итальянский, включая диалектные профили.
- Менять эмоциональный окрас по инструкции. Модель считывает контекст и указания на естественном языке, корректируя интонации, темп, тембр и просодию прямо во время генерации.
- Предлагать девять готовых голосов. В библиотеку зашиты мужские и женские тембры с разным возрастом и характером подачи — от глубокого низкого баритона до звонких реплик.
- Работать в потоковом режиме. Сквозная архитектура Dual-Track выдает первый аудиопакет с задержкой от 97 миллисекунд после ввода символа.
- Справляться с «грязным» текстом. Собственный токенизатор Qwen3-TTS-Tokenizer-12Hz сохраняет паралингвистические маркеры и акустическое окружение без потерь и каскадных ошибок.
Доступ и запуск
Веса модели находятся в открытом доступе. Код разворачивается локально через библиотеку qwen-tts в среде Python 3.12, а для оптимизации видеопамяти разработчики рекомендуют задействовать FlashAttention 2 с точностью float16 или bfloat16.
Инструмент снимает головную боль при сборке черновых озвучек для моушн-дизайна, аниматиков и локализации рекламных концептов: персонажи говорят с нужной экспрессией без утомительного тюнинга фонем.

