Voxtral TTS
Компактная модель озвучки на девяти языках с клонированием голоса от трех секунд

Команда Mistral AI собрала собственную модель синтеза речи на четыре миллиарда параметров. Архитектура объединяет декодер Ministral 3B, акустический flow-matching трансформер и кастомный нейрокодек. Разработчики целились в естественность звучания диалогов: модель улавливает контекст вроде иронии или радости, воспроизводит речевые паузы, характерные вздохи и живой ритм собеседника без эффекта механического зачитывания по слогам.
Что умеет
- Озвучивать текст на девяти языках. Поддерживаются английский, французский, немецкий, испанский, нидерландский, португальский, итальянский, хинди и арабский с региональными диалектами.
- Клонировать голос по короткому сэмплу. Для подражания тембру, акценту и манере речи достаточно аудиофрагмента длиной от трех секунд.
- Переносить акцент между языками. Модель умеет озвучивать текст на одном языке с акцентом голоса-образца из другого языка — например, выдать английскую речь с естественным французским прононсом.
- Работать в реальном времени. Задержка до первого звука составляет 70 миллисекунд для блока в 500 знаков, а нативная длина бесшовной генерации достигает двух минут.
Цены и доступ
Сервис доступен разработчикам через API по тарифу $0,016 за 1000 символов. Опробовать генерацию с готовыми или загруженными голосами можно в веб-интерфейсах Mistral Studio и чат-ассистенте Le Chat. Веса модели с набором эталонных голосов выложены на Hugging Face под некоммерческой лицензией CC BY-NC 4.0.
Инструмент пригодится саунд-дизайнерам, продюсерам интерактивных проектов и авторам видеоконтента, которым требуется быстро собирать правдоподобную многоязычную озвучку или локализовать персонажей без многочасовых студийных сессий. Три секунды записи диктора — и голос начинает жить на девяти языках.


