VibeVoice
Синтез длинных диалогов и подкастов до четырёх голосов длительностью до полутора часов
Собрать длинный разговорный подкаст или озвучить сцену на несколько персонажей одной нейросетью — задача, где привычный синтез речи быстро спотыкается о темп и смену интонаций. Исследовательский фреймворк VibeVoice от Microsoft спроектирован специально для озвучивания сложных диалогов из текста, удерживая связность и узнаваемость каждого тембра на длинной дистанции.
Архитектура опирается на связку языковой модели и диффузии: первая следит за логикой текста и чередованием реплик, а диффузионная часть прорисовывает акустические детали. Чтобы обрабатывать часовые дорожки без колоссальных вычислительных затрат, авторы применили акустические и семантические токенизаторы на сверхнизкой частоте 7,5 Гц.
Что умеет
- Синтезировать аудио длительностью до 90 минут без деградации звучания.
- Вести диалог сразу четырьмя различными голосами, выдерживая естественные паузы и переходы между репликами.
- Учитывать контекст повествования для эмоциональной выразительности речи.
- Сводить дорожки подкастов с фоновой музыкой прямо в процессе генерации.
- Работать с многоязычными сценариями диалогов.
Доступ и статус
Модель создавалась как открытый исследовательский проект. В сентябре 2025 года разработчики временно закрыли репозиторий после случаев использования инструмента не по прямому назначению — до тех пор, пока не будут внедрены ограничения безопасности.
Для авторов аудиоспектаклей, подкастеров и моушн-студий это наглядный маркер: синтез речи уходит от коротких одиночных фраз к бесшовной режиссуре групповых сцен.
