В ComfyUI появилась нативная поддержка MiniMax Music 3 — модели для локальной генерации аудио. Она создает треки длиной до пяти минут с вокалом и четкой структурой. За глобальную логику композиции отвечает LLM на 8B параметров. Акустические детали обрабатывает локальная модель на 0.6B. Синтез звука идет через архитектуру Flow Matching и Flow-VAE. На выходе получается стерео с частотой 32 кГц и глубиной 16 бит.
Официальный воркфлоу принимает два текстовых инпута. Поле Caption задает жанр, темп, тональность, характер вокала и инструменты. Во второе поле загружается текст песни со структурными тегами. Разметка вида [Intro], [Verse] или [Chorus] работает как прямая инструкция для смены частей трека. Для видеокарт с небольшим объемом памяти добавлена функция tiled_decode. Она декодирует аудио тайлами, снижая потребление VRAM при работе с длинными композициями.
Адаптированные веса лежат в репозитории Comfy-Org на Hugging Face. Сам шаблон доступен через раздел Template Library напрямую в интерфейсе ComfyUI. В нише открытых решений MiniMax сейчас обходит модель ACE, но пока уступает коммерческой Suno. Для упрощения работы авторы также выложили скрипт, который конвертирует короткие описания в правильный многоуровневый промпт.
Поделиться:
Смерть после отмены: как плагиатный скандал разрушил карьеру и жизнь профессора Кембриджа
Иллюзия пустого инбокса: почему концепция продуктивности изжила себя и при чем здесь 4000 недель жизни