Состоялся релиз open-weight модели MiniMax Music 3 для генерации музыки, которая уже получила интеграцию в виде шаблона рабочих процессов для ComfyUI. Нейросеть способна локально создавать полноценные и продолжительные музыкальные композиции с вокалом, выступая альтернативой закрытым коммерческим сервисам.
В основе системы лежит гибридная архитектура, разделяющая вычислительные задачи между несколькими компонентами. За глобальную структуру и композицию трека отвечает языковая модель на 8B параметров, построенная на базе Qwen3-8B, в то время как меньшая нейросеть на 0.6B параметров обрабатывает локальные акустические детали. Процесс финального синтеза звука опирается на технологию Flow Matching, что в результате позволяет сохранять когерентность ритма и мелодии на длительных временных отрезках.
Анализ результатов генерации показывает, что по качеству итогового материала MiniMax Music 3 превосходит открытую модель ACE, при этом уступая проприетарным решениям уровня Suno. Доступность подобных весов для локального запуска означает постепенный перенос сложных инструментов аудиосинтеза из облачных платформ в контролируемые пользовательские пайплайны.
Поделиться:
Qwen 3.8 от Alibaba: анализ новых моделей на 27B и 2.4T параметров
Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090