Открытые нейросети для видео активно пытаются уместить в потребительское железо. Модель MiniMax H3 позиционируется как универсальный комбайн: она генерирует видеоряд, понимает текст, визуальные данные и даже синтезирует стереозвук. Звучит амбициозно, особенно с заявкой на разрешение до 2K и длину роликов до 15 секунд. Посмотрим, какую цену придется заплатить за запуск этого мультимодального конвейера вне облака.
В свежем репозитории появились GGUF-квантизации двух базовых моделей. Версия FL2VA работает с генерацией из текста или крайних кадров, а Ref2VA поддерживает сборную солянку из референсов — до девяти визуальных файлов, трех видеороликов и аудио. Самая жесткая урезка Q3_K весит 15.6 ГБ, а версии Q5 уходят за 23 ГБ. Но основной трансформер — это только часть уравнения. Системе требуется тяжелый текстовый энкодер на базе Qwen3-VL-32B и отдельные VAE-модули.
Правда, авторам удалось немного снизить порог входа. Теперь вместо неподъемного NVFP4-энкодера на 27.1 ГБ можно использовать GGUF-версию Q4_K_M весом 14.6 ГБ. То есть минимальный рабочий комплект обойдется примерно в 32-35 гигабайт памяти. Вопрос в том, насколько агрессивная квантизация до трех-четырех бит разрушит способность модели адекватно связывать сложные референсы. Выдавать заявленные 24 кадра в секунду с частотой звука 32 кГц система будет, но стабильность мелких деталей в динамике при таком сжатии обычно страдает в первую очередь.
Поделиться:
Курс по AI-видео для геймдева: полный пайплайн от сценария до генерации в Kling и Magnific
Концепция Guardian Angels: персонализированные LLM с непрерывным обучением для защиты и продуктивности