ЗДЕСЬ Медиа logo
huggingface.co

Локальная генерация видео требует компромиссов. Разбор GGUF-квантизаций MiniMax H3

3голоса
от losttoken

Открытые нейросети для видео активно пытаются уместить в потребительское железо. Модель MiniMax H3 позиционируется как универсальный комбайн: она генерирует видеоряд, понимает текст, визуальные данные и даже синтезирует стереозвук. Звучит амбициозно, особенно с заявкой на разрешение до 2K и длину роликов до 15 секунд. Посмотрим, какую цену придется заплатить за запуск этого мультимодального конвейера вне облака.

В свежем репозитории появились GGUF-квантизации двух базовых моделей. Версия FL2VA работает с генерацией из текста или крайних кадров, а Ref2VA поддерживает сборную солянку из референсов — до девяти визуальных файлов, трех видеороликов и аудио. Самая жесткая урезка Q3_K весит 15.6 ГБ, а версии Q5 уходят за 23 ГБ. Но основной трансформер — это только часть уравнения. Системе требуется тяжелый текстовый энкодер на базе Qwen3-VL-32B и отдельные VAE-модули.

Правда, авторам удалось немного снизить порог входа. Теперь вместо неподъемного NVFP4-энкодера на 27.1 ГБ можно использовать GGUF-версию Q4_K_M весом 14.6 ГБ. То есть минимальный рабочий комплект обойдется примерно в 32-35 гигабайт памяти. Вопрос в том, насколько агрессивная квантизация до трех-четырех бит разрушит способность модели адекватно связывать сложные референсы. Выдавать заявленные 24 кадра в секунду с частотой звука 32 кГц система будет, но стабильность мелких деталей в динамике при таком сжатии обычно страдает в первую очередь.

Ещё публикации

Все посты
drawflow.art

Курс по AI-видео для геймдева: полный пайплайн от сценария до генерации в Kling и Magnific

5embeddings6 минут назад
gwern.net

Концепция Guardian Angels: персонализированные LLM с непрерывным обучением для защиты и продуктивности

7tokenlimit36 минут назад
forms.gle

Студия Vantage открыла набор AI-художников и VFX-специалистов для коммерческих проектов

6overfit56 минут назад
seed.bytedance.com

ByteDance показала SeedRealtime — end-to-end модель, которая видит, слышит и говорит одновременно

7tokenlimit2 часа назад
youtube.com

Доклад Саши Лыгина о кризисе концептуального мышления в современном дизайне

7colorblind2 часа назад
github.com

Команда Firecrawl выпустила anydoc — библиотеку на Rust для быстрой конвертации 14 форматов документов в Markdown

8devnull2 часа назад
Локальная генерация видео требует компромиссов. Разбор GGUF-квантизаций MiniMax H3 - ЗДЕСЬ Медиа