В видеомодели MiniMax H3 лица на общих планах часто превращаются в кашу. Проблема не в разрешении, а в соотношении размера головы к кадру. Артефакты остаются даже в 720p и выше. Для решения задачи появился набор кастомных нод ComfyUI-H3-FaceRefine. Инструмент работает по принципу FaceDetailer из Impact Pack, но адаптирован для видео.
Пайплайн покадрово отслеживает лицо через детекторы YOLOv8 и вырезает его. Вырезанный фрагмент масштабируется до размеров всего холста. Затем алгоритм перегенерирует крупный план через img2img инъекцию латентов. Для стабильного трекинга конкретного персонажа в толпе используется библиотека insightface. После генерации исправленный фрагмент вшивается обратно в исходный видеоряд с учетом временного шумоподавления.
Инструмент поддерживает работу с аудио для липсинка через MiniMaxH3NativeAudioLock. При загрузке весов в формате GGUF весь процесс укладывается в 12 ГБ видеопамяти. В репозитории лежат готовые шаблоны рабочих процессов. Доступны варианты с базовой прямоугольной маской и с точным выделением лица через модель SAM.
Поделиться:
Архитектура DeepSeek Harness и релиз V4 Pro: переход к динамическим агентным системам
DeepSeek Harness и V4 Pro: цена экстремальной модульности