На платформе Hugging Face опубликована адаптированная версия весов MiniMax-H3 Turbo LoRA, предназначенная для работы в среде ComfyUI. Исходный проект, разработанный автором под псевдонимом larryvrh, представляет собой метод дистилляции, который сокращает процесс совместной генерации видео и синхронизированного стереозвука со стандартных двадцати до четырех шагов, что обеспечивает пятикратное сокращение времени рендеринга.
Оригинальные веса Turbo LoRA требовали изменения ключей тензоров, поскольку встроенный загрузчик ComfyUI использует собственное пространство имен. В представленной конверсии ключи вида blocks.* были преобразованы в diffusion_model.blocks.*, при этом сохранились исходные значения тензоров, формат BF16 и архитектурная совместимость с усеченным чекпоинтом MiniMax-H3. Из адаптера удалены 102 тензора проекции AdaLN, несовместимые с усеченной моделью, однако полностью сохранены адаптеры внимания и многослойных перцептронов основного блока, а также модули уточнения токенов.
Репозиторий включает несколько версий файлов, в том числе базовые превью-варианты и дополнительно обученные чекпоинты на 500 шагов, разделенные на EMA и non-EMA версии. Варианты без экспоненциального скользящего среднего (non-EMA) сохраняют более высокую детализацию и лучше обрабатывают быстрые движения, в то время как EMA-версии формируют более сглаженный результат за счет усреднения весов во времени. Конверсия тестировалась с дополнительными методами акселерации внимания, такими как SageAttention и Sol Attention, что позволяет варьировать стратегии оптимизации памяти при работе с тяжелыми графами генерации.
Поделиться:
Генерация видео из таблиц и PDF: Alibaba открыла публичный доступ к модели Wan 3.0
Обновление шрифтовой системы Futura PT: моноширинные начертания и расширенная кириллица