Новость

Qwen-Image-2.1 генерирует и правит визуал за 6 шагов с новым дистиллятом Viggle

Видео: Hugging Face

Сорок шагов инференса посреди правок арт-директора превращают рабочий вечер в бесконечное ожидание прогресс-бара. Команда Viggle решила срезать этот путь: свежий релиз турбо-дистиллята Qwen-Image-2.1-viggle-turbo версии v0.2.1 укладывает генерацию и сложное редактирование ровно в 6 шагов трансформера вместо сорока исходных. Скорость пайплайна выросла примерно в 5 раз при картинке, которую в большинстве сценариев сложно отличить от полновесного оригинала.

В основе апдейта лежит дистилляция соответствия распределений (Distribution Matching Distillation). Обученная студент-модель цепляется поверх базовой архитектуры Qwen/Qwen-Image-2.1 и справляется как с прямой генерацией по текстовому описанию, так и с инструктивным редактированием по 1–3 референсным изображениям. Рабочий процесс избавлен от классификаторно-свободного наведения — модель обходится честным значением true_cfg_scale=1.0. На официальных тестах визуальный результат практически совпадает с базовым, хотя один компромисс все-таки остался: на мелком и очень плотном шрифтовом наборе сорокашаговая база все еще держит первенство.

Что под капотом и в файлах

Текущая версия v0.2.1 представляет собой чекпоинт на 700-м шаге обучения — шаг вперед по сравнению с промежуточной версией v0.2, зафиксированной на 600-м. Разработчики не стали прятать кухню и выкатили сразу несколько вариантов адаптеров под разные задачи и мощности:

  • Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r256.safetensors — полновесный LoRA-адаптер (ранг 256, alpha 256, формат bf16, вес 1.3 ГБ). Он монтируется поверх базового трансформера прямо в момент выполнения и крутится в публичном демо.
  • Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r128.safetensors — облегченный вариант ранга 128 (alpha 128, вес 680 МБ). Его усекли с помощью послойного сингулярного разложения (SVD по методу Эккарта–Янга) специально для бережного расхода видеопамяти в локальных сценариях ComfyUI.
  • Директория peft_v0.2.1/ — тот же адаптер, пересобранный под ключи библиотеки PEFT в точности F32.
  • Предыдущие итерации (включая v0.1, v0.2 и полный рендер-дистиллят трансформера) оставлены в репозитории ради воспроизводимости экспериментов.

Главная проблема быстрых дистиллятов — деградация композиции и превращение генератора в штамповщик однотипных планов. В версии v0.2.1 с этим разобрались основательно. Нас подкупило, что вариативность генераций почти вернулась к уровню «тяжелого» оригинала, а паразитный дрейф центроида кадра свели к абсолютному нулю.

Замеры качества на тестовом наборе из 96 запросов

Конфигурация моделиСэмпл-разнообразие (доля от базы)Дрейф композиции (от базы)Доля промптов с чужой компоновкой
v0.1 LoRA r640.75−0.019—
v0.1 full fine-tune0.72−0.033—
v0.2.1 LoRA r256 (6 шагов)0.98+0.0000%
v0.2 LoRA r256 (6 шагов)0.97−0.0010%
v0.2 (на 5 шагах)0.93+0.0004%
v0.2 (на 4 шагах)0.89+0.002—

Разнообразие в этой таблице рассчитывалось как среднее расстояние DINOv2 внутри одного промпта по 8 случайным сидам (выборка из 32 запросов). Дрейф композиции отражает горизонтальное смещение смыслового центра тяжести кадра относительно базовой модели, измеренное в долях ширины холста. Третья колонка отсекает критические смещения центроида больше чем на 0.05 ширины — в релизе v0.2.1 композиция сидит намертво.

Нюансы сборки под ComfyUI

Чтобы запустить инструмент локально, Viggle упаковали кастомные ноды в модуль viggle_turbo.py и приложили готовые шаблоны связок — t2i.json для прямой генерации и edit.json для правок по референсам. Для точного совпадения математики с диффузором авторы рекомендуют задействовать фирменный планировщик «Viggle Turbo Sigmas».

Второй технический нюанс — загрузка адаптера. Разработчики советуют использовать несливаемый (unmerged) загрузчик LoRA. Если попытаться жестко запечь веса в трансформер перед квантованием, точность неизбежно просядет, а 6-шаговый пайплайн критически чувствителен к мелким погрешностям весов.

Чуда на всех фронтах не произошло: физику не обманешь, поэтому у дистиллята есть четкие границы применимости. Если задача упирается в ювелирную замену лиц, строгую консистентность персонажа, одновременную сборку сцены из нескольких референсов или длинную цепочку взаимоисключающих инструкций, сорокашаговая оригинальная модель справится чище. Пожалуй, турбо-режим пока не про финализацию сложнейшего вижуала с десятком условий в брифе.

Зато в ежедневной рутине концепт-арта и быстрых итераций это меняет всё. Шесть шагов дают интерактивный отклик: арт-директор может на лету перебирать ракурсы, освещение и стилистику по референсам, не выпадая из потока мыслей. Рабочий пайплайн сжимается до масштаба реального времени.

Ещё новости

Все новости →