Qwen-Image-2.1 генерирует и правит визуал за 6 шагов с новым дистиллятом Viggle
Сорок шагов инференса посреди правок арт-директора превращают рабочий вечер в бесконечное ожидание прогресс-бара. Команда Viggle решила срезать этот путь: свежий релиз турбо-дистиллята Qwen-Image-2.1-viggle-turbo версии v0.2.1 укладывает генерацию и сложное редактирование ровно в 6 шагов трансформера вместо сорока исходных. Скорость пайплайна выросла примерно в 5 раз при картинке, которую в большинстве сценариев сложно отличить от полновесного оригинала.
В основе апдейта лежит дистилляция соответствия распределений (Distribution Matching Distillation). Обученная студент-модель цепляется поверх базовой архитектуры Qwen/Qwen-Image-2.1 и справляется как с прямой генерацией по текстовому описанию, так и с инструктивным редактированием по 1–3 референсным изображениям. Рабочий процесс избавлен от классификаторно-свободного наведения — модель обходится честным значением true_cfg_scale=1.0. На официальных тестах визуальный результат практически совпадает с базовым, хотя один компромисс все-таки остался: на мелком и очень плотном шрифтовом наборе сорокашаговая база все еще держит первенство.
Что под капотом и в файлах
Текущая версия v0.2.1 представляет собой чекпоинт на 700-м шаге обучения — шаг вперед по сравнению с промежуточной версией v0.2, зафиксированной на 600-м. Разработчики не стали прятать кухню и выкатили сразу несколько вариантов адаптеров под разные задачи и мощности:
Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r256.safetensors— полновесный LoRA-адаптер (ранг 256, alpha 256, формат bf16, вес 1.3 ГБ). Он монтируется поверх базового трансформера прямо в момент выполнения и крутится в публичном демо.Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r128.safetensors— облегченный вариант ранга 128 (alpha 128, вес 680 МБ). Его усекли с помощью послойного сингулярного разложения (SVD по методу Эккарта–Янга) специально для бережного расхода видеопамяти в локальных сценариях ComfyUI.- Директория
peft_v0.2.1/— тот же адаптер, пересобранный под ключи библиотеки PEFT в точности F32. - Предыдущие итерации (включая v0.1, v0.2 и полный рендер-дистиллят трансформера) оставлены в репозитории ради воспроизводимости экспериментов.
Главная проблема быстрых дистиллятов — деградация композиции и превращение генератора в штамповщик однотипных планов. В версии v0.2.1 с этим разобрались основательно. Нас подкупило, что вариативность генераций почти вернулась к уровню «тяжелого» оригинала, а паразитный дрейф центроида кадра свели к абсолютному нулю.
Замеры качества на тестовом наборе из 96 запросов
| Конфигурация модели | Сэмпл-разнообразие (доля от базы) | Дрейф композиции (от базы) | Доля промптов с чужой компоновкой |
|---|---|---|---|
| v0.1 LoRA r64 | 0.75 | −0.019 | — |
| v0.1 full fine-tune | 0.72 | −0.033 | — |
| v0.2.1 LoRA r256 (6 шагов) | 0.98 | +0.000 | 0% |
| v0.2 LoRA r256 (6 шагов) | 0.97 | −0.001 | 0% |
| v0.2 (на 5 шагах) | 0.93 | +0.000 | 4% |
| v0.2 (на 4 шагах) | 0.89 | +0.002 | — |
Разнообразие в этой таблице рассчитывалось как среднее расстояние DINOv2 внутри одного промпта по 8 случайным сидам (выборка из 32 запросов). Дрейф композиции отражает горизонтальное смещение смыслового центра тяжести кадра относительно базовой модели, измеренное в долях ширины холста. Третья колонка отсекает критические смещения центроида больше чем на 0.05 ширины — в релизе v0.2.1 композиция сидит намертво.
Нюансы сборки под ComfyUI
Чтобы запустить инструмент локально, Viggle упаковали кастомные ноды в модуль viggle_turbo.py и приложили готовые шаблоны связок — t2i.json для прямой генерации и edit.json для правок по референсам. Для точного совпадения математики с диффузором авторы рекомендуют задействовать фирменный планировщик «Viggle Turbo Sigmas».
Второй технический нюанс — загрузка адаптера. Разработчики советуют использовать несливаемый (unmerged) загрузчик LoRA. Если попытаться жестко запечь веса в трансформер перед квантованием, точность неизбежно просядет, а 6-шаговый пайплайн критически чувствителен к мелким погрешностям весов.
Чуда на всех фронтах не произошло: физику не обманешь, поэтому у дистиллята есть четкие границы применимости. Если задача упирается в ювелирную замену лиц, строгую консистентность персонажа, одновременную сборку сцены из нескольких референсов или длинную цепочку взаимоисключающих инструкций, сорокашаговая оригинальная модель справится чище. Пожалуй, турбо-режим пока не про финализацию сложнейшего вижуала с десятком условий в брифе.
Зато в ежедневной рутине концепт-арта и быстрых итераций это меняет всё. Шесть шагов дают интерактивный отклик: арт-директор может на лету перебирать ракурсы, освещение и стилистику по референсам, не выпадая из потока мыслей. Рабочий пайплайн сжимается до масштаба реального времени.


