С прозрачным фоном и десятью референсами: команда Qwen выпустила открытую модель Image 2.1

Знакомая рутина любого дизайнера: сгенерировать объект в нейросети, открыть графический редактор и вручную вырезать рваные края или вычищать артефакты от белого фона. С выходом Qwen-Image-2.1 эту цепочку действий можно забыть. Разработчики из команды Qwen выложили в открытый доступ модель для генерации и точечного редактирования изображений, которая отдает графику сразу в формате RGBA — с чистым альфа-каналом прямо из коробки.
Релиз интересен не только прозрачностью. Под капотом находится архитектура Single-Stream DiT на 32 слоя с общим объемом в 7 миллиардов параметров для визуальной части. Модель компактная, но при этом держит нативное разрешение 2K и решает классическую проблему генеративных сеток — аккуратно собирает композиции из нескольких разных исходников без потери узнаваемости персонажей или предметов.

Что умеет модель и как устроена ее архитектура
В основе системы лежит связка из нескольких специализированных модулей, спроектированных для точной работы со сложными визуальными сценами:
- Трансформер генерации: 32-слойный Single-Stream DiT на 7 млрд параметров с блочно-каузальным вниманием. Текстовая часть использует токен-каузальную маску, а визуальные чанки обрабатываются двунаправленной маской.
- Текстовый энкодер: мультимодальная модель Qwen3-VL на 8 млрд параметров, которая переводит промпты и референсные кадры в единое скрытое пространство.
- Автоэнкодер (VAE): 64-канальный RGBA-энкодер с 16-кратным пространственным сжатием, отвечающий за корректную прорисовку прозрачности и мелких текстур.
- Планировщик: алгоритм Flow Matching с дискретным планированием Euler и динамическим смещением.
На практике такая связка дает несколько инструментов, закрывающих частые боли продакшена. Во-первых, модель поддерживает одновременную работу сразу с десятью референсными изображениями. Это позволяет собирать в одном кадре конкретного человека, фирменный флакон духов и реальный интерьер, сохраняя идентичность каждого элемента. Во-вторых, локальные правки больше не требуют сложных манипуляций: область под замену можно задавать простыми кругами, грубо закрашенными зонами или четкими масками. Кроме того, инженеры подтянули отрисовку типографики, естественное портретное освещение и детализацию микротекстур вроде ткани или кожи.

Нативные пропорции и рабочие разрешения
Qwen-Image-2.1 генерирует честные 2K без апскейлеров. Разработчики зафиксировали рекомендуемую сетку соотношений сторон под любые форматы верстки:
- Квадрат 1:1 — 2048 × 2048 пикселей;
- Универсальные форматы 4:3 (2400 × 1792) и 3:4 (1792 × 2400);
- Классические пропорции кадра 3:2 (2528 × 1696) и 2:3 (1696 × 2528);
- Широкий экран и вертикалки для соцсетей: 16:9 (2752 × 1536) и 9:16 (1536 × 2752).
Инфраструктура с первого дня и прокачка промптов
Главная беда многих открытых релизов — необходимость ждать неделями, пока энтузиасты напишут удобные плагины. Здесь интеграцию подготовили в день запуска. Модель уже встроена в библиотеку HuggingFace Diffusers через пайплайн QwenImage21Pipeline (пулл-реквест #14804), а для ComfyUI выложили готовые рабочие воркфлоу под генерацию и манипуляции с картинками. Для быстрого серверного продакшена есть поддержка через vLLM-Omni (с пошаговым инференсом, кэшированием KV, квантованием FP8 и CUDA Graph) и SGLang (пулл-реквест #39983 с поддержкой Cache-DiT). За снижение потребления видеопамяти и разгон отвечает фреймворк LightX2V.
Подумали и о тех, кто не любит писать длинные абзацы описаний. В комплекте идут две вспомогательные модели-переписчики на базе архитектуры Qwen3.5-VL 9B: Qwen/Qwen-Image-2.1-PE-T2I для разворачивания коротких запросов в плотные сцены и Qwen/Qwen-Image-2.1-PE-I2I для задач редактирования. Обе утилиты умеют работать пакетами через vLLM или запускаться локально стандартными скриптами.
Нас подкупило, что авторы выкатили не просто абстрактные веса для исследователей, а готовый конвейер под реальные студийные задачи. Когда нейросеть понимает десяток референсов и сама отдает чистый альфа-канал в двух тысячах пикселей по длинной стороне, процесс сборки сложных шотов и рекламных макетов перестает быть битвой с масками. Открытый код наконец-то начинает говорить на языке удобного композитинга.


