Новость

С прозрачным фоном и десятью референсами: команда Qwen выпустила открытую модель Image 2.1

The image depicts a cartoon character, possibly a fox or similar creature, riding a red and white lion, a traditional Chinese symbol. The character is wearing a red hat with a gold trim and a red robe, and is holding a red lantern in one hand and a red and white striped stick in the other. The character has a friendly
Фото: Qwen

Знакомая рутина любого дизайнера: сгенерировать объект в нейросети, открыть графический редактор и вручную вырезать рваные края или вычищать артефакты от белого фона. С выходом Qwen-Image-2.1 эту цепочку действий можно забыть. Разработчики из команды Qwen выложили в открытый доступ модель для генерации и точечного редактирования изображений, которая отдает графику сразу в формате RGBA — с чистым альфа-каналом прямо из коробки.

Релиз интересен не только прозрачностью. Под капотом находится архитектура Single-Stream DiT на 32 слоя с общим объемом в 7 миллиардов параметров для визуальной части. Модель компактная, но при этом держит нативное разрешение 2K и решает классическую проблему генеративных сеток — аккуратно собирает композиции из нескольких разных исходников без потери узнаваемости персонажей или предметов.

The image is a collage of six photos featuring a young woman standing in front of a white building with graffiti on its door. She is wearing a pink puffer jacket, a white lace top, blue jeans, and silver shoes. She is also wearing a white panda-themed hat with black antlers. In the first photo, she is wearing a pink pu
Фото: Qwen

Что умеет модель и как устроена ее архитектура

В основе системы лежит связка из нескольких специализированных модулей, спроектированных для точной работы со сложными визуальными сценами:

  • Трансформер генерации: 32-слойный Single-Stream DiT на 7 млрд параметров с блочно-каузальным вниманием. Текстовая часть использует токен-каузальную маску, а визуальные чанки обрабатываются двунаправленной маской.
  • Текстовый энкодер: мультимодальная модель Qwen3-VL на 8 млрд параметров, которая переводит промпты и референсные кадры в единое скрытое пространство.
  • Автоэнкодер (VAE): 64-канальный RGBA-энкодер с 16-кратным пространственным сжатием, отвечающий за корректную прорисовку прозрачности и мелких текстур.
  • Планировщик: алгоритм Flow Matching с дискретным планированием Euler и динамическим смещением.

На практике такая связка дает несколько инструментов, закрывающих частые боли продакшена. Во-первых, модель поддерживает одновременную работу сразу с десятью референсными изображениями. Это позволяет собирать в одном кадре конкретного человека, фирменный флакон духов и реальный интерьер, сохраняя идентичность каждого элемента. Во-вторых, локальные правки больше не требуют сложных манипуляций: область под замену можно задавать простыми кругами, грубо закрашенными зонами или четкими масками. Кроме того, инженеры подтянули отрисовку типографики, естественное портретное освещение и детализацию микротекстур вроде ткани или кожи.

The image depicts a young woman with brown hair, her eyes closed, and a serene expression. She is adorned with a floral wreath composed of various flowers in shades of orange, white, and pink, interspersed with green leaves. The woman's face is centered in the image, and her neck and shoulders are visible. The backgrou
Фото: Qwen

Нативные пропорции и рабочие разрешения

Qwen-Image-2.1 генерирует честные 2K без апскейлеров. Разработчики зафиксировали рекомендуемую сетку соотношений сторон под любые форматы верстки:

  • Квадрат 1:1 — 2048 × 2048 пикселей;
  • Универсальные форматы 4:3 (2400 × 1792) и 3:4 (1792 × 2400);
  • Классические пропорции кадра 3:2 (2528 × 1696) и 2:3 (1696 × 2528);
  • Широкий экран и вертикалки для соцсетей: 16:9 (2752 × 1536) и 9:16 (1536 × 2752).

Инфраструктура с первого дня и прокачка промптов

Главная беда многих открытых релизов — необходимость ждать неделями, пока энтузиасты напишут удобные плагины. Здесь интеграцию подготовили в день запуска. Модель уже встроена в библиотеку HuggingFace Diffusers через пайплайн QwenImage21Pipeline (пулл-реквест #14804), а для ComfyUI выложили готовые рабочие воркфлоу под генерацию и манипуляции с картинками. Для быстрого серверного продакшена есть поддержка через vLLM-Omni (с пошаговым инференсом, кэшированием KV, квантованием FP8 и CUDA Graph) и SGLang (пулл-реквест #39983 с поддержкой Cache-DiT). За снижение потребления видеопамяти и разгон отвечает фреймворк LightX2V.

Видео: Qwen

Подумали и о тех, кто не любит писать длинные абзацы описаний. В комплекте идут две вспомогательные модели-переписчики на базе архитектуры Qwen3.5-VL 9B: Qwen/Qwen-Image-2.1-PE-T2I для разворачивания коротких запросов в плотные сцены и Qwen/Qwen-Image-2.1-PE-I2I для задач редактирования. Обе утилиты умеют работать пакетами через vLLM или запускаться локально стандартными скриптами.

Нас подкупило, что авторы выкатили не просто абстрактные веса для исследователей, а готовый конвейер под реальные студийные задачи. Когда нейросеть понимает десяток референсов и сама отдает чистый альфа-канал в двух тысячах пикселей по длинной стороне, процесс сборки сложных шотов и рекламных макетов перестает быть битвой с масками. Открытый код наконец-то начинает говорить на языке удобного композитинга.

Ещё новости

Все новости →