Прозрачный слой по щелчку: Qwen-Image 2.1 добралась до ComfyUI

Вместо привычной возни с вырезанием фона и чисткой рваных краев модель просто отдает готовый прозрачный файл. Команда Qwen выкатила открытую генеративную модель Qwen-Image 2.1 на семь миллиардов параметров, которая умеет сразу собирать честный RGBA по тексту. Архитектура на 32 слоях DiT берет планку разрешений до 2752 пикселей по широкой стороне, а разработчики обещают аккуратный рендеринг типографики, читаемый свет на портретах и честную работу со сложной текстурой.
В режиме редактирования нейросеть вытаскивает объекты из готовых снимков, держит в памяти идентичность людей и переваривает до десяти референсов за раз. Причем править изображение можно буквально грубыми пометками от руки — обвели нужную деталь цветным маркером или маской, и модель меняет только указанный фрагмент. Ребята из Comfy-Org отреагировали мгновенно: они уже упаковали веса в удобные safetensors (есть как полная bf16, так и облегченная int8 под скромное железо) и выложили готовые шаблоны связок для генерации и правок на Hugging Face и GitHub.
Нас в редакции подкупает именно появление прозрачности на уровне самой диффузии — моушн-дизайнерам и верстальщикам это экономит десятки рутинных минут. Когда чистый изолированный ассет падает на таймлайн прямо из нодового графа, возвращаться к ручной обтравке не хочется совсем.