Открытая Qwen-Image-2.1 научилась собирать кадр сразу по десяти референсам

Знакомая боль арт-директора на этапе раскадровки: в мудборде лежит десяток картинок с нужным светом, позой и фактурой, но скормить их нейросети в один заход не выйдет. Приходится скрещивать промпты, нарезать коллажи и надеяться на удачу. Разработчики из команды Qwen решили зайти именно с этой стороны и выкатили Qwen-Image-2.1 — открытую визуальную модель, заточенную под плотную связку с визуальными исходниками.
Архитектура насчитывает 7 миллиардов параметров. Для открытого веса размер вполне подъемный: модель не выглядит неповоротливым гигантом, требующим промышленных мощностей. Ее прямое назначение — синтез графики с чистого листа и аккуратная ретушь того, что уже собрано в чистовик. Нас здесь подкупил практический фокус на управляемости, которой часто не хватает диффузионным решениям в коммерческом пайплайне.
Что внутри инструментария
Главный аргумент релиза — работа со сложными визуальными пакетами. Qwen-Image-2.1 способна принимать на вход до 10 референсных изображений одновременно. Для арт-отдела это означает прямой перенос референсов в рабочий холст без потерь на текстовом описании.
В системе заложены две центральные функции:
- Одновременная обработка до 10 входящих изображений для жесткого контроля стилистики, ракурса и композиционного строя будущей сцены.
- Встроенный механизм локального редактирования, позволяющий перерисовывать изолированные фрагменты графики и оставлять нетронутым остальное полотно.
Точечные правки — вторая вещь, из-за которой рендеры часто уходят в ручной фотошоп. Если нужно перекрасить пиджак или заменить предмет на столе, модель переписывает только указанную зону. Фон, свет на соседних объектах и общая геометрия не плывут, если верить демонстрационным тестам разработчиков.
В собственных синтетических бенчмарках авторы столкнули релиз с Nano Banana 2.0. По заявленным результатам тестовых сценариев, 7B-модель от Qwen уверенно обходит конкурента по совокупности возможностей генерации и точности правок. Преимущество кажется закономерным, учитывая упор на многослойное считывание контекста с референсов.
Выход модели вписан в большую череду обновлений генеративных инструментов от авторов Qwen. Впрочем, студийным инженерам пока придется подождать с интеграцией в продакшен-пайплайны. Точные условия распространения, тип открытой лицензии и прямые ссылки на веса в исходных публикациях создатели пока не раскрыли.
Когда исходники окажутся на руках, правила игры на препродакшене станут ощутимо приятнее. Контроль над генерацией наконец-то смещается от бесконечного подбора эпитетов в сторону нормального визуального брифа из картинок.
Хороший повод подготовить мудборды заранее.


