Qwen-VLo
Единая модель для генерации, редактирования и структурного анализа картинок по текстовым командам
Загружаешь снимок машины, просишь перекрасить кузов — сетка меняет цвет, сохраняя точные очертания модели и заводские детали. Qwen VLo объединяет визуальное распознавание и генерацию в одну систему: модель не просто видит сцену, но и перерисовывает её с опорой на увиденное. Инструмент ориентирован на арт-директоров, моушн-дизайнеров и визуализаторов, которым требуются осмысленные точечные правки без сбора громоздких пайплайнов.
Что умеет
- Создавать изображения с нуля по тексту, включая двуязычные постеры на английском и китайском языках.
- Строить изображение прогрессивно: картинка формируется слева направо и сверху вниз, что помогает аккуратнее выводить надписи на рекламе или в комиксах.
- Редактировать загруженные кадры по свободным текстовым запросам — менять фон, добавлять предметы вроде шляпы на кота или стилизовать фото под живопись XIX века.
- Принимать комплексные команды за один проход: одновременно заменять объекты, переписывать текст и трансформировать задний план.
- Работать с произвольным разрешением и экстремальными пропорциями холста, вплоть до соотношений 4:1 и 1:3.
- Решать прикладные задачи анализа: строить карты глубины, сегментировать слои, выделять края и детектировать границы предметов.
- Распознавать содержимое собственных генераций — например, называть точные породы нарисованных собак и кошек.
Цены и доступ
Модель представлена в формате раннего превью и доступна через Qwen Chat. Разработчики предупреждают о временных ограничениях тестовой сборки: генератор порой ошибается в деталях референса или не с первого раза считывает сложные команды.
Инструмент пригодится для быстрой сборки раскадровок, адаптации баннеров под сложные форматы и ретуши без кропотливого ручного маскирования. Нас подкупило, как точно алгоритм держит геометрию оригинала при глубокой смене стиля — правки перестают напоминать случайную лотерею.


