Ant Group выкатила открытую дизайн-нейросеть Ming-Image с нативным альфа-каналом

Знакомая рутина любого дизайнера при работе с генерациями — мучительная обтравка. Нейросети упорно выдают сплющенные растровые полотна, где текст намертво впекается в фон, а декоративные плашки требуют лассо и долгой зачистки артефактов по краям. Компания Ant Group решила зайти на территорию визуального продакшена с неожиданной стороны. Разработчики представили Ming-Image-0.1-Design — открытую модель на 6 миллиардов параметров, заточенную под плакаты, типографику, инфографику и компоненты пользовательских интерфейсов.
Что умеет модель и как устроена архитектура
Вместо попыток соревноваться с тяжелыми фотореалистичными генераторами команда сфокусировалась на прикладных графических задачах. Модель отдает картинку с нативной поддержкой прозрачности в RGBA — без зеленого фона, без костылей и без масок сторонних утилит.
Технические параметры рендера:
- Нативное разрешение на выходе — до 2K.
- Полноценный альфа-канал RGBA с честной прозрачностью.
- Высокая скорость синтеза: модели требуется всего 12 шагов семплирования.
- Открытые веса по свободной лицензии MIT, опубликованные на Hugging Face в репозитории inclusionAI/Ming-Image-0.1-Design и на GitHub под именем inclusionAI/Ming-Image.

Вторая часть релиза решает еще более практическую задачу. Вместе с базовой нейросетью вышла вспомогательная модель Ming-Image-0.1-Design-Layer. Она берет готовый плоский макет или постер и автоматически разбирает его на независимые RGBA-слои. Текст, подложки, кнопки и графические акценты оказываются на отдельных прозрачных плоскостях — то есть макет можно спокойно дорабатывать в привычном редакторе, а не пересобирать с нуля.

Аппетиты по железу и способы запуска
Развернуть такую систему локально сможет далеко не каждая студия. Полновесный чекпоинт весит около 53 ГБ. Официальная конфигурация, протестированная и подтвержденная инженерами Ant Group, требует видеокарту CUDA с 80 ГБ видеопамяти VRAM при работе в формате BF16. Домашние видеокарты пока остаются за бортом, если только сообщество не выпустит агрессивные квантования.
Впрочем, протестировать пайплайн можно сразу несколькими обходными путями:
- Браузерное демо развернуто на площадке Hugging Face Space под названием hugging-apps/ming-image-0-1-design-demo.
- Доступ по API открыт через каталог OpenRouter с провайдером NovitaAI (идентификатор inclusionai/ming-image-0.1-design). Медианная скорость генерации там держится на отметке около 37 секунд.
- Энтузиасты уже готовят перенос инструмента в привычный софт: разработчик Kijai собрал кастомные ноды в репозитории Kijai/Ming-Image-ComfyUI и отправил пулреквест PR #16482 в основной репозиторий ComfyUI.
Нас подкупило, что авторы наконец-то посмотрели на пайплайн глазами арт-директора, а не только исследователя данных. Когда генератор умеет складывать UI-сетку, выдавать читаемый шрифт и раскладывать графику по слоям за 12 шагов, исчезает пропасть между быстрым концептом и реальным макетом в работе.
Теперь дело за малым: дождаться, пока сторонние оптимизаторы упакуют эти 53 гигабайта в формат, который поместится в локальную рабочую станцию.



