Stability AI выпустила Stable-Layers для разбора плоских изображений на редактируемые RGBA-слои, но технически это не базовая модель компании. Под капотом работает адаптер LoRA поверх китайской Qwen/Qwen-Image-Layered на 20B параметров. Дополнительное обучение через метод Flow-GRPO позволило исправить главные проблемы оригинала: сетка перестала дублировать элементы, стала точнее разделять объекты и выдавать чистый альфа-канал.
Скрипт раскладывает исходник максимум на четыре слоя в порядке от заднего плана к переднему. Базовый layer_0 содержит фон, причем нейросеть автоматически инпейнтит области, которые были перекрыты объектами на оригинале. Остальные слои изолируют передний план. Запуск с флагом --transparent отдает файлы с реальной прозрачностью, которые сразу готовы для сборки в софте для композитинга.
За качество приходится платить высокими системными требованиями и нулевой гибкостью настроек. Веса в формате bf16 занимают около 40 ГБ, поэтому для локального запуска нужна карта уровня A100 или H100 на 80 ГБ. Параметры инференса зафиксированы жестко: использовать можно только сэмплер Heun на 50 шагах при CFG 1.0. Любые отклонения от этих значений или попытка поднять разрешение выше 640 пикселей ломают генерацию. Веса адаптера лежат на Hugging Face под лицензией Community.
Поделиться:
Первая задокументированная атака автономных ИИ-агентов на государственную инфраструктуру Тайваня
Релиз Grok 4.6 от xAI: сильные автономные агенты, уровень GPT-5.6 Sol и фокус на визуальных проектах