Исследователи из Stability AI представили фреймворк Stable-Layers, предназначенный для разделения плоских изображений на независимые RGBA-слои с автоматической дорисовкой перекрытых областей фона. В основе системы лежит модель Qwen-Image-Layered, которая была дообучена методами обучения с подкреплением, в частности через алгоритм Flow-GRPO, что позволило полностью отказаться от использования парных размеченных данных в процессе тренировки.
Для контроля качества декомпозиции вместо традиционной разметки используется обратная связь от визуально-языковой модели (VLM), выступающей в роли автоматического судьи. Поскольку изолированная оценка сгенерированных слоев обычно приводит к слишком узкому диапазону баллов и снижает эффективность алгоритма GRPO, разработчики внедрили двухэтапный конвейер, при котором первоначальный скоринг каждого семпла по пяти критериям дополняется калибровочным сравнением всех кандидатов одновременно.
В результате модель научилась изолировать отдельные семантические элементы с более чистыми альфа-масками, избегая характерного для базовой нейросети дублирования композиции в слоях переднего плана. Анализ ошибок реконструкции показывает снижение средних показателей искажений на всех этапах декомпозиции, что означает общее повышение точности извлечения объектов и уменьшение цветовых артефактов в полупрозрачных областях.
Поделиться:
Разбор изображений на RGBA-слои: что скрывается под капотом Stable-Layers от Stability AI
Архитектура AI-агентов от Anthropic: почему простые паттерны работают лучше сложных фреймворков