SeFi-Image: text-to-image модель на базе Semantic-First Diffusion с низкими затратами на обучение

Вышла новая text-to-image модель SeFi-Image. В основе лежит архитектура Semantic-First Diffusion. Процесс денойзинга разделен на два независимых потока. Сначала формируется семантическая структура и расположение объектов. Затем генерируются текстуры с небольшим временным сдвигом. Это дает генерации жесткую структурную привязку.
Доступны три версии: на 1B, 2B и 5B параметров. Главное преимущество архитектуры — резкое снижение вычислительных затрат. Разделение потоков заметно упрощает процесс обучения диффузии. Старшая модель на 5B обучена за 125 000 GPU-часов на ускорителях A800. Это около 10–20% от ресурсов, затраченных на обучение аналогичной Z-Image.
При меньших затратах качество генерации остается высоким. В тестах рендеринга длинного текста LongTextBench результат составил 0.978 балла. В генерации визуального текста CVTG-2K точность слов достигает 0.895. Модель отлично справляется со сложным позиционированием и двуязычной типографикой. По ключевым метрикам она уверенно конкурирует с Qwen-Image и FLUX.2.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад