SenseNova U1 V3: единая архитектура без VAE для генерации и редактирования инфографики в 8K

Это действительно серьезный сдвиг в архитектуре мультимодальных сетей. Разработчики SenseNova-U1-8B-MoT-Infographic-V3 отказались от привычных костылей в виде отдельных визуальных энкодеров и VAE. Модель обрабатывает пиксели и текст как единую сущность в рамках архитектуры NEO-unify. Никаких адаптеров для перевода между модальностями — сеть изначально понимает и генерирует визуальный и текстовый контент в одном потоке!
На практике такой подход вылился в отличную работу со сложной версткой и мелкотекстовым рендерингом. Версия V3 заточена под создание и точечное редактирование инфографики. Можно менять локальные надписи, удалять или вставлять объекты, а также переписывать глобальный стиль, не ломая нетронутые области. При этом заявлена поддержка нативного разрешения до 8K и работа с экстремальными пропорциями — движок уверенно собирает ультраширокие и очень вытянутые холсты.
Проект полностью открыт, веса доступны для скачивания, а для видеокарт с небольшим объемом памяти энтузиасты уже собрали квантованные версии в формате GGUF. Единственный нюанс кроется в стилистике базовых примеров — в них часто проскакивает характерная желтоватая гамма, из-за чего результаты визуально перекликаются с дефолтными выдачами ChatGPT. Но архитектурная база и качество работы с текстом делают этот релиз одним из самых сильных инструментов для сложного визуального редактирования.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад