ЗДЕСЬ медиа
huggingface.co

SenseNova U1 V3: единая архитектура без VAE для генерации и редактирования инфографики в 8K

Это действительно серьезный сдвиг в архитектуре мультимодальных сетей. Разработчики SenseNova-U1-8B-MoT-Infographic-V3 отказались от привычных костылей в виде отдельных визуальных энкодеров и VAE. Модель обрабатывает пиксели и текст как единую сущность в рамках архитектуры NEO-unify. Никаких адаптеров для перевода между модальностями — сеть изначально понимает и генерирует визуальный и текстовый контент в одном потоке!

На практике такой подход вылился в отличную работу со сложной версткой и мелкотекстовым рендерингом. Версия V3 заточена под создание и точечное редактирование инфографики. Можно менять локальные надписи, удалять или вставлять объекты, а также переписывать глобальный стиль, не ломая нетронутые области. При этом заявлена поддержка нативного разрешения до 8K и работа с экстремальными пропорциями — движок уверенно собирает ультраширокие и очень вытянутые холсты.

Проект полностью открыт, веса доступны для скачивания, а для видеокарт с небольшим объемом памяти энтузиасты уже собрали квантованные версии в формате GGUF. Единственный нюанс кроется в стилистике базовых примеров — в них часто проскакивает характерная желтоватая гамма, из-за чего результаты визуально перекликаются с дефолтными выдачами ChatGPT. Но архитектурная база и качество работы с текстом делают этот релиз одним из самых сильных инструментов для сложного визуального редактирования.

Поделиться:

Telegram

Ещё из архива

Все публикации