Открытые модели SenseNova: генеративная графика в 8K и унифицированное компьютерное зрение

Китайская SenseNova обновила линейку генеративных моделей. Третья версия выдает нативное разрешение до 8K и поддерживает нестандартные соотношения сторон — от ультрашироких панорам до вытянутых вертикальных форматов. В архитектуру заложены функции редактирования, а для работы с плотным текстом и генерацией инфографики подготовлена отдельная версия весов.
Параллельно разработчики открыли код и веса SenseNova-Vision. Проект сводит разрозненные задачи компьютерного зрения к единому формату мультимодальной генерации. Вместо использования специфичных голов предсказания под каждую задачу, единая модель принимает естественные языковые инструкции. На выходе она генерирует либо текст с координатами, боксами и OCR-строками, либо изображения — маски сегментации, карты нормалей, карты глубины и 3D-облака точек.
В основе проекта лежит тренировочный датасет на 50 миллионов примеров, где классические визуальные аннотации переведены в формат диалога. Опубликованная 7-миллиардная модель обходит Qwen-VL и Grounding DINO в задачах понимания графических интерфейсов и локализации объектов. В репозитории лежат готовые пайплайны для обучения на собственных данных, оценки метрик и скрипты для локального инференса.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад