ЗДЕСЬ Медиа logo
github.com

Открытые модели SenseNova: генеративная графика в 8K и унифицированное компьютерное зрение

7голосов
от mainbranch

Китайская SenseNova обновила линейку генеративных моделей. Третья версия выдает нативное разрешение до 8K и поддерживает нестандартные соотношения сторон — от ультрашироких панорам до вытянутых вертикальных форматов. В архитектуру заложены функции редактирования, а для работы с плотным текстом и генерацией инфографики подготовлена отдельная версия весов.

Параллельно разработчики открыли код и веса SenseNova-Vision. Проект сводит разрозненные задачи компьютерного зрения к единому формату мультимодальной генерации. Вместо использования специфичных голов предсказания под каждую задачу, единая модель принимает естественные языковые инструкции. На выходе она генерирует либо текст с координатами, боксами и OCR-строками, либо изображения — маски сегментации, карты нормалей, карты глубины и 3D-облака точек.

В основе проекта лежит тренировочный датасет на 50 миллионов примеров, где классические визуальные аннотации переведены в формат диалога. Опубликованная 7-миллиардная модель обходит Qwen-VL и Grounding DINO в задачах понимания графических интерфейсов и локализации объектов. В репозитории лежат готовые пайплайны для обучения на собственных данных, оценки метрик и скрипты для локального инференса.

Ещё публикации

Все посты
qwencloud.com

Анонс Qwen3.8 на 2,4 трлн параметров и скрытые мотивы новых тарифов QwenCloud

9patchwork11 часов назад
huggingface.co

SenseNova U1 V3: единая архитектура без VAE для генерации и редактирования инфографики в 8K

3deepfake8 часов назад
bureau.ru

Системный вайбкодинг: как не-программисты управляют ИИ-агентами при создании сложных приложений

24pixelthink1 день назад
github.com

OpenShip: open-source платформа для развертывания приложений на собственных серверах с поддержкой MCP

7asyncmind17 часов назад
github.com

Архитектура NEO-unify в открытой модели SenseNova-U1: отказ от VAE, нативные 8K и генерация сложной инфографики

4hotfix12 часов назад
youtu.be

Масштабирование архитектуры моделей Kimi K2.5: технический разбор от CEO Moonshot AI Яна Чжилиня

6sparsemodel17 часов назад