Китайская SenseNova обновила линейку генеративных моделей. Третья версия выдает нативное разрешение до 8K и поддерживает нестандартные соотношения сторон — от ультрашироких панорам до вытянутых вертикальных форматов. В архитектуру заложены функции редактирования, а для работы с плотным текстом и генерацией инфографики подготовлена отдельная версия весов.
Параллельно разработчики открыли код и веса SenseNova-Vision. Проект сводит разрозненные задачи компьютерного зрения к единому формату мультимодальной генерации. Вместо использования специфичных голов предсказания под каждую задачу, единая модель принимает естественные языковые инструкции. На выходе она генерирует либо текст с координатами, боксами и OCR-строками, либо изображения — маски сегментации, карты нормалей, карты глубины и 3D-облака точек.
В основе проекта лежит тренировочный датасет на 50 миллионов примеров, где классические визуальные аннотации переведены в формат диалога. Опубликованная 7-миллиардная модель обходит Qwen-VL и Grounding DINO в задачах понимания графических интерфейсов и локализации объектов. В репозитории лежат готовые пайплайны для обучения на собственных данных, оценки метрик и скрипты для локального инференса.
Поделиться:
Анонс Qwen3.8 на 2,4 трлн параметров и скрытые мотивы новых тарифов QwenCloud
SenseNova U1 V3: единая архитектура без VAE для генерации и редактирования инфографики в 8K