Step3-VL-10B
Компактная открытая мультимодальная модель на 10B параметров для сложного визуального анализа
Обычно за разбором графиков или мелких надписей в скриншотах приходится идти к тяжелым закрытым сервисам. Step3-VL-10B предлагает альтернативу: открытую мультимодальную модель всего на 10 миллиардов параметров, которая в тестах на логику и зрение соревнуется с флагманами размером в сотни миллиардов. Архитектура связывает оптимизированный под язык энкодер восприятия PE-lang на 1,8B параметров и декодер Qwen3-8B через слой проекции с 16-кратным даунсемплингом. С картинками система работает через нарезку: сначала захватывает глобальный вид размером 728×728, а затем параллельно изучает детали на кропах 504×504.
Что умеет
- Глубокий анализ графики и текста. Модель распознает мелкие элементы интерфейсов, извлекает текст через OCR и разбирает сложные визуальные шифры вроде таблиц с азбукой Морзе.
- Понимание 2D- и 3D-пространства. Вычисляет взаимное расположение объектов на кадрах, считает одинаковые элементы и оценивает геометрию сцены.
- Параллельное рассуждение. Метод PaCoRe запускает 16 параллельных цепочек проверки гипотез с контекстом до 128K токенов для поиска ответов в комплексных изображениях.
- Анализ интерфейсов. Точно считывает состояние открытых вкладок редактора, вычленяет названия и игнорирует посторонний шум в кадре.
- Сложные вычисления по схемам. Решает визуальные математические и физические задачи, ориентируясь на метки, веса ребер в графах и диаграммы.
Такая система пригодится командам, которые строят пайплайны распознавания документов, технической графики или скриншотов внутри локального контура без обращения к гигантским облачным API.

