Holo2
Компактные визуальные модели, которые смотрят на экран и управляют интерфейсами за человека

Команда H выпустила второе поколение открытых визуально-языковых моделей для управления интерфейсами. Holo2 берет на себя рутину за монитором: смотрит на экран, находит нужные кнопки, кликает, вводит текст и переходит между окнами. В отличие от ранних версий, которые ориентировались строго на браузер, свежие веса уверенно ориентируются в мобильных и настольных операционных системах вроде Ubuntu и Android.
Что умеет
- Точно попадать по кнопкам. Архитектура определяет координаты элементов для клика на скриншотах с разным разрешением и плотностью элементов.
- Ориентироваться на нескольких платформах. Модели работают с веб-страницами, приложениями на смартфонах и полноценным десктопным окружением.
- Рассуждать перед действием. Модель генерирует промежуточные цепочки мыслей, чтобы аккуратнее оценивать контекст перед кликом или вводом данных.
- Работать экономно. Флагманская версия на 30 миллиардов параметров собрана по архитектуре Mixture-of-Experts и активирует только часть весов при каждом шаге, снижая нагрузку на вычисления.
- Встраиваться в пайплайны. Веса основаны на семействе Qwen3-VL, разворачиваются через vLLM и легко подключаются к ReAct-агентам.
Цены и доступ
Модели выложены на Hugging Face. Младшие версии на 4B и 8B параметров распространяются под свободной лицензией Apache-2.0. Старшую версию 30B-A3B авторы отдают бесплатно для некоммерческих экспериментов, а за лицензией для бизнеса просят обращаться напрямую.
Разработчикам агентных сценариев и автоматизаторам интерфейсов это дает возможность запускать локальных роботов прямо на собственном сервере, не переплачивая за тяжелые проприетарные API.


