Агентыесть бесплатный тарифH

Holo2

Компактные визуальные модели, которые смотрят на экран и управляют интерфейсами за человека

Фото: hcompany.ai

Команда H выпустила второе поколение открытых визуально-языковых моделей для управления интерфейсами. Holo2 берет на себя рутину за монитором: смотрит на экран, находит нужные кнопки, кликает, вводит текст и переходит между окнами. В отличие от ранних версий, которые ориентировались строго на браузер, свежие веса уверенно ориентируются в мобильных и настольных операционных системах вроде Ubuntu и Android.

Что умеет

  • Точно попадать по кнопкам. Архитектура определяет координаты элементов для клика на скриншотах с разным разрешением и плотностью элементов.
  • Ориентироваться на нескольких платформах. Модели работают с веб-страницами, приложениями на смартфонах и полноценным десктопным окружением.
  • Рассуждать перед действием. Модель генерирует промежуточные цепочки мыслей, чтобы аккуратнее оценивать контекст перед кликом или вводом данных.
  • Работать экономно. Флагманская версия на 30 миллиардов параметров собрана по архитектуре Mixture-of-Experts и активирует только часть весов при каждом шаге, снижая нагрузку на вычисления.
  • Встраиваться в пайплайны. Веса основаны на семействе Qwen3-VL, разворачиваются через vLLM и легко подключаются к ReAct-агентам.

Цены и доступ

Модели выложены на Hugging Face. Младшие версии на 4B и 8B параметров распространяются под свободной лицензией Apache-2.0. Старшую версию 30B-A3B авторы отдают бесплатно для некоммерческих экспериментов, а за лицензией для бизнеса просят обращаться напрямую.

Разработчикам агентных сценариев и автоматизаторам интерфейсов это дает возможность запускать локальных роботов прямо на собственном сервере, не переплачивая за тяжелые проприетарные API.

Сайт Holo2
Агентыплатно

Holo4

Агентные модели H Company, которые управляют экраном, кодом и API одной и той же моделью

Агенты

Manus 2.0

Обновлённый агент Manus с видеоредактором, разработкой игр и автоматизациями по событиям

Агенты

Gemini 3.8 Live

Речевые модели с параллельным рассуждением и визуальным восприятием в реальном времени