Gemini Computer Use
Инструмент Gemini API для создания агентов, управляющих браузером, мобильными и десктопными интерфейсами

Инструмент для тех, кто хочет переложить механические действия на искусственный интеллект прямо через графический интерфейс. Gemini Computer Use дает моделям Gemini возможность «видеть» происходящее на экране по скриншотам и генерировать действия пользователя — щелчки мыши или ввод текста с клавиатуры. Разработчик развертывает клиентскую среду исполнения, а нейросеть берет на себя роль оператора, ориентируясь в веб-страницах, мобильных экранах и окнах десктопных приложений.
Что умеет
- Работать в разных средах: система готова взаимодействовать с браузером, мобильными операционными системами и десктопом.
- Объяснять свои шаги: в моделях линейки Gemini 3.x каждое действие сопровождается полем intent с логикой и причиной выбора конкретного элемента интерфейса.
- Контролировать безопасность: встроенные политики классифицируют действия на разрешенные, заблокированные или требующие прямого подтверждения человеком.
- Выявлять скрытые инъекции: функция выборочного сканирования скриншотов распознает враждебные инструкции, спрятанные внутри страниц или интерфейсов.
- Автоматизировать рутину: агент справляется с заполнением форм, монотонным переносом данных, проверкой пользовательских сценариев и сбором информации о товарах и ценах с интернет-площадок.
Инструмент превращает модель в полноценного тестировщика или исследователя, работающего через графический интерфейс без поиска готовых API. Продуктовым командам и дизайнерам это упрощает стресс-тесты верстки в живом браузере и избавляет от необходимости вручную собирать визуальные референсы и данные по десяткам сайтов.


