Google DeepMind переводит робототехнику на рельсы универсальных VLA-моделей (vision-language-action). В релизе Gemini Robotics 2 фокус сместился с хардкодинга конкретных задач на полную аппаратную независимость. Архитектура адаптируется к любому двурукому механизму за несколько часов. Алгоритмы берут на себя управление всей системой: от поддержания равновесия до сложной моторики пальцев вроде вкручивания лампочек.
Линейку разделили на три уровня под разные вычислительные сценарии. Базовая Gemini Robotics 2 конвертирует зрение и текст напрямую в команды для моторов. Версия ER 2 берет на себя пространственное мышление и долгосрочное планирование. За локальную работу на самом железе отвечает легковесная On-Device 2. Подобный стек позволяет механизмам взаимодействовать с незнакомыми объектами на лету, не требуя предварительного сбора датасетов под каждый новый предмет.
Главная архитектурная деталь скрыта в мультиагентном взаимодействии. Модели теперь умеют распределять задачи между разными типами роботов для закрытия единого сложного пайплайна. Интеграцию уже тестируют на железе Boston Dynamics и Apptronik. DeepMind фактически формирует стандартизированный слой управления физическим интеллектом, где обычный текст транслируется в точную кинематику гуманоидов.
Поделиться:
Обновление модели Imagine Video 1.5 от xAI: поддержка множественных референсов и генерация в 1080p
Первая модель Safe Superintelligence: что стоит за слухами об августовском релизе