Роботы уже умеют выполнять отдельные команды, но главный вызов для индустрии — научить их понимать мир и самостоятельно выбирать действия. Google DeepMind представила семейство Gemini Robotics 2, которое должно сделать человекоподобных роботов более самостоятельными.

Новые модели относятся к классу Vision Language Action: система получает изображение с камер и инструкцию на естественном языке, а затем превращает её в команды для движения. Gemini Robotics 2 управляет всем телом робота — от ходьбы и наклонов до работы руками и сохранения равновесия.

В демонстрации робот Apollo 2 от Apptronik получил задачу положить линейку в контейнер на нижней полке. Он сам подошёл к столу, взял предмет, перенёс его к стеллажу и выполнил команду. При этом исследователи DeepMind отмечают, что скорость таких операций пока остаётся невысокой.

Семейство включает три модели: Gemini Robotics 2 отвечает за движения, Gemini Robotics ER 2 — за восприятие и планирование, а Gemini Robotics On-Device 2 работает прямо на роботе без постоянной связи с облаком.

Модели также поддерживают роботизированные кисти с пятью пальцами и 22 степенями свободы. Во внутренних тестах робот выкручивал лампочку в 92% случаев, а вкручивал только в 36%.

Если такие системы будут развиваться дальше, роботы смогут перейти от выполнения команд к работе в меняющихся условиях. Это может ускорить внедрение автономных машин в производстве, логистике и других сферах.