Робот Google научился ходить. Лампочку он выкручивает в 92% случаев, а вкручивает в 36%
30 июля Google DeepMind показала Gemini Robotics 2 — набор из трёх моделей, которые управляют роботами. Ролик разошёлся быстро: гуманоид ходит по комнате, приседает, берёт предметы с пола и с полок, завязывает мусорный пакет, вставляет кассету в магнитофон. Всё это, по заявлению компании, снято в реальном времени и без человека на пульте.
Что изменилось по сравнению с прошлыми версиями. Раньше такие модели управляли только верхней частью робота — руками над столом. Теперь модель ведёт всё тело: робот идёт к цели, наклоняется, удерживает равновесие с предметом в руках, протискивается в тесноте, потому что дома и склады построены под человеческие движения, а не под манипулятор на тумбе. Пример из анонса: «поставь лейку в зелёный ящик на нижней полке» — робот доходит до стола, берёт лейку, делает несколько шагов к стеллажу и ставит её на место.
Моделей три, у каждой своя работа. Первая переводит картинку и команду в движения. Вторая — рассуждающая, работает как высокоуровневый мозг: разбивает задание на шаги, следит за ходом выполнения, понимает, когда задача началась и когда закончилась, и может согласовать действия нескольких роботов, чтобы они делали общую работу вдвоём. Третья — облегчённая, крутится прямо на роботе, без интернета и облака, и осваивает новое железо за несколько часов: чтобы модель начала работать на незнакомом корпусе с другим числом суставов, ей нужно меньше 200 примеров.
А теперь то, что в ролике не показывают, хотя лежит в том же анонсе двумя экранами ниже. Там опубликованы результаты замеров — сколько попыток из ста заканчиваются успехом.
Взять предмет со стола — 68,4%. Взять с полки — 76,3%. Поднять с пола — 45,7%.
Дальше мелкая моторика, пятипалая рука с 22 подвижными суставами. Выкрутить лампочку — 92%. Вкрутить лампочку обратно — 36%. Завязать мусорный пакет — 44%. Застегнуть зип-пакет — 40%. Подмести мусор в совок — 32%.
DeepMind это не прячет и в подписи к графику пишет прямо: с задачами всего тела и с обычным захватом-клешнёй модель справляется средне-хорошо, а тонкая работа пальцами остаётся тяжёлой.
Разрыв между «выкрутить» и «вкрутить» хорошо объясняет, где именно у робота проблема. Выкручивание прощает неточность: обхватил, повернул, вытащил. Вкручивание требует попасть в резьбу и постоянно проверять на ощупь, идёт ли виток — то есть работать по обратной связи от пальцев, а не по картинке с камеры. Ровно на этом и спотыкаются: совок, пакет, зип-замок — всё это задачи, где мягкий, меняющий форму предмет надо контролировать пальцами, а не глазами.
Отсюда практический вывод, который не совпадает с настроением ролика. Порог полезности домашнего робота — не «эффектно справился при мне», а «не создаёт мне работы». Робот, который подметает в 32 случаях из 100, а в остальных 68 рассыпает, — это не помощник, это ещё один участник уборки, за которым надо переделывать. Между такими цифрами и бытовым применением лежит не одно обновление модели, а годы работы над железом рук и обратной связью.
Есть и часть про безопасность: вместе с моделями выпущен отдельный набор тестов, который проверяет, откажется ли робот выполнять опасную команду, поймёт ли, что задача невыполнима, и попросит ли помощи, когда не уверен. Плюс модель научили лучше замечать людей рядом и останавливаться, если кто-то подошёл слишком близко.
Купить всё это нельзя. Рассуждающая модель доступна разработчикам через инструменты Google, а те две, что непосредственно двигают роботом, выдаются только партнёрам по раннему доступу — производителям самих роботов.
Так что «роботы уже здесь» пока читается точнее так: они научились ходить и рассуждать, но всё ещё проваливают две трети подметаний.
Больше разборов и новостей про ИИ — в канале t.me/veruna_ai_news.






