Почему сделать хорошую руку робота оказалось сложнее, чем научить его ходить

Посмотрите на современного гуманоида. Он идёт по лестнице, восстанавливает равновесие после толчка, приседает, иногда даже бегает. Ещё лет десять назад такие ролики выглядели почти фантастикой, а сегодня новый двуногий робот, который просто уверенно ходит, уже не гарантирует даже миллиона просмотров.

А теперь попросите его сделать что-нибудь по-настоящему бытовое. Вставить ключ в замок. Завязать шнурок. Достать из коробки одну тонкую салфетку. Вкрутить лампочку. Застегнуть молнию.

И внезапно машина за десятки или сотни тысяч долларов начинает вести себя так, будто вы попросили её провести операцию на открытом сердце.

Потому что человеческая кисть — это маленький биологический кошмар для инженера. Мы таскаем её с собой всю жизнь и совершенно не замечаем, насколько безумно сложную машину нам выдала эволюция.

Ноги хотя бы имеют довольно понятную главную задачу

Не упасть.

Да, я сейчас сильно упрощаю. Ходьба — чудовищно сложная динамическая задача: нужно управлять центром масс, учитывать инерцию, положение суставов, контакт с поверхностью, компенсировать толчки и перестраивать движение буквально каждую секунду.

Но результат довольно легко сформулировать: робот должен переместить тело из точки А в точку Б и сохранить равновесие.

Современная робототехника научилась решать это очень хорошо. Boston Dynamics десятилетиями занималась динамической локомоцией. Unitree превратила ходящих машин в относительно массовый товар. Tesla, Figure, Apptronik, UBTECH и целая армия китайских компаний показывают двуногие платформы.

С кистью такой одной задачи нет.

Она должна быть одновременно:

сильной;

точной;

быстрой;

мягкой;

чувствительной;

компактной;

надёжной.

Причём эти требования регулярно противоречат друг другу.

Возьмите обычное куриное яйцо

Человек поднимает его двумя пальцами практически не думая. Мы автоматически прикладываем достаточно силы, чтобы яйцо не выскользнуло, но недостаточно, чтобы оно треснуло.

Теперь вместо яйца берём металлический молоток. Та же рука мгновенно перестраивает захват и держит его значительно сильнее.

Потом поднимаем лист бумаги со стола. Здесь вообще приходится сначала подцепить тончайший край ногтем или создать трение между пальцем и поверхностью.

Затем берём телефон. Ключ. Чашку. Монету. Пакет молока.

Для нас всё это одно действие:

взять.

Для робота слово «взять» скрывает огромное количество совершенно разных физических задач.

В человеческой кисти около двух десятков степеней свободы

Точное число зависит от того, что именно считать отдельной степенью свободы, но важен масштаб. Каждый палец имеет несколько суставов, большой палец ещё и расположен совершенно иначе, а запястье добавляет собственную подвижность.

Именно поэтому современные роботические руки становятся невероятно сложными. В июле 2026 года Google DeepMind показывала управление пяти-палой SharpaWave с 22 степенями свободы. Gemini Robotics 2 использовала её для таких действий, как завязывание узла и закрывание zip-пакета — задач, которые требуют уже не просто «схватить предмет», а постоянно менять положение пальцев во время манипуляции.

Sanctuary AI сейчас развивает другую конструкцию: человекоподобную гидравлическую кисть с 17 степенями свободы и встроенным тактильным восприятием. Причём компания прошла уже восемь поколений аппаратных рук, перебирая разные способы привода, прежде чем остановиться на миниатюрной гидравлике.

Это великолепно показывает масштаб проблемы. Кисть — вроде бы маленькая деталь гуманоида, а внутри неё может находиться отдельная многолетняя инженерная программа.

Причём моторы надо куда-то спрятать

Вот где начинается настоящее издевательство.

У промышленного манипулятора можно сделать огромный привод возле каждого сустава. Весит много? Не страшно. Рука стоит на бетонном основании.

Человеческая кисть маленькая.

Пять пальцев должны помещаться примерно в человеческий габарит, иначе робот перестанет нормально пользоваться нашими инструментами. При этом каждый палец хочется отдельно приводить в движение.

Можно поставить маленькие электромоторы прямо в кисть. Тогда появляется масса, нагрев и сложность обслуживания.

Можно вынести приводы в предплечье и тянуть пальцы тросами, имитируя человеческие сухожилия. Тогда появляются растяжение, люфты, трение и необходимость очень точно управлять натяжением.

Можно использовать гидравлику. Она даёт великолепную плотность мощности, но требует клапанов, каналов, жидкости и герметичности.

Инженеру приходится буквально упаковать внутри пространства человеческой руки маленький завод.

И сделать её сильной недостаточно

Простейший промышленный захват обычно выглядит совершенно нечеловечески: две жёсткие «челюсти», которые сходятся навстречу друг другу.

И знаете что?

Для огромного количества задач это намного лучше пяти пальцев.

Если на конвейере всегда приезжает одна и та же металлическая деталь, зачем имитировать человека? Два пальца дешевле, надёжнее, легче и проще управляются.

Человеческая кисть становится оправданной только тогда, когда роботу нужно взаимодействовать с человеческим миром, где предметы изначально проектировались под наши руки.

Отвёртка.

Ножницы.

Дверная ручка.

Клавиатура.

Шуруп.

Пакет.

Крышка банки.

Тут универсальность пяти пальцев начинает окупать сложность.

Только вместе с ней приходит следующая проблема.

Роботу нужно чувствовать

Попробуйте закрыть глаза и взять стакан.

Получилось.

Теперь немного покрутите его в руке.

Тоже получается, потому что пальцы постоянно сообщают мозгу, что происходит. Где поверхность касается кожи. Не начинает ли предмет скользить. Сколько усилия приходится на каждый палец.

Мы почти никогда сознательно не думаем об этой информации, но без неё ловкость резко падает.

У робота классически всё было проще. Камера говорит:

предмет вот здесь.

Мотор сообщает:

сустав повернулся на столько-то градусов.

Но между этими двумя сигналами находится огромная слепая зона:

что происходит непосредственно в месте контакта?

В работе 2026 года в npj Robotics исследователи прямо называют объединение богатого тактильного восприятия с ловким захватом одной из ключевых нерешённых задач современной робототехники. Причём оказалось, что недостаточно чувствовать только кончиками пальцев — ладонь тоже активно участвует в манипуляции.

Человеческая ладонь вообще слишком хороша

Мы привыкли думать, что всё делают пальцы.

Но возьмите большую бутылку. Ручка упирается в ладонь. Возьмите отвёртку — опять часть усилия распределяется по всей поверхности кисти. Перекатывая предмет внутри руки, человек использует не отдельные точки, а целую карту контакта.

Современные тактильные датчики пытаются сделать примерно то же самое. Sanctuary AI, например, покрывает чувствительными элементами значительную часть рабочих поверхностей кисти, чтобы робот мог обнаруживать контакт, изменение давления и начало проскальзывания. Компания отдельно подчёркивает, что такие данные нужны не только для управления рукой, но и для обучения Physical AI.

То есть прикосновение становится новым каналом данных для нейросети.

Раньше:

вижу стакан.

Теперь:

вижу стакан + чувствую, как именно его держу.

Разница огромная.

Особенно когда предмет почти выскользнул

Человек реагирует на это фантастически быстро.

Стакан начал немного двигаться относительно кожи — пальцы автоматически сильнее сжались. Скорее всего, вы вообще не успели осознать происходящее.

Роботу нужно проделать тот же цикл:

датчик обнаружил движение;

система распознала проскальзывание;

контроллер решил увеличить силу;

приводы среагировали;

новое давление снова измерили.

И желательно сделать всё раньше, чем стеклянный стакан объяснит инженеру действие гравитации.

Sanctuary демонстрирует свои тактильные системы именно на подобных задачах — включая обнаружение проскальзывания и манипуляцию, когда визуального контроля недостаточно.

Вот почему камера сама по себе никогда не даст роботу человеческую ловкость. Иногда пальцам нужно знать вещи, которых глаз просто не видит.

А теперь добавим мягкие предметы

До этого у нас хотя бы были твёрдые тела.

Берём полотенце.

Носок.

Провод.

Шнурок.

Пакет.

Кусок теста.

Одежду.

Форма объекта теперь меняется прямо во время действия. Нельзя заранее сказать:

его геометрия вот такая.

Робот сжал ткань — она сложилась. Потянул кабель — тот изогнулся. Попытался поднять футболку — вместе с ней зацепилась вторая.

Именно поэтому человек может спокойно сложить бельё, а для робота это долго оставалось отдельной исследовательской задачей.

В NVIDIA при разработке физических симуляторов сейчас отдельно моделируют уже не только столкновения твёрдых тел, но и ткань, кабели, эластичные материалы и другие деформируемые объекты. Причина простая: огромное количество реальных манипуляций невозможно нормально изучать в мире, где всё представляет собой жёсткие кубики.

Ноги имеют дело в основном с полом. Руки — со всем миром

Вот, пожалуй, главная причина различия.

У ног достаточно ограниченный набор контактов. Они взаимодействуют с поверхностью, ступеньками, склонами, препятствиями. Да, среда может быть очень сложной, но основная механика всё-таки относительно повторяется.

Кисть взаимодействует практически с каждым объектом человеческой цивилизации.

А предметы никто не стандартизировал под роботов.

Посмотрите вокруг себя.

Ручка кружки тонкая.

Банка цилиндрическая.

Книга плоская.

Ключ маленький.

Мышка округлая.

Телефон скользкий.

Стул большой.

Провод гибкий.

У каждого предмета свой способ обращения.

Человеческая кисть универсальна настолько, что мы воспринимаем эту проблему как несуществующую.

Причём правильный захват зависит ещё и от будущего действия

Допустим, на столе лежит отвёртка.

Если нужно просто перенести её в коробку, можно схватить почти как угодно.

Если нужно закрутить винт, инструмент надо взять за рукоятку и правильно ориентировать.

Если надо передать отвёртку человеку, возможно, лучше держать за рабочую часть, оставив рукоятку свободной.

То есть робот должен выбирать захват не только на основе формы предмета.

Нужно понимать:

что я собираюсь делать с ним потом?

Это уже соединение механики с планированием.

Большие Vision-Language-Action модели как раз пытаются решить подобную задачу: видеть объект, понимать человеческую команду и связывать её с подходящим физическим действием.

Рука в таком случае становится последним звеном длинной цепочки рассуждения.

И одна небольшая ошибка наверху превращается в неправильные пальцы внизу

Команда:

передай мне ножницы.

Модель нашла ножницы.

Отлично.

Теперь нужно понять, как безопасно передать.

Не лезвиями вперёд.

Не зажав оба кольца.

Не бросив на стол.

У человека здесь работает огромный слой бытового здравого смысла.

Роботу надо либо получить его из данных, либо научиться через взаимодействие.

И поэтому настоящий универсальный манипулятор — это не просто хорошая механическая кисть.

Это связка:

зрение + понимание задачи + планирование + кинематика + тактильные ощущения + управление силой.

Слабое одно звено — и вся великолепная рука превращается в дорогой пяти-палый зажим.

Очень показательна лампочка

В исследовании роботической руки ADAPT авторы специально разбирают задачу с вкручиванием лампочки.

Вроде элементарно. Взял, вставил, повернул.

Но одной визуальной информации недостаточно. Ось лампочки должна очень точно совпасть с патроном, а маленькие силы контакта нужно почувствовать, чтобы корректировать положение. Авторы отмечают, что без тактильной обратной связи подобную операцию практически невозможно нормально выполнить с самого начала.

Человек делает это автоматически.

Немного повёл рукой.

Почувствовал резьбу.

Поправил.

Роботу нужно воспроизвести весь этот маленький танец между зрением и осязанием.

Поэтому ловкость нельзя просто запрограммировать

Можно написать траекторию для одной лампочки в одном патроне.

Но настоящий универсальный робот встретит:

другой патрон;

другую лампочку;

чуть другое положение;

другой угол;

люфт;

грязь;

неидеальную геометрию.

Жёсткая программа начнёт ломаться.

И тут в игру входит обучение.

Google DeepMind несколько лет развивает подходы, где робот приобретает манипуляционные навыки через демонстрации, reinforcement learning и симуляцию. В DemoStart, например, многопалая рука постепенно осваивала задачи от простых состояний к сложным. В симуляции система достигала более 98% успеха на ряде задач вроде переориентации куба, работы с гайкой и болтом и сортировки инструментов.

Но обратите внимание на ключевое слово:

в симуляции.

Реальный мир всегда приносит сюрпризы.

Потому что симулировать контакт пальца очень трудно

Ходьбу тоже симулируют.

Но у кисти площадь контакта небольшая, движения тонкие, а ошибка в миллиметр может полностью изменить результат.

Палец чуть не там коснулся кубика — тот повернулся.

Материал немного мягче — давление распределилось иначе.

Коэффициент трения другой — объект начал скользить.

Настоящая поверхность имеет микронеровности, которые вообще не хочется считать в реальном времени.

Поэтому современные физические движки для робототехники становятся всё более сложными. NVIDIA в Newton, например, отдельно развивает модели контакта именно потому, что тактильное взаимодействие критично для ловкой манипуляции. Компания показывает возможность моделировать давление на сенсорные поверхности пальцев достаточно подробно, чтобы затем обучать политики управления на этих виртуальных сигналах.

Это тот момент, когда создание робота внезапно требует почти отдельной виртуальной вселенной для его пальцев.

А человеческие руки ещё и очень быстро обучаются

Ребёнок не рождается умеющим пользоваться отвёрткой.

Он постепенно набирает огромную библиотеку манипуляций.

Взял ложку.

Уронил.

Попробовал ещё раз.

Поймал мяч.

Не поймал.

Научился завязывать шнурки.

Потом через десять лет встречает новый инструмент и довольно быстро понимает, как его держать.

То есть наша сила не только в прекрасной механике кисти. Человек отлично переносит уже накопленный опыт на новые объекты.

Роботам именно этого пока особенно не хватает.

Если машина отлично научилась переворачивать красный куб, это не означает автоматически, что она столь же хорошо справится с зелёным яблоком.

Современные модели пытаются приблизиться к такой переносимости, но человеческий уровень generalization всё ещё очень далёк.

А сколько вообще нужно данных для одной руки?

Много.

Очень много.

Каждый хороший пример манипуляции должен содержать не только видео.

Нужны положения всех суставов.

Скорости.

Команды приводам.

Положение объекта.

Данные камер.

Желательно усилия.

Тактильные ощущения.

Иногда действия оператора.

И всё это синхронизировано во времени.

Sanctuary AI поэтому активно использует телеуправление. Человек надевает устройства управления и фактически действует через руки робота, а система записывает богатый поток поведенческих данных. Компания отдельно подчёркивает ценность тактильного сигнала: модель получает не только информацию о том, как действие выглядело, но и о том, как ощущался контакт.

Получается своеобразная школа для машины.

Человек несколько тысяч раз показывает:

вот так.

Потом робот пытается повторять самостоятельно.

Но человеческая рука и роботическая всё равно разные

Вот ещё одна неприятность.

Предположим, у нас есть миллионы записей человеческих движений.

Отлично.

Но у роботической кисти:

другая длина пальцев;

другие ограничения суставов;

другая скорость;

другие силы;

другое трение;

возможно, вообще четыре пальца вместо пяти.

Просто скопировать движение человека нельзя.

Нужно сохранить смысл действия, а траекторию адаптировать под другое тело.

Именно поэтому сейчас появляется целое направление переноса человеческих демонстраций на роботическую морфологию. NVIDIA, например, в работе Dexplore использует человеческое движение как ориентир, после чего роботическая кисть ищет собственный способ выполнить манипуляцию с учётом своей физической конструкции.

То есть робот не должен идеально копировать нас.

Он должен понять:

чего человек пытался добиться.

Есть ещё одна мелочь — рука должна выдержать работу

Лабораторный прототип может великолепно поднять иголку.

Десять раз.

Промышленный клиент спросит:

А сто тысяч?

И тут снова начинаются компромиссы.

Чем точнее конструкция, тем больше маленьких деталей.

Чем больше суставов, тем больше подшипников, приводов, тросов, датчиков и потенциальных точек отказа.

Кисть ещё постоянно ударяется о предметы, испытывает боковые нагрузки и загрязняется.

Sanctuary AI в своей текущей программе отдельно подчёркивает именно долговечность. Компания несколько поколений экспериментировала с приводами и сейчас пытается соединить человеческий размер, высокую плотность мощности, чувствительность и промышленный ресурс.

Сделать руку, которая ловко работает пять минут на CES, и руку, которая два года стоит на заводе, — две совершенно разные инженерные победы.

Вот почему простые захваты никуда не исчезнут

И это нормально.

Очень легко посмотреть на красивую пяти-палую кисть и решить:

наконец-то будущее, все остальные манипуляторы устарели.

Нет.

Если роботу надо восемь часов перекладывать одинаковые коробки, два простых пальца могут оказаться идеальным вариантом.

Меньше цена.

Меньше масса.

Проще обслуживание.

Легче обучение.

Выше надёжность.

Пять пальцев нужны там, где ценность универсальности превышает стоимость всей этой сложности.

Именно поэтому Google в Gemini Robotics 2 одновременно показывает и 22-степенную пяти-палую SharpaWave, и обычные двухпальцевые захваты. Одна и та же AI-система должна уметь работать с разными конечными исполнительными механизмами.

Инженеры не поклоняются человеческой руке.

Они выбирают инструмент.

В доме ситуация другая

Вот здесь универсальная кисть становится почти обязательной.

Мы не собираемся переделывать квартиру под робота.

Нам хочется сказать:

выгрузи стиральную машину.

А там:

носки;

рубашки;

полотенца;

нижнее бельё;

простыня.

Потом:

приготовь кофе.

Кружка.

Ложка.

Пакет.

Крышка.

Потом:

принеси отвёртку.

Все задачи используют одну руку, но требуют совершенно разной моторики.

Поэтому бытовой гуманоид без хороших кистей — немного как дворецкий в боксёрских перчатках.

Ходить умеет великолепно.

Работать неудобно.

И тут становится понятно, почему Tesla столько внимания уделяет руке Optimus

Когда компания показывала разные поколения робота, именно кисти постоянно заметно менялись.

Не ради красоты.

Tesla хочет гуманоида, способного работать в инфраструктуре человека. Значит, ему нужны человеческие инструменты, кнопки, контейнеры и детали.

Можно построить великолепные ноги, но если машина не способна надёжно манипулировать предметом, промышленная ценность резко падает.

То же самое видно у Figure, Apptronik, Sanctuary и других разработчиков. Новые поколения роботов всё чаще соревнуются уже не только в походке, а в том, насколько тонкие манипуляции они могут выполнить.

Эволюция рынка буквально перемещается сверху вниз:

сначала все смотрели на ноги;

теперь смотрят на пальцы.

И пальцам постепенно дают настоящее чувство осязания

Очень интересное направление 2025–2026 годов — попытка сделать тактильные датчики не уникальным прибором для каждой отдельной зоны, а более универсальным источником данных.

В Nature Communications в 2026 году была представлена система GenForce, позволяющая переносить знание о силе между разными тактильными сенсорами. Авторы вдохновлялись тем, что человеческая нервная система объединяет ощущения от разных участков кожи в общую модель прикосновения.

Для роботов это очень важный шаг.

Иначе каждый новый тип пальца приходится почти заново калибровать и обучать.

А хотелось бы, чтобы модель понимала более абстрактную вещь:

здесь давление растёт;

предмет начал скользить;

контакт сместился.

Неважно, какой именно сенсор это почувствовал.

По сути роботы сейчас проходят путь от зрения к осязанию

Последние пятнадцать лет компьютерное зрение развивалось невероятно быстро.

Робот уже довольно хорошо может увидеть:

это яблоко.

Следующий этап:

я держу яблоко неправильно.

Вот для этого камеры недостаточно.

Именно поэтому прикосновение становится одним из главных новых источников данных Physical AI.

Можно даже провести аналогию с большими мультимодальными моделями.

Сначала ИИ умел читать текст.

Потом добавили изображения.

Аудио.

Видео.

Теперь физической модели добавляют ещё один modality:

touch.

Она не просто видит мир.

Она начинает его чувствовать.

Конечно, не «чувствовать» в человеческом эмоциональном смысле. Здесь речь о давлении, контакте, вибрациях и силах.

Но для манипуляции это примерно такое же расширение картины мира, каким когда-то стала камера для обычного AI.

А потом появится ещё более интересная штука — активное осязание

Мы же не просто пассивно ждём, что предмет коснётся руки.

Иногда специально трогаем его.

Не видно, закрыта ли крышка?

Нажали.

Непонятно, мягкий ли фрукт?

Слегка сжали.

Ищем ключ в кармане?

Пальцы ощупывают предметы без зрения.

То есть прикосновение само становится способом исследовать мир.

Роботу предстоит научиться тому же.

Не просто:

датчик сообщил давление.

А:

я не уверен, поэтому сейчас специально прикоснусь и получу дополнительную информацию.

Вот здесь манипуляция становится настоящим интеллектом, а не воспроизведением движения.

Поэтому рука — маленькая модель всей проблемы робототехники

В ней сходится практически всё.

Механика.

Материалы.

Миниатюризация.

Электроника.

Сенсоры.

Физика контакта.

Управление.

Машинное обучение.

Компьютерное зрение.

Тактильное восприятие.

Планирование.

И при этом конечный критерий предельно бытовой:

может открыть банку или нет?

Это мне особенно нравится.

Можно написать миллион научных статей и построить симулятор стоимостью десятки миллионов долларов.

Потом приходит бабушка:

Милок, крышку открой.

И вот он — настоящий benchmark.

Пожалуй, поэтому развитие рук сегодня интереснее развития ходьбы

Ноги уже достигли уровня, на котором механическая сторона проблемы в значительной степени доказана.

Не решена окончательно, конечно. Энергоэффективность, надёжность и цена ещё требуют огромной работы.

Но вопрос:

может ли двуногая машина нормально ходить?

уже не вызывает сомнений.

С руками мы пока на другой стадии.

Роботы демонстрируют очень впечатляющие отдельные операции, но универсальная человеческая ловкость всё ещё далеко впереди. Даже Google DeepMind, показывая в 2026 году завязывание узлов и работу с пяти-палой кистью, прямо говорит, что продолжает улучшать точность и скорость в стремлении к человеческому уровню dexterity.

И это довольно честное состояние отрасли.

В итоге главный компонент будущего домашнего робота может весить меньше килограмма

Не огромная батарея.

Не вычислительный блок.

Не ноги.

А две маленькие кисти.

Потому что именно через них машина наконец сможет перестать быть устройством, которое красиво ходит по нашему миру, и начать пользоваться этим миром.

Двери.

Инструменты.

Посуда.

Одежда.

Мебель.

Техника.

Практически всё вокруг создавалось для человеческой руки. Пока робот не умеет нормально с этим взаимодействовать, его универсальность остаётся сильно условной.

Можно научить гуманоида бегать быстрее человека.

Прыгать выше.

Не уставать десять часов.

Но если после всей этой великолепной инженерии он подходит к кухне, смотрит на пакет молока и двадцать секунд решает, как его взять, — человек пока сохраняет довольно унизительное преимущество.

Мы умеем открыть пакет.

Не глядя.

Одной рукой.

Продолжая в этот момент спорить по телефону.

Вот это и есть настоящий уровень, который роботам ещё предстоит догнать.

Не сальто.

Пальцы.