Последние несколько лет искусственный интеллект жил в довольно комфортных условиях.
Ему давали текст.
Картинку.
Аудиозапись.
Таблицу.
Иногда доступ к браузеру.
ИИ мог ошибиться, написать глупость, неправильно понять документ — и максимум на экране появлялась ерунда.
А теперь инженеры решили:
Хорошо. А давайте дадим ему двухметрового робота весом в несколько десятков килограммов.
Прекрасная идея.
😁
Если языковая модель перепутала две даты, можно исправить ответ.
Если робот перепутал две команды и вместо коробки схватил вашу руку — характер ошибки немного меняется.
Именно поэтому сейчас всё чаще встречается термин Physical AI — физический искусственный интеллект.
NVIDIA использует его для систем, способных воспринимать окружающий мир, рассуждать о нём и совершать реальные действия: роботов, автономных машин и других устройств. Google DeepMind говорит очень похоже — об embodied reasoning, «воплощённом рассуждении», когда модель должна не только понимать информацию, но и действовать внутри физической среды.
Звучит как очередное красивое название для робототехники.
Но сдвиг действительно происходит.
Потому что раньше мы в основном программировали движения роботов.
Теперь пытаемся дать роботам что-то похожее на понимание задачи.
Старый промышленный робот тоже очень умный. Только по-своему
На автомобильных заводах роботы работают десятилетиями.
Один сварит кузов.
Другой нанесёт герметик.
Третий перенесёт деталь.
И делает это великолепно.
Быстро.
Точно.
Тысячи раз подряд.
Но обычно его мир очень хорошо подготовлен.
Деталь подъезжает в известное место.
Конвейер движется предсказуемо.
Положение оборудования известно заранее.
Человек в рабочую зону заходить не должен.
Программист фактически объяснил машине:
Когда получишь сигнал А, поверни первый сустав сюда, второй сюда, возьми объект, перенеси по такой траектории, отпусти.
Роботу необязательно понимать:
Это дверь автомобиля.
Для него это вполне может быть:
объект в координатах X, Y, Z.
Именно поэтому промышленная роботизация прекрасно работает там, где мир можно заставить вести себя прилично.
А человеческий мир ведёт себя отвратительно
Возьмём кухню.
Сегодня чашка стоит возле чайника.
Завтра — на столе.
Послезавтра — внутри мойки.
На ней может лежать ложка.
Рядом мокрое полотенце.
Кто-то оставил дверцу шкафа открытой.
На полу игрушка.
Кот решил, что именно сейчас необходимо пройти между ногами робота.
Человек входит на кухню и воспринимает всё это как:
ну кухня.
Для машины это совершенно новый набор входных данных.
И поэтому задача:
возьми чашку и поставь в посудомойку
на самом деле означает:
- понять, какая из объектов чашка;
- определить её положение в трёхмерном пространстве;
- понять, где находится посудомойка;
- найти дверцу;
- определить, открыта ли она;
- если нет — открыть;
- выбрать место для чашки;
- рассчитать захват;
- не раздавить чашку;
- не столкнуться со столом;
- не уронить её во время движения;
- заметить, если человек неожиданно оказался рядом;
- понять, получилось ли вообще.
И всё это — одна бытовая команда.
Вот почему робот, который замечательно танцует на сцене, может внезапно проиграть бабушке в дисциплине:
убери со стола.
Языковые модели подарили робототехнике новую идею
До недавнего времени роботам в основном создавали специальные системы под специальные задачи.
Но оказалось, что большие мультимодальные модели обладают очень полезным свойством:
они уже знают довольно много о мире.
Модель видела миллионы изображений.
Знает, что чашку обычно берут за ручку.
Понимает фразу:
положи яблоко в миску слева от синей тарелки.
Способна отличить яблоко от отвёртки.
Может разложить длинную цель на более короткие шаги.
Получается заманчивый мост.
Берём интеллект, который научился связывать язык и изображения.
И добавляем ещё один тип выхода:
движение.
Так появился класс моделей, который обычно называют VLA — Vision-Language-Action.
Зрение.
Язык.
Действие.
Google DeepMind именно так описывает Gemini Robotics: модель получает визуальную информацию и инструкции и превращает их в команды физическому роботу. Первую Gemini Robotics представили в марте 2025 года, а к лету 2026-го Google уже показывает Gemini Robotics 2, управляющую целым гуманоидом — от перемещения ног до работы кистей. (Google DeepMind)
Представим, что раньше робота учили так
Инженер:
Подними зелёный куб.
Робот:
рука X = 0.42
рука Y = 0.18
захват = открыть
двигаться по траектории №7
захват = закрыть
Всё чудесно.
Теперь куб передвинули на двадцать сантиметров.
Упс.
Или вместо куба дали зелёную кружку.
Снова нужна новая логика.
Современная идея выглядит иначе.
Человек:
Убери зелёную кружку со стола.
Модель видит сцену.
Находит кружку.
Понимает цель.
Рассчитывает, как подойти.
Выбирает способ захвата.
Управляет приводами.
То есть программируется уже не движение.
Программируется намерение.
Вот это действительно большое изменение.
Google в прошлом году показала очень хороший пример
В Gemini Robotics-ER исследователи демонстрировали ситуацию с обычной кружкой.
Модель видит кружку и может рассуждать:
лучше всего взять её двумя пальцами за ручку;
вот подходящая точка захвата;
вот безопасная траектория движения.
Причём ER означает Embodied Reasoning — воплощённое рассуждение. Такая модель может заниматься пространственным пониманием, планированием и оценкой ситуации, а более низкоуровневый контроллер уже занимается конкретным движением моторов.
Это очень похоже на человека.
Вы не думаете:
сокращаю дельтовидную мышцу на 11%.
Вы думаете:
возьму кружку.
Остальное нервная система решает сама.
А в 2026 году роботу уже начали отдавать всё тело
Летом Google DeepMind представила Gemini Robotics 2.
И вот здесь произошёл довольно важный переход.
Предыдущие модели в основном хорошо выглядели за столом:
роботизированные руки манипулируют предметами.
Теперь модель управляет полноценным гуманоидом Apollo 2 от Apptronik.
В демонстрации человеку достаточно сказать:
Положи лейку в зелёную корзину на нижней полке.
Роботу нужно:
увидеть лейку;
подойти;
наклониться;
взять её;
развернуться;
пройти к стеллажу;
найти нужную корзину;
положить предмет.
Google подчёркивает, что Robotics 2 уже управляет целым телом, а не только верхней частью робота. При этом сама компания признаёт, что скорость движений пока ещё нужно улучшать.
Последняя фраза мне нравится особенно.
Потому что ролики про Physical AI сейчас выглядят очень впечатляюще.
А потом вспоминаешь:
человеку потребовалось бы секунд десять.
Робот трудится минуту.
Мы ещё в начале дороги.
Но руки оказались едва ли не сложнее ног
Это мы уже немного обсуждали.
Заставить двухногого робота ходить — огромная инженерная проблема.
Но хотя бы задача понятна:
не падать.
С рукой начинается настоящий ад.
Человеческая кисть способна:
держать молоток;
завязать шнурок;
взять яйцо;
повернуть ключ;
открыть пакет;
поднять лист бумаги;
закрутить лампочку.
Каждый объект имеет:
разную форму;
массу;
жёсткость;
трение;
центр тяжести.
Слишком слабый захват — предмет выпал.
Слишком сильный — раздавил.
Gemini Robotics 2 сейчас демонстрирует управление пяти-палой кистью SharpaWave с 22 степенями свободы. Google показывает, например, завязывание узлов и закрывание zip-пакета.
И вот это для меня гораздо интереснее очередного бега робота.
Бег выглядит зрелищно.
Но деньги домашнему гуманоиду принесёт способность нормально взять тарелку.
Почему нельзя просто обучить робота на интернете, как ChatGPT?
Потому что интернет забит текстом.
Для языковой модели великолепно.
Миллиарды страниц.
Книги.
Документы.
Форумы.
Код.
Изображений тоже море.
А где взять миллиард примеров:
робот взял носок именно этой рукой под именно таким углом и не уронил?
Таких данных значительно меньше.
Физический мир плохо индексируется.
Google не может открыть поисковик и скачать:
400 миллиардов качественно размеченных движений гуманоидных кистей.
И поэтому главный дефицит Physical AI сегодня — не только процессоры.
Данные о действиях.
Можно собирать их с людей
Например, оператор дистанционно управляет роботом.
Берёт предмет.
Ставит.
Открывает ящик.
Каждое действие записывается:
картинка с камер;
положение суставов;
силы;
траектория;
команда.
Получается обучающий пример.
Сделайте это миллион раз — появляется датасет.
Именно поэтому телеметрия и телеуправление сейчас постоянно появляются рядом с гуманоидными компаниями.
Иногда зритель смотрит ролик:
Смотри, робот сам работает!
А потом выясняется:
за ним где-то стоит человек с контроллером.
Интернет:
ОБМАН!
Но телеуправление само по себе совершенно нормально.
Проблема только если его пытаются выдать за автономность.
Для разработки это великолепный способ показать машине:
вот как человек решил эту физическую задачу.
Только человеческие демонстрации дороги
Чтобы собрать тысячу часов данных, кому-то нужно тысячу часов двигать роботом.
А хочется миллион.
Десять миллионов.
И здесь появляется, наверное, самая необычная часть Physical AI:
роботов всё чаще учат в мирах, которых не существует.
Для этого строят цифровые двойники
Берём завод.
Склад.
Квартиру.
Робота.
И создаём их виртуальные версии.
С настоящей физикой:
гравитацией;
трением;
столкновениями;
массой предметов;
ограничениями суставов.
Теперь у виртуального робота есть великолепное преимущество.
Его можно ронять.
Сто тысяч раз.
Без счёта из сервисного центра.
😁
Робот схватил коробку неправильно?
Она виртуально упала.
Повторяем.
Вывернул сустав?
Перезапускаем симуляцию.
Врезался в человека?
Никто не пострадал.
NVIDIA сейчас строит значительную часть своей стратегии Physical AI именно вокруг симуляции, Isaac и Omniverse. Компания описывает физически корректные виртуальные среды как способ обучать и проверять роботов до того, как алгоритмы попадут в реальные машины.
По сути роботу создают собственную видеоигру
Только с одной важной целью.
После миллиона часов внутри игры он должен выйти наружу и не обнаружить:
Ой. Настоящая кружка ведёт себя совсем не так.
Это называется sim-to-real — перенос навыка из симуляции в реальный мир.
И это отдельная огромная проблема.
В симуляторе:
поверхность идеально описана;
камера имеет известные параметры;
физический движок знает коэффициент трения;
объект соответствует модели.
В жизни:
краска стёрлась;
пол скользкий;
линза грязная;
винт немного люфтит;
коробка промокла;
кто-то заменил деталь на похожую.
Маленькое расхождение может сломать красивый виртуальный навык.
Поэтому NVIDIA Research в 2026 году отдельно называла sim-to-real одной из фундаментальных областей, необходимых для перехода от демонстрационных роботов к устойчивой автономности.
Есть очень хитрый способ: сделать симуляцию намеренно хуже
Звучит контринтуитивно.
Мы хотим максимально точную виртуальную копию мира?
Не всегда.
Иногда во время обучения параметры специально постоянно меняют.
Сегодня коробка весит 800 граммов.
Следующий запуск — 1,1 кг.
Трение выше.
Потом ниже.
Освещение другое.
Камера чуть сместилась.
Мотор слабее.
Пол неровный.
Робот учится не одной идеальной реальности.
А большому диапазону возможных реальностей.
И когда попадает в настоящий мир, тот оказывается просто ещё одной вариацией.
Такой подход давно используют в робототехнике под названиями вроде domain randomization.
Очень человеческая идея:
если не знаешь точно, какие неприятности ждут — готовься сразу ко многим.
А теперь к симуляции подключили генеративный ИИ
Вот здесь технологии последних лет начали склеиваться.
Что прекрасно умеют современные генеративные модели?
Создавать варианты.
Допустим, у нас есть склад.
Нужно обучить робота.
Можно вручную построить:
100 вариантов склада.
А можно генерировать тысячи сцен:
коробки иначе расставлены;
другой свет;
другие предметы;
часть прохода перекрыта;
работник стоит в неожиданном месте;
на полу лежит мусор.
NVIDIA развивает для этого семейство world models Cosmos — моделей мира, которые используются для генерации и рассуждения о физически правдоподобных сценариях, синтетических данных и обучения автономных систем. В 2026 году компания представила Cosmos 3 как часть нового поколения своего Physical AI-стека.
То есть робот получает возможность «прожить» огромное количество ситуаций, которые инженерам никогда не пришлось реально строить.
Это почти как обучение беспилотных автомобилей
Беспилотнику нужно уметь реагировать на очень редкие события.
На дорогу выкатилась шина.
Необычная стройка.
Машина странно остановилась поперёк полосы.
Олень.
Пешеход с велосипедом.
Собирать каждый такой случай в реальности дорого и иногда опасно.
В симуляции можно создать десять тысяч вариантов.
И тот же подход теперь уходит в робототехнику.
Только вместо:
что делать с грузовиком на трассе?
появляется:
что делать, если чашка лежит внутри кастрюли, кастрюля на стуле, а стул передвинул ребёнок?
Physical AI — это во многом попытка заставить машину иметь достаточно богатую модель мира, чтобы не ломаться при первой неожиданности.
Потому что физический мир требует причинно-следственного понимания
Языковой модели можно задать вопрос:
Что произойдёт, если толкнуть стакан со стола?
Она ответит:
упадёт.
Роботу недостаточно знать это словами.
Ему нужно понимать:
если моя рука продолжит двигаться ещё пять сантиметров, я сейчас действительно столкну стакан.
Вот здесь важно различие между описанием мира и действием внутри мира.
NVIDIA определяет Physical AI как системы, которым нужно понимать физическую динамику — гравитацию, трение, инерцию, пространственные отношения и причинно-следственные связи.
То есть появляется не просто:
что изображено на фотографии?
А:
что станет с изображённым миром после моего действия?
Это уже очень интересная форма интеллекта.
Представьте роботизированную руку возле трёх предметов
Хрустальный бокал.
Металлический молоток.
Мягкая губка.
Форма понятна.
Но хорошая модель должна ещё знать:
бокал хрупкий;
молоток тяжёлый;
губка сжимается.
Захват не может быть одинаковым.
Человек знает это не потому, что каждый раз решает уравнения механики.
У нас огромное количество физической интуиции.
Мы прожили годы внутри мира.
Роняли вещи.
Толкали.
Сжимали.
Разбивали.
Ребёнок вообще несколько лет практически профессионально занимается сбором физического датасета.
Берёт предмет.
Бросает.
Мать возвращает.
Снова бросает.
😁
Роботу такую интуицию приходится создавать искусственно.
Поэтому «модель мира» сейчас становится очень модным термином
И здесь маркетинга хватает.
Но идея сама по себе нормальная.
Если ИИ собирается действовать, ему полезно уметь предсказывать:
что будет дальше?
Не обязательно с идеальной точностью.
Человеку тоже не нужно знать траекторию каждой молекулы.
Достаточно понимать:
если отпустить тарелку — хороший вечер закончится.
Модели мира пытаются дать машине похожую способность предсказывать развитие сцены и последствия действий.
Это один из тех моментов, где робототехника, генеративное видео и AI неожиданно начинают встречаться.
Модель, умеющая генерировать правдоподобное:
следующий кадр после этого,
теоретически уже знает что-то о динамике мира.
А если вместо кадров научить её выбирать действия, способные привести к нужному будущему, получится очень интересный контроллер.
Но не стоит путать красивое видео с настоящей физикой
Это важная оговорка.
Современная видеомодель может показать:
человек бросил мяч — мяч полетел.
И одновременно через несколько секунд случайно изменить форму мяча или количество пальцев человека.
Для кино не страшно.
Для робота:
пять пальцев превратились в шесть
— несколько неудобно.
😁
Физический AI требует гораздо более строгого уровня согласованности.
Предмет не должен исчезнуть между кадрами.
Масса должна иметь значение.
Стол должен оставаться там же.
Робот обязан знать собственное положение.
Поэтому генеративная модель мира — не волшебная замена физическому движку.
Скорее ещё один инструмент внутри большого стека.
И главное отличие Physical AI от обычного чат-бота — цена ошибки
Допустим, ChatGPT пишет:
Париж находится в Германии.
Человек:
Нет.
Исправили.
Робот считает:
проход свободен.
А там стоит ребёнок.
Вот здесь фраза:
модель иногда галлюцинирует
перестаёт звучать мило.
Поэтому физическим машинам нужны отдельные уровни безопасности.
Не только большой умный AI.
Но и очень тупые ограничения.
Максимальное усилие.
Зоны безопасности.
Аварийная остановка.
Контроль расстояния до человека.
Ограничение скорости.
Независимые датчики.
То есть языковая модель может решить:
я могу пройти сюда.
А низкоуровневая система отвечает:
нет, не можешь, впереди человек.
И выключает привод.
Google в Gemini Robotics тоже отдельно подчёркивает многоуровневую безопасность: высокоуровневое рассуждение должно работать вместе с классическими робототехническими ограничениями — избеганием столкновений, контролем усилий и устойчивости.
В Robotics 2 Google вообще отдельно учит робота сомневаться
Это мне особенно нравится.
Вместо идеи:
умная машина всегда знает, что делать,
появляется:
умная машина должна понимать, когда не знает.
В Gemini Robotics 2 Google ввела тесты, где модель должна распознавать опасные команды, оценивать возможность выполнения задачи и обращаться к человеку, если ситуация неопределённая.
Мы буквально к этому уже пришли, когда обсуждали ИИ-агентов с CRM.
Хороший агент должен уметь сказать:
требуется человек.
Для робота это ещё важнее.
ИИ-продавец ошибся:
отправил не то письмо.
Гуманоид ошибся:
открыл не тот вентиль.
Масштаб ответственности меняется.
Ещё одна интересная тенденция — мозг пытаются сделать независимым от тела
Мы недавно обсуждали роботов-кентавров, колёса и четыре ноги.
Вот здесь Physical AI начинает особенно интересно с этим пересекаться.
Старый подход:
каждый робот имеет собственный специально написанный интеллект.
Новая мечта:
обучили общий роботический мозг — адаптировали к разным телам.
Google подчёркивает, что Gemini Robotics рассчитана на разные embodiments — физические воплощения. Модель обучалась преимущественно на одной двухрукой платформе, но её адаптировали к другим манипуляторам и гуманоидам. В Robotics 2 компания заявляет возможность адаптации к новому телу за считаные часы.
Если этот подход реально масштабируется, последствия огромные.
Потому что производитель нового робота не начинает интеллект с нуля.
Как сегодня производитель телефона не пишет собственную операционную систему от первой строчки.
Представим мир роботических приложений
У вас робот марки А.
У соседа Б.
На заводе модель В.
Но базовый Physical AI умеет:
возьми;
положи;
открой;
найди;
подойди;
используй инструмент.
Дальше производитель адаптирует эти навыки под геометрию своего тела.
У одного четыре пальца.
У другого пять.
Третий вообще пользуется захватом.
Высокоуровневая задача одна:
возьми бутылку.
Конкретная моторика разная.
Если такое разделение действительно получится, робототехника наконец получит что-то похожее на программную платформу.
Сейчас каждый робот слишком сильно является отдельным проектом.
И здесь появляются роботы, которые могут учить друг друга
Летом 2026 года Google показала в Gemini Robotics 2 ещё одну любопытную штуку — взаимодействие нескольких роботов.
Машины могут выполнять общую задачу и распределять работу с учётом собственных физических возможностей.
Представим склад.
Один робот маленький и быстрый.
Другой способен поднимать тяжести.
Третий достаёт до верхних полок.
Вместо заранее прошитой схемы система сама решает:
маленький привезёт контейнер;
большой поднимет;
третий разместит наверху.
Это уже почти не отдельные машины.
А физическая версия системы AI-агентов.
Только вместо:
агент поиска → агент анализа → агент текста
получаем:
тележка → гуманоид → манипулятор.
И вот здесь слова «интернет роботов» перестают выглядеть совсем фантастически.
Причём часть интеллекта обязательно будет жить прямо внутри машины
Мы только что писали про локальный ИИ в телефонах.
Для роботов это ещё важнее.
Представьте:
робот держит кастрюлю кипятка.
Запрос в облако:
следует ли мне удерживать предмет?
Wi-Fi:
подключение потеряно.
Робот:
¯\(ツ)/¯
Нет.
Критическая моторика должна продолжать работать локально.
Google ещё в 2025 году выпустила Gemini Robotics On-Device — компактную VLA-модель, оптимизированную для работы непосредственно на роботическом оборудовании. В Robotics 2 локальная версия тоже является частью семейства моделей.
Получается очень похожая архитектура на смартфон.
Локально:
быстрая реакция;
движение;
безопасность;
базовые навыки.
В облаке:
тяжёлое рассуждение;
новые знания;
большие задачи;
обучение.
И Physical AI уже далеко не только про гуманоидов
Термин очень удобно приклеился к человекоподобным роботам, потому что они самые фотогеничные.
Но физический ИИ — это гораздо шире.
Самоуправляемый автомобиль.
Складская техника.
Робот-манипулятор.
Сельскохозяйственная машина.
Дрон.
Медицинский робот.
Автономная строительная техника.
Форма вообще вторична.
Если система:
видит физический мир;
понимает его состояние;
принимает решение;
совершает действие;
оценивает результат —
это уже та область, которую сейчас называют Physical AI.
NVIDIA, например, в свою экосистему Physical AI включает и гуманоидов, и промышленных роботов, и автономный транспорт.
Возможно, поэтому NVIDIA так сильно за эту тему взялась
На первый взгляд:
NVIDIA делает видеокарты. При чём здесь роботы?
При всём.
Для обучения AI нужны GPU.
Для генерации синтетических данных нужны GPU.
Для симуляции мира нужны GPU.
Для компьютерного зрения — GPU.
Для запуска моделей внутри робота — ускорители.
У NVIDIA уже сложился почти идеальный стек:
DGX — обучать большие модели.
Omniverse — строить виртуальный мир.
Isaac — симулировать и обучать роботов.
Cosmos — модели мира и генерация данных.
GR00T — модели для гуманоидной робототехники.
Jetson — запускать AI уже внутри физической машины.
И становится понятно, почему Дженсен Хуанг последние годы так любит слово Physical AI.
Если робототехническая революция случится, почти на каждом этапе можно продать немножко NVIDIA.
Очень удачная любовь к будущему.
😁
В марте 2026 года компания объявила новые модели Cosmos 3 и Isaac GR00T N1.7 и перечислила среди партнёров ABB Robotics, FANUC, KUKA, Figure, Agility, Universal Robots, Yaskawa и других крупных игроков робототехники.
Но пока самая большая проблема Physical AI — реальность
Она очень разнообразная.
У языка тоже бесконечное количество фраз.
Но слово не весит три килограмма.
Не падает.
Не ломается.
Не застревает между пальцами.
С физическим миром невозможно окончательно решить задачу:
вот достаточный набор примеров, теперь я видел всё.
Всегда появится новый объект.
Новая поверхность.
Новый дом.
Необычная ситуация.
Поэтому главный критерий будущего робота — не то, сколько действий он запомнил.
А насколько хорошо он обобщает опыт.
Не обучали именно этой кружке.
Но он понимает:
кружка.
Не видел именно этот ящик.
Но понимает:
здесь ручка, скорее всего, надо потянуть.
Никогда не работал в этой квартире.
Но может адаптироваться.
Google именно generality — способность справляться с новыми объектами, инструкциями и средами — называет одной из трёх центральных задач своих роботических моделей наряду с интерактивностью и ловкостью.
Вот если это получится, робототехника действительно сильно поменяется.
Тогда робот перестанет быть автоматом и станет учеником
Сегодня покупатель промышленного робота часто фактически покупает проект внедрения.
Робота нужно:
привезти;
установить;
оградить;
запрограммировать;
настроить;
проверить.
Изменился процесс?
Зовём специалиста.
Будущий Physical AI обещает другую модель:
Показываем роботу несколько раз.
Или:
объясняем словами.
Он пробует.
Ошибается.
Корректируем.
Через некоторое время выполняет сам.
Это уже гораздо ближе к обучению нового сотрудника.
Не потому, что робот становится человеком.
А потому, что перестаёт требовать отдельной программы на каждую микрозадачу.
И это тот самый момент, которого гуманоиды ждут десятилетиями
Сам механический гуманоид можно построить уже сегодня.
Мы видели десятки.
Unitree.
Tesla.
Figure.
Apptronik.
Boston Dynamics.
UBTECH.
Agility.
Проблема не в том, можно ли сделать две ноги и две руки.
Можно.
Проблема:
что именно посадить внутрь этой машины, чтобы она перестала быть очень дорогой радиоуправляемой куклой?
Вот здесь Physical AI и нужен.
Без общего интеллекта гуманоид имеет довольно сомнительный смысл.
Если каждое движение всё равно программировать отдельно, дешевле поставить специализированный манипулятор.
Человеческое тело выгодно только тогда, когда машина способна использовать его универсальность.
Открыть дверь.
Взять коробку.
Принести инструмент.
Переставить предмет.
Убрать.
А потом получить совершенно другую задачу.
Поэтому настоящая гонка роботов сегодня проходит не только в железе
Очень легко смотреть:
У кого робот красивее ходит?
Но значительно важнее:
У кого быстрее появляется общий «мозг» для реального мира?
Tesla пытается использовать опыт своих систем автономного вождения и огромные вычислительные ресурсы.
Google переносит Gemini в робототехнику.
NVIDIA строит открытые платформы вокруг GR00T, Cosmos и Isaac.
Различные стартапы создают собственные foundation-модели для роботов.
В каком-то смысле повторяется ранняя гонка больших языковых моделей.
Только теперь benchmark может закончиться разбитой чашкой.
А самое интересное — Physical AI способен изменить и сам искусственный интеллект
Мы привыкли думать:
сначала создадим умный AI, потом дадим ему тело.
Но связь может быть обратной.
Люди значительную часть своего понимания мира получили именно потому, что имели тело.
Ребёнок узнаёт:
тяжёлое;
горячее;
далеко;
высоко;
скользко;
больно;
не из Википедии.
Он взаимодействует.
Сенсорный опыт создаёт массу понятий, которые потом кажутся нам совершенно очевидными.
AI, который обучается только на текстах и изображениях, получает описание этого опыта.
Робот способен получать сам опыт.
Действие.
Последствие.
Новая попытка.
Можно представить, что следующим большим источником данных для искусственного интеллекта станет не интернет.
А физический мир.
Миллионы роботов смогут создавать совершенно новый датасет
Допустим, когда-нибудь работают десять миллионов домашних и промышленных машин.
Каждый день они:
открывают двери;
берут предметы;
ходят;
ошибаются;
исправляются;
встречают новые ситуации.
Если хотя бы часть такого опыта может обезличенно использоваться для обучения, получается гигантский поток реальных физических данных.
Один робот научился лучше брать пакет.
Обновление модели.
Навык получают остальные.
И тогда каждый проданный робот становится одновременно:
продуктом;
датчиком;
испытательным стендом;
источником данных.
Примерно то, что Tesla много лет пыталась делать с автомобилями, но теперь переносится на машины, способные взаимодействовать почти со всем человеческим окружением.
Вот тогда прогресс может начать ускоряться очень быстро
Первые роботы плохие.
Поэтому собирают мало полезных данных.
Стали чуть лучше.
Их продали больше.
Данных больше.
Модель улучшилась.
Роботы стали полезнее.
Продали ещё больше.
Получили ещё больше данных.
Возникает маховик.
И мне кажется, именно поэтому сегодняшний робототехнический бум выглядит серьёзнее многих предыдущих.
Механика действительно улучшилась.
Но главное — рядом наконец появился AI, способный потенциально сделать эту механику универсальной.
Хотя слово «потенциально» пока надо писать большим шрифтом
ПОТЕНЦИАЛЬНО.
Потому что большая часть красивейших демонстраций всё ещё происходит в:
подготовленной среде;
ограниченном наборе задач;
лаборатории;
коротком ролике.
Чтобы Physical AI действительно изменил экономику, роботу нужно выполнить другой тест.
Не:
один раз завязать узел.
А:
прийти завтра и снова нормально работать.
Потом послезавтра.
В комнате, где кто-то передвинул стол.
С предметом, которого раньше не видел.
Рядом с человеком.
Без инженера, который каждые двадцать минут перезапускает систему.
Мы постоянно возвращаемся к этому критерию, потому что другого пока не придумали.
Но переход уже хорошо виден
Ещё несколько лет назад главным впечатляющим достижением было:
робот ходит.
Сегодня:
ну ходит и ходит. Что умеет делать?
Потом было:
робот взял предмет.
Теперь:
хорошо. А новый предмет?
Следующая ступень:
выполни длинную задачу.
Потом:
сам разберись, что пошло не так.
Google уже строит агентную архитектуру, где одна модель занимается высокоуровневым планированием, вызывает цифровые инструменты вроде поиска, а другая выполняет физические действия.
Это фактически AI-агент, который выбрался из браузера.
И вот здесь мне Physical AI кажется намного важнее очередной версии чат-бота
Разница между двумя хорошими языковыми моделями сегодня часто выглядит так:
одна написала ответ на 8 из 10;
другая на 8,5.
Полезно.
Но революционность постепенно снижается.
А превращение ИИ из системы, которая объясняет, как сделать работу, в систему, которая физически делает её сама, меняет совсем другие рынки.
Производство.
Логистику.
Строительство.
Сельское хозяйство.
Уход.
Транспорт.
Дом.
Если всё получится, главным интерфейсом искусственного интеллекта однажды станет не строка:
Ask anything.
А физическая машина, которой можно сказать:
Убери здесь.
И уйти.
Хотя именно слово «уйти» будет главным экзаменом
Попросить робота:
убери комнату.
Стоять рядом двадцать минут и следить, как он работает.
Через три минуты поправить.
Через пять поднять упавшую вещь.
Через десять перезапустить.
Это не автоматизация.
Настоящий Physical AI начнётся тогда, когда человек сможет:
дать задачу;
уйти;
вернуться;
увидеть нормальный результат.
Без разбитой вазы.
Без запертого в шкафу кота.
Без робота, который остановился посреди комнаты и философски смотрит на носок.
😁
И вот до такого уровня нам ещё есть куда идти.
Но направление уже понятно
Первую большую волну ИИ мы научили читать и писать.
Вторую — видеть и слышать.
Потом дали ей браузер и приложения — она начала действовать в цифровом мире.
Теперь начинается следующая попытка.
Дать ей:
руки;
ноги;
колёса;
камеры;
датчики;
физическое тело.
И проверить, что произойдёт, когда искусственный интеллект впервые столкнётся не с описанием мира…
…а с самим миром.
А он, зараза, гораздо сложнее любого промпта.
Именно поэтому следующие несколько лет в робототехнике могут оказаться интереснее предыдущих двадцати.
Железо уже научилось двигаться.
ИИ уже научился довольно неплохо рассуждать.
Теперь инженерам осталось соединить эти две вещи так, чтобы робот не просто знал:
как надо поступить,
а действительно смог:
взять — и сделать.