Почему ИИ-агенты до сих пор не стали «виртуальными сотрудниками», которых нам обещали

Почему ИИ-агенты до сих пор не стали «виртуальными сотрудниками», которых нам обещали

Агент открывает браузер, находит нужное письмо, вытаскивает из него данные и обновляет карточку клиента. На демонстрации это выглядит как рабочий день сотрудника, сжатый до пары минут. Настоящие проблемы начинаются позже: задача растянулась на несколько дней, страница успела поменяться, доступ истёк, а мелкие допущения, накопившиеся по дороге, сложились в ошибку, которую никто не поймал. По состоянию на 10 октября 2026 года разрыв между этими двумя картинками никуда не исчез.

Обещание и реальность

В разговорах последних лет агент выглядел почти как коллега: берёт задачу целиком, сам планирует шаги, помнит контекст, работает сутками и отчитывается. Реальность прозаичнее. Агентные API действительно дают модели возможность работать с браузером — открывать сайты, нажимать элементы интерфейса, собирать данные, выполнять операции в приложениях. Но в таких сценариях вокруг модели обычно нужен технический контур: кто-то управляет сессией, обрабатывает запросы на авторизацию, восстанавливает работу после обрывов и проверяет, что получилось.

В этом и главная подмена. «Сотрудник, которому дали задачу» и «технический контур вокруг модели» снаружи выглядят похоже: в обоих случаях что-то происходит без человека в моменте. Разница в том, что в рискованных производственных сценариях контур обычно не обходится без участия людей — их участие просто вынесено в настройку, наблюдение и разбор ошибок.

Если отбросить крайности, агенты уже способны выполнять короткие повторяемые задачи в проверяемых сценариях: находят информацию, переносят данные из одного места в другое, собирают черновик, проверяют несколько условий, готовят сводку. Ценность здесь не в глубине рассуждений, а в том, что шагов мало и каждый следующий можно проверить до того, как он станет необратимым. Как только сценарий удлиняется, начинается совсем другая история.

Где ломается длинная задача

В длинных цепочках ломается не «интеллект» модели, а несколько вполне инженерных вещей сразу. Агенту нужно помнить принятые решения и удерживать состояние между шагами, замечать, что среда изменилась: страница обновилась, интерфейс переехал, доступ закончился. Ему нужно не накапливать мелкие отклонения — к десятому шагу они складываются в одну крупную ошибку, а к сотому её уже невозможно распутать. И ему нужна возможность безопасно ошибиться, которой в реальном процессе почти никогда нет, потому что часть действий необратима.

Отдельный вопрос — как возможности агентов вообще измеряют. Организация METR оценивает не то, сколько часов агент способен проработать без остановки, а сложность задачи, которую он решает с заданной вероятностью. Сама по себе эта метрика не показывает, сколько часов агент способен работать автономно, и METR предупреждает об этом прямо. Вдобавок тесты построены в основном на задачах по программированию, машинному обучению и кибербезопасности — то есть на работе с кодом и формальными системами, а не на обычной офисной рутине.

Второй пример — исследование ResearchGym. Агент на базе GPT-5 улучшил исходные результаты лишь в одной оценке из пятнадцати, а в среднем выполнил 26,5% подзадач. Это эксперимент на конкретном наборе исследовательских задач, и переносить его выводы на все агентные системы неправильно. Но разрыв, который он показывает, узнаваем: каждый отдельный шаг агент вроде бы умеет делать, а довести цепочку до стабильного результата не получается.

Отдельная осторожность нужна с цифрами из материалов самих компаний. Anthropic описывала запуск Claude Code, который, по утверждению компании, семь часов автономно работал над задачей в библиотеке vLLM. Это впечатляющий пример для узкого технического сценария, но как доказательство того, что агенты стали универсальными работниками, он не работает. И здесь же полезно развести четыре вещи, которые постоянно смешивают: демонстрацию, пилот, производственную автоматизацию и полностью автономную работу. Это разные степени свободы и разные требования к контролю.

Где агенты реально приносят пользу

Самая убедительная область — программирование. Код можно запустить, протестировать и проверить автотестами, поэтому именно здесь агент чаще всего выходит за рамки красивой демонстрации. Но и тут один удачный прогон не равен способности вести большой продуктовый проект без присмотра: разовая задача и месяцы сопровождения — разные истории.

Браузерные сценарии полезны в том же ключе, в каком полезен аккуратный исполнитель на простых поручениях: собрать данные, перенести информацию, подготовить черновик. Слабые места предсказуемы — авторизация, нестандартный интерфейс, изменившаяся страница и любое действие, которое нельзя отменить.

В клиентской поддержке и работе с CRM агенты способны классифицировать обращения, извлекать данные, готовить ответ и обновлять карточку клиента. Граница проходит там, где начинается ответственность: компенсация, спорный возврат, юридически чувствительная формулировка, нестандартная эскалация. На таких шагах появляются ограничения и подтверждение человеком. Показательно, что бенчмарк CRMArena построен вокруг девяти задач клиентской поддержки в ролях сервисного специалиста, аналитика и менеджера: оценивать агента имеет смысл не по отдельному действию вроде «найди письмо», а по работе внутри профессиональной роли и системы.

Общий вывод по этой части простой: польза есть там, где результат проверяем, шаг ограничен, а ошибку можно откатить.

Дело не только в модели

Разговоры об агентах обычно упираются в качество модели, хотя упираются они в инфраструктуру. Опрос Google Cloud среди 1402 ИТ-руководителей показал: 83% организаций заявили, что им нужны обновления инфраструктуры для производственных автономных систем, а четыре из пяти назвали безопасность, управление или MLOps одними из главных препятствий к масштабированию. Агенту нужно многое помимо умения рассуждать: доступы, журналы действий, разграничение полномочий, отказоустойчивость, контроль стоимости прогона.

С управлением ситуация ещё интереснее. По опросу Deloitte среди 3235 руководителей из 24 стран, о зрелой модели управления агентными системами сообщил только 21% респондентов — при том что 74% ожидают, что к 2027 году их организации будут использовать ИИ-агентов хотя бы умеренно. Это ожидания участников опроса, а не статистика будущего внедрения, и «использовать умеренно» вовсе не означает передать агенту самостоятельную ответственность. Но зазор между желанием внедрить и готовностью контролировать виден отчётливо.

Здесь же стоит сказать про человеческую проверку. Её часто показывают как временный костыль, который исчезнет, когда модели поумнеют. В производственной автоматизации это не костыль, а часть архитектуры безопасности и ответственности. Рабочая схема выглядит примерно так: агент собирает контекст, предлагает действие, система проверяет его по правилам, человек подтверждает рискованный шаг, результат уходит в журнал. Скучно, зато предсказуемо.

Проверять агентов разумно в той же логике — на своих задачах, с тестовым сценарием, контрольными точками и логом действий. Если хочется разбирать такие сценарии на практике, можно заглянуть в GPT-Лабораторию — она есть в Telegram и во ВКонтакте.

Как отличить производственный контур от демонстрации

Дальше — набор вопросов, которые стоит задавать к любому впечатляющему видео. Это серийный продукт или прототип? Доступен ли он обычным пользователям или только авторам демонстрации? Показана ли работа в контролируемых условиях? Известны ли реальные ограничения, а не только удачный сценарий? Подтверждал ли результат кто-то независимый? И главное: что происходит при ошибке и кто её разбирает?

Про надёжность стоит помнить конкретную деталь. В системной карте Operator от OpenAI компьютерно-использующая модель показывала 38,1% успешных выполнений в OSWorld — бенчмарке задач, требующих работы с полноценным компьютером. Там же было прямо сказано, что модель недостаточно надёжна для автоматизации таких задач и желателен человеческий контроль. Это результат конкретного теста на момент публикации, а не приговор всем современным моделям. Но привычка сверять красивый процент с тем, что именно измеряли, экономит много времени.

И ещё одно: прогнозы вендоров не стоит читать как нейтральный консенсус рынка. Отчёты компаний об агентном программировании включают собственные кейсы и видение компании, поэтому нейтральным консенсусом рынка они не являются. Опросы — это мнения и ожидания респондентов. Ни то, ни другое не равно подтверждённой статистике того, что уже произошло.

На мой взгляд, главная ошибка в разговорах об агентах — ждать, что виртуальный сотрудник появится в тот момент, когда модель прибавит несколько процентов в очередном бенчмарке. Скорее всего, произойдёт это иначе: сначала вокруг агента достроят контур — с полномочиями, памятью, журналами и понятной ценой ошибки. Пока контур достраивают, агент остаётся полезным исполнителем ограниченных процедур. Это не то, что обещали, но и не так мало.