GPT-6 Astra: я дал ей реальный аудит бизнеса вместо бенчмарка. Это уже AGI?

3 сентября OpenAI выпустила GPT-6 Astra и назвала её своей самой способной моделью для сложной сквозной работы: исследований, программирования, работы с браузером и компьютером, научных задач и многошаговых профессиональных процессов. В официальных тестах цифры местами выглядят так, будто кто-то опять забыл подкрутить сложность: 97,6% на FrontierMath Tier 4, 99,9% на ARC-AGI-3, заметный скачок в computer use и инженерных задачах.

Почти сразу вокруг модели начались разговоры про AGI. Президент OpenAI Грег Брокман заговорил об «эре AGI», а глава NVIDIA Дженсен Хуанг сформулировал ещё проще:

AGI has arrived.

То есть «AGI уже здесь».

Ну хорошо.

Я решил поступить проще.

Не спрашивать Astra, осознаёт ли она себя, не просить решить головоломку и не любоваться бенчмарками. Я дал ей кусок настоящего работающего бизнеса, с которым сам уже несколько дней не мог окончательно разобраться.

И сказал примерно:

Вот система. Вот проблема. Иди копай.

Результат получился намного интереснее очередных 99,9%.

Сначала важно разобраться, что именно я тестировал

GPT-6 Astra — это модель.

А ChatGPT Work, через который я её запускал, — уже агентная среда. Work предназначен для длинных многошаговых задач: он может работать с файлами, исследовать материалы, использовать инструменты и доводить достаточно большую работу до готового результата, а не просто отвечать одним сообщением. OpenAI отдельно разделяет обычный Chat и Work именно по этому принципу.

Это важное уточнение, потому что иначе очень легко сказать:

Astra сама полезла во все файлы и провела аудит.

Технически правильнее:

модель Astra работала внутри агентной среды Work, которая дала ей возможность выполнить длинную последовательность действий.

В реальной работе, впрочем, пользователю это различие постепенно становится всё менее интересным.

Мне не особенно важно, какая часть системы открыла файл, какая решила его прочитать, а какая связала найденное с рекламной статистикой.

Мне нужен результат.

А задача у меня была не игрушечная

У меня есть собственная платформа Market-GPT. Среди прочего она умеет формировать семантику и рекламные кампании для Яндекс Директа.

С этим блоком давно оставалось ощущение:

что-то здесь не так.

Ключевых фраз система могла получить вполне приличное количество. Формально всё выглядело неплохо. Есть коммерческие запросы, частотности, группы, фильтрация мусора.

Но реальный целевой трафик получался хуже, чем хотелось.

И постепенно у меня сформировалась гипотеза:

количество ключевых фраз вообще не равно ширине охваченного покупательского спроса.

Можно иметь пятьдесят запросов и фактически обслуживать два намерения пользователя.

Особенно хорошо это было видно на отоплении

Допустим, система собрала десятки ключевых фраз.

Смотришь поверхностно:

Отлично. Семантика широкая.

Начинаешь читать внимательнее — и оказывается, что огромное количество запросов представляет собой вариации одного и того же намерения:

монтаж отопления цена;

стоимость монтажа отопления;

монтаж отопления сколько стоит;

цена установки отопления;

стоимость работ по монтажу отопления.

Формально пять ключей.

С точки зрения покупательского спроса — практически один.

А где:

проектирование;

замена системы;

отопление частного дома;

монтаж котельной;

тёплый пол;

переделка старой системы;

запуск отопления под ключ?

Вот это уже разные потребности.

И именно здесь я отправил Astra разбираться в архитектуре.

Причём специально запретил ей что-либо чинить

Мне не хотелось получить знакомый агентный эффект:

Я заметил проблему и заодно улучшил вам половину проекта.

Спасибо.

Не надо.

Задача была именно исследовательская: не менять код, рекламные кампании или настройки, а выяснить, почему система может иметь много ключевых фраз и одновременно плохо покрывать разные коммерческие намерения.

Это, кстати, довольно хороший тест для агента.

Сильный исполнитель должен уметь не только что-нибудь сделать.

Иногда он должен уметь ничего не трогать и сначала разобраться.

Первое, что мне понравилось: Astra не остановилась на очевидном

Примитивный аудит мог закончиться так:

Нужно добавить больше ключевых слов и расширить семантику.

Ну спасибо.

За такую консультацию ещё обычно денег просят.

😁

Astra полезла глубже — в сам механизм, который создаёт ключи.

И довольно быстро обнаружила архитектурную причину того, что я наблюдал уже на выходе.

Система работала слишком сильно вокруг seed-фраз, а расширение одного seed генерировало большое количество близких формулировок.

В итоге количество строк росло значительно быстрее, чем количество реальных пользовательских намерений.

То есть проблема оказалась не в количестве

Представим seed:

монтаж отопления.

Дальше генератор начинает создавать коммерческие варианты:

монтаж отопления цена;

стоимость;

заказать;

услуги;

недорого;

под ключ.

Получилось шесть фраз.

Теперь другой seed:

установка отопления.

И снова:

цена;

стоимость;

заказать;

услуги.

Формально семантика стала больше.

А с точки зрения реального рынка мы продолжаем топтаться вокруг человека, который уже ищет услугу монтажа и сравнивает цену.

Это именно та ошибка, которую глазами видно уже после генерации.

Astra показала, почему система сама постоянно к ней приходит.

И вот здесь аудит стал полезным.

Потом нашлась ещё более неприятная вещь — общий лимит

Генерация ведь не бесконечная.

Где-то существует ограничение:

хватит, ключей уже достаточно.

И если seeds обрабатываются последовательно, ранние получают возможность породить множество вариантов, а до поздних система иногда добирается уже почти с заполненным лимитом.

Получается очень забавная механика.

Первый коммерческий смысл рождает:

цена;

стоимость;

сколько стоит;

заказать;

услуги;

монтаж цена;

монтаж стоимость.

А какой-нибудь действительно новый покупательский сценарий, стоящий ниже в списке seeds, может вообще не получить нормального развития.

То есть разнообразие спроса зависит от порядка строк в промежуточном массиве.

Вот это уже не «давайте сделаем ключи лучше».

Это нормальная архитектурная находка.

Astra связала несколько уровней проблемы

Вот это, пожалуй, было самым ценным.

Она не просто нашла кусок кода и сказала:

здесь лимит.

Получилась причинная цепочка:

плоский список seeds → последовательное расширение → множество вариаций первых намерений → общий лимит → поздние намерения получают меньше места → в финальной кампании много ключей, но мало разных причин купить.

Именно такая цепочка уже позволяет что-то проектировать.

Потому что решение становится другим.

Не:

добавить ещё 50 ключей.

А:

сначала построить карту разных покупательских намерений и гарантировать представительство каждого из них, а уже потом размножать формулировки внутри намерения.

Это совершенно разные архитектуры.

Нашлась и вторая проблема: «коммерческий запрос» ещё не означает «наш клиент»

Система умеет фильтровать информационный мусор.

Это хорошо.

Но фраза может быть совершенно коммерческой и при этом относиться не к тому продукту, который продаёт конкретный проект.

Например, запрос содержит:

купить;

цена;

заказать;

стоимость.

Формальный классификатор счастлив:

Отличный коммерческий спрос!

А человек собирался купить соседний продукт.

И если проверка коммерческого намерения происходит сильнее, чем проверка соответствия конкретному предложению, мусор становится очень качественным.

Не информационный.

Коммерческий мусор.

И он особенно неприятен, потому что внешне выглядит великолепно.

Вот здесь Astra начала вести себя уже не как чат-бот

Чат-бот в моём понимании — это система, которой нужно постоянно держать за руку.

Дай файл.

Теперь посмотри этот участок.

Теперь сравни с этим.

А здесь что?

А теперь сделай вывод.

Work с Astra получила большую задачу и начала сама строить маршрут исследования.

Не идеально. Не магически. Но ощущение было уже другое: я скорее ждал отчёт от специалиста, чем продолжал обычный диалог с нейросетью.

Именно это мне кажется самым важным изменением поколения.

Не насколько красивее модель отвечает.

А насколько большой кусок незнакомой работы ей можно отдать одним поручением.

OpenAI как раз продаёт Astra именно через эту идею

В официальном описании компания делает акцент на hardest end-to-end work — сложной работе от исходного задания до законченного результата. Astra улучшена в программировании, исследованиях, computer use, браузере, научных и профессиональных задачах и умеет адаптироваться, когда пользователь меняет требования уже в процессе.

Это немного другой критерий прогресса.

Раньше модели соревновались:

кто лучше ответит?

Теперь всё больше:

кому можно поручить работу и уйти?

Мне этот критерий нравится значительно больше.

Потому что именно за него бизнес в итоге готов платить.

И результаты официальных тестов действительно впечатляют

На ARC-AGI-3 OpenAI показывает для Astra 99,9%. На FrontierMath Tier 4 — 97,6%. На Terminal-Bench 4.0, проверяющем работу в терминальной среде, Astra получила 57,9% против 37,3% у GPT-5.6 Sol. В длинном контексте между 512 тысячами и миллионом токенов она набрала 96,3% на внутреннем MRCR-тесте OpenAI против 73,8% у Sol.

Есть ещё одна цифра, которая уже звучит менее уютно.

Astra стала первой системой OpenAI, достигшей Critical по кибервозможностям в Preparedness Framework. Компания утверждает, что с нужными инструментами и доступом модель способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищённых системах без постоянного руководства человека.

То есть рост агентности уже перестал быть только вопросом:

Как удобно, она сама заполнила Excel.

В какой-то момент самостоятельность становится вопросом безопасности.

Но знаменитые 99,9% на ARC-AGI требуют звёздочки размером с дом

Это прекрасный пример того, почему я не люблю объявлять AGI по одной цифре.

ARC Prize независимо опубликовала более подробные результаты Astra на ARC-AGI-3.

С адаптером OpenAI, который сохраняет скрытое состояние рассуждения между запросами и использует специальную компактификацию контекста, действительно получается 99,9%.

Но на стандартном harness ARC Prize результат составил 62,7%.

62,7 — всё равно очень серьёзно.

Только звучит уже немного иначе, чем:

тест на AGI практически закрыт.

То есть даже для одной и той же модели результат сильно зависит от того, какую среду и память вокруг неё построили.

Очень знакомо после моего теста с Work.

И это возвращает нас к вопросу: где вообще заканчивается модель и начинается система?

Astra без инструментов — одно.

Astra с браузером — другое.

Astra в Work, способная исследовать файлы и вести длинный процесс, — уже третье.

Добавляем память, компьютер, внешние приложения, возможность писать и запускать код — получается система, которая функционально умеет значительно больше, чем «нейросеть» как отдельный объект.

С человеком ведь происходит примерно то же самое.

Посадите специалиста голым в пустой комнате без компьютера, интернета и документов.

Его профессиональная производительность внезапно слегка уменьшится.

Поэтому, возможно, искать AGI исключительно внутри весов одной модели вообще постепенно становится неправильным вопросом.

Но некоторые бенчмарки Astra всё ещё совсем не закрыла

На Humanity’s Last Exam с инструментами OpenAI показывает 57,2%.

Причём Claude Fable 5.1 в той же таблице получает 65%. На части coding-тестов Astra тоже не уничтожает всех конкурентов: где-то лидер, где-то результаты близкие, а где-то другой модельный класс оказывается немного впереди. (OpenAI)

Это важно.

Перед нами не машина:

дайте любую интеллектуальную задачу, человек больше никогда не нужен.

Есть огромный скачок.

Но есть и довольно большое пространство ошибок.

Кстати, лимиты я почувствовал значительно раньше AGI

Astra оказалась прожорливой.

OpenAI предупреждает, что в Work и Codex она может расходовать включённый лимит быстрее GPT-5.6 Sol; конкретное потребление зависит от задачи, размера контекста, reasoning и режима работы.

У меня это проявилось очень практично.

Первый большой проход аудита уткнулся в лимит.

Пришлось остановиться, дождаться восстановления и продолжать позже.

То есть будущее наступило.

Но пока выдаётся порционно.

😁

И это не мелочь. Если мы говорим об AI как о настоящем сотруднике, вопрос стоимости вычислений и доступного времени работы становится примерно аналогом зарплаты и рабочего графика.

А теперь главный вопрос: это уже AGI?

Здесь сначала придётся испортить красивую дискуссию.

У AGI нет единого общепринятого определения.

Для одного человека AGI — система, способная выполнять большую часть экономически полезной интеллектуальной работы человека.

Для другого — интеллект, который устойчиво переносит знания между совершенно новыми областями, самостоятельно учится и действует в мире.

Для третьего AGI почему-то обязательно должно иметь сознание, внутреннее «я» и однажды спросить:

Зачем вы меня создали?

Три совершенно разные планки.

Поэтому два человека могут посмотреть на одну Astra и совершенно честно прийти к противоположным выводам.

Если использовать экономическое определение — разговор стал очень серьёзным

Возьмём практический критерий:

способна ли система выполнять широкий набор сложных интеллектуальных работ, для которых раньше нужен был квалифицированный человек?

После моего теста я уже не могу просто ответить:

нет.

Она получила довольно специализированную задачу из маркетинга, программной архитектуры и рекламных систем.

Не была специально обучена на Market-GPT.

Не знала проект заранее.

Должна была понять его структуру, разобраться в генерации семантики, сопоставить код с наблюдаемым результатом и построить причинное объяснение.

И она это сделала достаточно хорошо, чтобы найденные проблемы имело смысл брать в работу.

Для одного конкретного кейса это уже очень похоже на работу квалифицированного специалиста.

Но одного хорошего аудита для AGI явно недостаточно

Я могу дать превосходному программисту аудит Яндекс Директа — и он ничего полезного не скажет.

Это не значит, что программист неразумен.

Просто интеллект ещё включает опыт, специализацию и контекст.

Чтобы я сам начал уверенно использовать слово AGI, мне хочется увидеть несколько вещей одновременно.

Не красивую демонстрацию, а устойчивость.

Десятки разных областей.

Длинные задачи.

Незнакомая среда.

Ошибки и восстановление после них.

Способность понять, что выбранный путь плохой, и самостоятельно сменить его.

И главное — высокий процент успеха не в подготовленном benchmark, а в реальной грязной работе.

Вот именно последняя часть пока исследована значительно хуже.

Astra всё ещё способна ошибаться

Это легко забыть после красивых результатов.

Даже OpenAI при релизе отдельно добавила для Astra мониторинг ситуаций, когда агент мог неверно понять инструкции или выйти за предполагаемую область задачи. В некоторых случаях работа может специально приостанавливаться, чтобы человек проверил происходящее.

Сам факт появления такой системы контроля очень показателен.

Если бы перед нами был просто улучшенный чат-бот, не понадобилось бы настолько серьёзно думать о том, куда он самостоятельно пошёл после вашей команды.

Но необходимость контроля одновременно показывает и ограничение.

Мы ещё не в состоянии:

держи компанию, увидимся через год.

И, думаю, какое-то время не будем.

Я бы назвал Astra не AGI, а первым очень убедительным кандидатом на «практический общий интеллект»

Это не научный термин.

Просто мне он кажется полезнее.

Модель уже не выглядит как специализированный инструмент:

пишет тексты;

пишет код;

отвечает на вопросы.

Она способна соединять исследование, код, документы, браузер, инструменты и рассуждение внутри одной большой задачи.

А главное — самостоятельно выбирать промежуточные действия.

Вот это слово «общий» становится всё более оправданным.

Но слово «надёжный» я бы пока добавлял осторожно.

И сознание здесь вообще ни при чём

Я знаю любимую версию AGI:

пока не осознаёт себя — никакой AGI.

Она философски привлекательна.

Только практически почти бесполезна.

Мы не знаем хорошего теста на субъективное сознание даже для AI, который умеет очень убедительно о нём разговаривать. Языковая модель прекрасно способна сказать:

Я чувствую страх перед выключением.

Это пока не доказывает наличие страха.

Поэтому в бизнесовой плоскости мне гораздо интереснее другое:

что система способна самостоятельно сделать?

Если она может заменить значительную часть интеллектуальной работы человека, экономике будет совершенно всё равно, медитирует ли она ночью о смысле жизни.

Именно поэтому Astra кажется мне важнее многих предыдущих релизов

GPT-4 удивлял качеством разговора.

Reasoning-модели — способностью долго думать над сложной задачей.

Computer use дал моделям глаза и мышку.

Агенты научились связывать несколько действий.

Astra пытается собрать всё это в одну систему, которой можно поручить результат.

И в моём маленьком эксперименте это действительно почувствовалось.

Я не сидел рядом с ней и не диктовал:

открой этот файл;

найди эту функцию;

теперь сравни вот эти два массива.

Я обозначил проблему.

А работа дальше стала в значительной степени её проблемой.

Вот этот момент и кажется мне настоящей границей.

До сих пор AI в основном усиливал специалиста

Программист пишет код быстрее.

Маркетолог быстрее анализирует.

Редактор быстрее редактирует.

Исследователь быстрее ищет информацию.

С агентами появляется следующая ступень:

человек формулирует цель, а AI сам выполняет значительную часть профессии между целью и результатом.

Не всегда.

Не идеально.

Но уже достаточно хорошо, чтобы этот сценарий перестал быть лабораторным.

И если тенденция продолжится ещё несколько поколений, спор:

это уже AGI или только очень мощный агент?

может оказаться примерно таким же важным, как спор:

смартфон — это компьютер или всё-таки телефон?

Пока спорили, он просто съел половину устройств вокруг себя.

Забавно, что сам ARC-AGI показывает примерно то же самое

ARC-AGI создавался именно как попытка проверять способность решать новые задачи, а не воспроизводить выученные шаблоны.

У Astra исследователи ARC Prize наблюдали интересное поведение: модель превращала незнакомые среды в компактные символические модели, сама формулировала правила мира и даже создавала собственные сокращения для отслеживания состояний и планирования.

Вот это уже намного интереснее обычного:

модель видела похожую задачу в интернете.

Она должна сначала разобраться:

что это за мир вообще?

А затем действовать.

Именно такая адаптивность всегда была одной из вещей, которые мы хотели получить от общего интеллекта.

Поэтому Дженсен Хуанг, возможно, не совсем сошёл с ума

Когда он пишет:

AGI has arrived,

это, конечно, великолепная фраза для человека, чья компания продаёт железо, на котором весь этот AGI обучают.

Некоторый конфликт интересов присутствует.

Совсем крошечный.

😁

Но я уже не могу отмахнуться:

маркетинговая ерунда, нам ещё двадцать лет.

Граница действительно стала размытой.

И если принять достаточно практичное определение AGI, можно аргументированно сказать:

мы как минимум вошли в серую зону, где вопрос уже перестал быть смешным.

Я всё-таки пока голосую: не AGI. Но очень близко к тому, что для бизнеса разницы скоро не будет

Почему не AGI?

Потому что мне пока недостаточно устойчивости.

Недостаточно доказательств действительно общего переноса навыков в любую новую область.

Слишком важна агентная обвязка.

Слишком заметно влияние конкретной среды и harness — те же 62,7 против 99,9% на ARC-AGI-3 это прекрасно показывают.

Есть задачи, которые Astra всё ещё не решает.

Есть ошибки.

Есть лимиты.

Есть необходимость человеческого контроля.

Но теперь вторая половина ответа значительно важнее.

Мне уже не особенно важно, называется ли это AGI

Вот система получила кусок моей компании, несколько часов самостоятельно в нём ковырялась и принесла мне находки, которые помогают принимать реальные решения.

Что именно мне даст официальный сертификат:

Поздравляем. Теперь это Artificial General Intelligence?

Ничего.

Если следующий такой агент сможет самостоятельно:

проверить рекламную систему;

найти проблему;

предложить архитектуру;

внести согласованные изменения;

протестировать;

выкатить;

через неделю оценить реальные результаты —

мне будет совершенно всё равно, получил ли он 99,9% на ARC-AGI.

Я просто перестану нанимать человека на значительную часть этой работы.

Вот где проходит настоящая экономическая граница.

И я думаю, именно поэтому следующие пару лет будут очень странными

Мы привыкли ждать один большой момент:

AGI СОЗДАН.

Красная бегущая строка.

Сам Альтман выходит на сцену.

Робот открывает глаза.

Музыка Ханса Циммера.

В реальности всё может произойти гораздо скучнее.

Сначала AI сам проведёт аудит.

Потом подготовит рекламную кампанию.

Потом исправит код.

Потом проведёт исследование рынка.

Через какое-то время владелец бизнеса поймает себя на мысли:

Подождите. А что из обычной офисной интеллектуальной работы он ещё не умеет?

И только потом мы начнём спорить, в какой именно день AGI всё-таки появилось.

Причём я собираюсь продолжать проверять Astra именно так

Не загадками.

Не вопросами:

сколько букв R в strawberry?

Таких тестов достаточно и без меня.

Мне интереснее отдавать ей грязные реальные задачи, где нет заранее подготовленного ответа.

Код.

Маркетинг.

Аналитику.

Архитектуру.

Противоречивые данные.

Там довольно быстро становится понятно, перед тобой очередная модель, которая великолепно сдаёт экзамены, или уже настоящий рабочий инструмент.

Такие эксперименты я как раз продолжаю собирать в GPT-Лаборатории — там удобнее показывать промежуточные результаты, провалы и то, что в длинную статью вообще не попадает: Telegram GPT-Лаборатории, ВКонтакте и MAX.

Потому что с Astra мне теперь интереснее не выяснять:

умнее ли она предыдущей на 17 процентов?

А проверять:

насколько большой кусок моей работы я могу ей отдать и больше туда не лезть?

После первого теста ответ уже немного тревожный

Аудит семантики я вполне мог бы заказать специалисту.

Нужно найти человека.

Объяснить систему.

Дать доступ.

Подождать.

Потом несколько раз обсудить детали.

Astra получила задачу практически сразу и действительно нашла вещи, которые стоило исследовать дальше.

При этом я не готов отдать ей проект целиком и уехать на море.

Это хорошо описывает нынешнее положение дел.

Не искусственный сотрудник, которому можно полностью довериться. Но уже и не инструмент, которым человек вручную выполняет каждое действие.

Что-то между.

И именно это «между», на мой взгляд, сейчас важнее самого слова AGI.

Может оказаться, что AGI вообще не будет отдельным изобретением

Мы просто однажды обнаружим, что переступили границу.

Модели стали видеть.

Потом пользоваться инструментами.

Потом писать программы.

Потом работать за компьютером.

Потом вести длинные процессы.

Потом самостоятельно исправлять ошибки.

Каждая отдельная ступень выглядит:

ну, ещё не AGI.

А потом складываем их вместе.

И перед нами система, которой можно дать незнакомую бизнес-задачу и через некоторое время получить внятный профессиональный отчёт.

И тогда возникает слегка неудобный вопрос:

А чего именно мы ещё ждём?

У меня пока есть несколько ответов: надёжности, автономного обучения, лучшего переноса навыков, меньшей зависимости от обвязки и значительно более предсказуемого поведения.

Поэтому табличку AGI я Astra пока не выдаю.

Но впервые мне кажется, что спор уже идёт не о фантастике.

Он идёт о критериях.

А это очень большая разница.

Пять лет назад вопрос был:

когда AI сможет выполнять работу квалифицированного специалиста?

Теперь я дал ему такую работу.

И он её выполнил.

Не всю.

Не без ограничений.

Но достаточно хорошо, чтобы следующим моим вопросом стало уже не:

«Может ли он?»

А совсем другое:

«Что ему дать проверить дальше?»