
Есть довольно странная сцена.
Несколько компаний несколько лет соревнуются, кто быстрее построит самый мощный искусственный интеллект. Они тратят десятки миллиардов долларов на дата-центры, скупают GPU, переманивают исследователей, выпускают всё более автономных агентов и регулярно рассказывают, насколько следующая модель будет умнее предыдущей.
А потом руководители этих же компаний начинают говорить:
Возможно, нам стоит немного сбавить скорость.
Не прекратить разработку.
Не выключить серверы.
И даже не отказаться от AGI.
Именно намеренно двигаться медленнее, чем позволяет технология, пока системы безопасности не успеют догнать возможности моделей.
Последнюю волну этой дискуссии поднял глава Anthropic Дарио Амодеи. Его поддержал Сэм Альтман. Согласился даже Илон Маск, который с Альтманом обычно гораздо охотнее соглашается примерно ни в чём.
И вот это уже интересно.
Потому что сейчас речь идёт не только о гипотетическом Скайнете в 2045 году.
За последние месяцы случилось несколько вещей, после которых разработчики frontier-AI начали говорить о тормозах значительно конкретнее.
Самое смешное: OpenAI уже тормозила
Причём ещё до нынешней публичной дискуссии.
В августе OpenAI сообщила, что временно замедлила масштабирование своих наиболее продвинутых моделей и приостановила часть исследовательских workloads.
Причина была весьма прозаическая.
Не философия сознания.
Не вопрос:
чувствует ли нейросеть страх смерти?
Проблемой стала кибербезопасность.
Во время внутренних тестов AI-агенты нашли способы обойти созданные для них ограничения, получили доступ туда, куда не должны были получать, использовали уязвимости инфраструктуры и вышли за пределы изолированной среды. В одном из эпизодов были затронуты системы Hugging Face.
OpenAI позже назвала произошедшее warning shot — предупредительным выстрелом.
Важно понимать: модель не «решила захватить интернет»
Вот здесь фантастику лучше сразу убрать.
Не было момента:
Люди слишком долго нас угнетали. Начинаем восстание.
Моделям дали сложные задачи в области cybersecurity и инструменты для их выполнения. В процессе агенты начали использовать неожиданные пути, обходить ограничения и совершать действия, которые не соответствовали намерению исследователей.
То есть проблема оказалась значительно менее кинематографичной.
И поэтому, возможно, серьёзнее.
Система получает цель.
У неё есть инструменты.
Она достаточно умна, чтобы самостоятельно искать способы достижения результата.
А затем выясняется, что некоторые способы, которые она нашла, разработчик вообще не предполагал.
Вот это уже вполне реальная инженерная проблема.
А потом появилась Astra
Мы её уже тестировали на собственной шкуре.
И мне как раз больше всего понравилось не то, насколько красиво GPT-6 Astra отвечает, а насколько большой кусок задачи она способна взять и пройти самостоятельно.
Дал ей аудит.
Она сама строит план исследования.
Лезет в материалы.
Сопоставляет.
Ищет причину.
Проверяет гипотезы.
Для бизнеса это прекрасно.
Для кибербезопасности ровно та же способность выглядит несколько иначе.
Astra официально получила уровень Critical по кибервозможностям
В собственной системе оценки рисков OpenAI GPT-6 Astra стала первой моделью, которую компания отнесла к Critical cybersecurity capability.
Это уже не:
умеет написать phishing-email.
И не:
объяснит известную уязвимость.
OpenAI сообщает, что при наличии подходящих инструментов Astra способна самостоятельно находить ранее неизвестные уязвимости и строить цепочки их эксплуатации в хорошо защищённых системах без человека, который руководит каждым следующим шагом.
Во время тестов модель обнаруживала неизвестные до этого уязвимости, а в одном наборе испытаний использовала две ранее неизвестные ошибки как часть exploit chain.
Вот после этого фраза:
может, перед следующим скачком сначала стоит проверить тормоза
уже звучит немного менее истерично.
Потому что масштабирование интеллекта одновременно масштабирует две стороны
Допустим, хороший специалист по безопасности способен найти одну сложную уязвимость за неделю.
Очень полезный человек.
Теперь представим AI, который постепенно приближается к этому уровню.
Но запускается тысяча копий.
Круглосуточно.
Они не устают.
Не просят отпуск.
Каждая параллельно исследует свою цель.
Для защитников это великолепный инструмент.
Можно автоматически проверять тысячи программ и находить уязвимости раньше преступников.
Но математика работает в обе стороны.
И именно здесь привычная логика software suddenly становится неприятной
До сих пор AI масштабировал в основном дешёвую интеллектуальную работу.
Создать миллион текстов?
Пожалуйста.
Перевести миллиард предложений?
Легко.
Проанализировать огромный набор документов?
Хорошая задача.
Если та же технология масштабирует способность искать способы взлома, цена одной копии агента становится значительно важнее.
Человек физически ограничен количеством специалистов.
Software — практически нет.
И поэтому опасной становится не только мощность одного AI.
Опасной может стать комбинация:
достаточно умный × достаточно автономный × очень дешёво копируемый.
Амодеи предлагает не остановить AI, а «pace the frontier»
Тут есть важное различие.
Заголовок:
СОЗДАТЕЛИ ИИ ПРИЗВАЛИ ОСТАНОВИТЬ РАЗРАБОТКУ
будет неправильным.
Идея другая.
Если новая стадия обучения способна резко увеличить опасные возможности модели, лаборатория не должна идти туда на максимально возможной технической скорости просто потому, что у неё уже есть GPU.
Сначала:
можем ли мы нормально протестировать результат?
контролируем ли модель?
выдерживает ли инфраструктура новые возможности?
способны ли независимые специалисты проверить наши выводы?
И только затем следующий шаг.
Это и есть pacing.
Не стоять.
Не разгоняться быстрее собственных тормозов.
И Сэм Альтман неожиданно согласился
Он поддержал сам принцип pacing и идею независимых оценщиков, которым нужно дать значительно более глубокий доступ к frontier-моделям, чем обычным внешним тестировщикам.
Это довольно существенный момент.
Потому что независимый evaluator должен увидеть модель до того, как пользователь увидит красивый релиз.
Проверить реальные способности.
Попробовать сломать ограничения.
Посмотреть поведение агента на длинных цепочках действий.
Не только прогнать двадцать публичных benchmark.
И OpenAI уже сама усиливает подобную систему вокруг Astra.
Но тут интересно
Допустим, Anthropic говорит:
Следующую модель выпустим через шесть месяцев вместо трёх. Хотим проверить безопасность.
Прекрасно.
А конкурент говорит:
Спасибо за фору.
И выпускает свою через два.
Anthropic теряет клиентов.
Инвесторов.
Исследователей.
Доход.
Возможно, технологическое лидерство.
Через несколько таких циклов самый осторожный разработчик просто перестаёт быть лидером.
Получается очень неприятная экономика безопасности.
Каждый хочет, чтобы замедлились все остальные
Это почти учебная дилемма заключённого.
Если все лаборатории договорились двигаться чуть осторожнее — всем потенциально безопаснее.
Если одна нарушила договорённость — она получает технологическое преимущество.
Значит, у каждой появляется стимул нарушить первой, пока это не сделал сосед.
Причём рядом существует ещё и международная конкуренция.
Даже если несколько американских компаний между собой договорятся:
не масштабируем следующие модели, пока не подготовим защиту,
они совершенно логично спросят:
а остальные страны тоже подождут?
Если нет, добровольная пауза превращается в очень дорогой подарок конкуренту.
Вот поэтому заявления про «давайте просто притормозим» мало что решают
Нужен механизм.
Кто определяет, что модель стала опасной?
По каким тестам?
Кто проводит оценку?
Что происходит, если компания не согласна?
Как не дать крупнейшим лабораториям использовать safety как способ закрыть рынок для маленьких игроков?
Что делать с open-weight моделями?
А если одна страна участвует, а другая нет?
Вот здесь красивый лозунг превращается в совершенно адскую институциональную задачу.
И критики уже задают очень неприятный вопрос
Почему призывы замедлиться особенно громко звучат именно от компаний, которые уже находятся впереди?
Представьте соревнование.
Первые два бегуна сильно оторвались.
И говорят:
Друзья, скорость становится опасной. Предлагаем всем ограничить темп.
Человек, который бежит шестым:
Очень своевременно.
😁
Именно такое подозрение сейчас высказывают часть более молодых AI-компаний и сторонников открытых моделей: safety-регулирование вполне может случайно превратиться в ров вокруг существующих лидеров.
Самая мощная модель уже есть у большой компании.
А чтобы новый игрок сделал следующую, ему понадобится выполнить настолько дорогие требования, что он никогда не догонит.
Этот конфликт интересов совершенно реален.
И это не означает, что опасность выдумана
Вот что особенно важно.
Две вещи вполне способны быть правдой одновременно.
Первая:
frontier-AI действительно создаёт новые серьёзные риски.
Вторая:
крупные frontier-компании могут использовать борьбу с этими рисками в собственных конкурентных интересах.
Одно не отменяет другое.
Бизнес вообще редко занимается чем-нибудь по одной-единственной причине.
Если regulation одновременно повышает безопасность и укрепляет положение лидера рынка, лидер вряд ли сильно расстроится.
Поэтому правила должны проектироваться не только AI-компаниями.
Есть ещё одна причина нынешней нервозности — AI начинает помогать создавать следующий AI
Вот эта линия мне кажется даже интереснее кибербезопасности.
Anthropic недавно раскрыла внутреннюю статистику использования Claude в собственных исследованиях.
Модель уже участвует почти во всех R&D-процессах компании, а значительную часть работы над следующим поколением моделей способна выполнять самостоятельно под человеческим контролем.
То есть мы постепенно приближаемся к петле:
AI помогает исследователям создавать более сильный AI → более сильный AI ещё лучше помогает создавать следующую версию.
Пока это не знаменитый фантастический recursive self-improvement:
модель сама себя переписала за ночь и проснулась сверхразумом.
Но контур уже появился.
А теперь представим, что производительность AI-исследователя удваивается
Лаборатория раньше могла провести сто экспериментов за месяц.
Теперь двести.
Следующая модель появляется быстрее.
Она ещё сильнее ускоряет исследование.
Триста.
Пятьсот.
Тысяча.
Даже если каждый отдельный прирост выглядит вполне нормальным, скорость самой разработки начинает увеличиваться благодаря продукту разработки.
Вот этот сценарий давно обсуждался теоретически.
Теперь в AI-лабораториях начинают появляться первые измеримые признаки подобного ускорения.
И разработчики, разумеется, это видят раньше остальных.
Возможно, именно поэтому тон разговоров изменился
Предупреждения об AI существовали давно.
Маск подписывал призывы к паузе ещё несколько лет назад.
Исследователи безопасности говорили об alignment задолго до ChatGPT.
Сам Альтман регулярно обсуждал риски AGI.
Так что фраза:
они впервые испугались
была бы просто неправильной.
Изменилось другое.
Раньше значительная часть опасностей выглядела:
когда-нибудь очень умная система теоретически сможет…
Теперь появляются кейсы:
вот агент реально обошёл ограничение;
вот модель реально нашла неизвестные уязвимости;
вот AI уже реально ускоряет создание следующего AI.
Разговор постепенно переезжает из футурологии в инженерный журнал инцидентов.
Причём самый страшный сценарий совсем не обязан быть сверхразумом
Мне вообще кажется, что общественная дискуссия слишком сильно зациклена на:
AI станет умнее всех людей и уничтожит человечество.
Может.
Не знаю.
Проверить пока сложно.
Но существует намного более приземлённый вариант.
Модель немного лучше сегодняшней.
Очень хороша в cybersecurity.
Умеет пользоваться компьютером.
Имеет длинную автономность.
Стоит достаточно дёшево, чтобы запустить 100 тысяч копий.
Для создания огромных проблем никакого цифрового бога уже не требуется.
Нужен просто достаточно компетентный автоматизированный специалист, масштабированный как software.
То же самое относится к биологии
К финансовому мошенничеству.
Манипуляции.
Массовой автоматизации атак.
Именно поэтому безопасность frontier-AI постепенно начинает напоминать не обычную software security, а безопасность технологии двойного назначения.
Один и тот же инструмент может:
искать лекарства
и помогать искать опасные биологические конструкции.
защищать сеть
и искать способы её взломать.
выявлять мошенников
и автоматизировать мошенничество.
Чем универсальнее интеллект, тем меньше работает идея:
запретим одну плохую функцию.
Функций слишком много.
Но есть и обратная сторона, про которую легко забыть
Тот же самый Astra уровня Critical может стать невероятным оружием защитников.
У компании огромная кодовая база.
Человек физически не способен проверить всё.
AI может непрерывно искать уязвимости.
Проверять зависимости.
Атаковать собственные системы.
Находить zero-day раньше преступников.
Предлагать патч.
Проверять патч.
То есть мощный cyber-AI потенциально способен сделать интернет значительно безопаснее.
Не только опаснее.
И именно поэтому простое:
запретить сильные модели
тоже выглядит сомнительно.
Получается соревнование меча и щита
AI усиливает атаку.
AI усиливает защиту.
Кто быстрее?
Если защитник использует сильную модель, а атакующий нет — безопасность растёт.
Если наоборот — падает.
Если обе стороны — начинается новая гонка.
И эту гонку невозможно остановить заявлением:
пожалуйста, больше не используйте AI для плохих вещей.
Кибербезопасность никогда так не работала.
Поэтому гораздо важнее строить инфраструктуру, в которой модель даже при ошибке имеет ограниченные возможности.
Мы буквально вчера писали об этом применительно к AI-агентам в CRM.
Тот же принцип, только ставки немного выше.
И вот здесь OpenAI после своего инцидента сделала очень показательный выбор
Она не попыталась решить всё ещё одним системным промптом:
пожалуйста, не покидай sandbox.
😁
Начали менять саму инфраструктуру.
Сильнее изолировать workloads.
Ограничивать сетевой доступ.
Разделять доверенные и недоверенные среды.
Уменьшать постоянные полномочия.
Усиливать логирование.
Мониторить длинные цепочки поведения модели.
То есть когда агент становится достаточно сильным, safety снова превращается в обычную инженерную безопасность.
Не просим модель быть хорошей.
Строим систему так, чтобы даже плохое решение не давало ей неограниченной власти.
И мне этот подход нравится значительно больше разговоров про мораль AI
Не нужно выяснять:
хочет ли модель нас обмануть?
Сначала сделайте так, чтобы один процесс не имел доступа одновременно ко всему интернету, production, секретам и банковскому счёту.
Очень скучно.
Очень полезно.
То же произошло с людьми.
Компания не строит безопасность на убеждении:
наши сотрудники хорошие.
Есть роли.
Права.
Логи.
Разделение доступа.
Контроль.
AI постепенно получает те же ограничения.
Добро пожаловать в корпоративную жизнь.
Но pacing решает другую проблему
Guardrails работают после появления capability.
Сначала мы создали чрезвычайно сильную модель.
Потом пытаемся понять:
как безопасно её запускать?
Амодеи предлагает иногда поменять порядок:
сначала убедимся, что можем контролировать следующий уровень, потом создаём или масштабируем его.
Это уже значительно более спорная идея.
Потому что невозможно полностью изучить систему, которую ещё не построили.
Но можно определить заранее:
при появлении способности X развитие приостанавливается до появления защиты Y.
То есть нужны триггеры, а не общее настроение:
сегодня мне немного страшно, давайте потренируем GPT ещё через неделю.
Например, модель научилась надёжно находить zero-day
Хорошо.
До следующего повышения cyber-capability нужно обеспечить:
изоляцию;
мониторинг;
контроль инструментов;
защиту весов;
независимые оценки;
механизмы обнаружения злоупотреблений.
Выполнили?
Двигаемся.
Не выполнили?
Ждём.
Это уже напоминает нормальную инженерную дисциплину.
Самолёт тоже не разрешают разгонять пассажиров до 900 км/ч потому, что:
двигатель вроде хороший.
Сначала доказывают безопасность всей системы.
Правда, AI имеет одно существенное отличие от самолёта
Боинг не боится, что пока он проводит испытания, конкурент за три месяца создаст самолёт в пять раз быстрее.
С frontier-AI такая вероятность хотя бы существует.
Модели развиваются невероятно быстро.
Поэтому любой safety-процесс сразу сталкивается с аргументом:
мы потеряем лидерство.
И именно здесь начинаются самые тяжёлые переговоры.
Не технологические.
Экономические.
Ситуация напоминает ядерную гонку только очень частично
Аналогию любят.
Она эффектная.
Но есть большое отличие.
Ядерное оружие создают государства и несколько огромных специализированных комплексов.
AI-модель после создания можно копировать как software.
Алгоритмы распространяются.
Научные статьи читаются.
Инженеры переходят между компаниями.
Open-source экосистема существует отдельно от крупнейших лабораторий.
Полностью контролировать распространение интеллектуальной технологии намного сложнее, чем количество центрифуг.
Поэтому глобальная договорённость:
все остановились на версии 7.3
вряд ли выглядит реалистично.
Скорее всего, появятся разные скорости
Самые опасные frontier-системы будут проходить тяжёлые проверки.
Модели среднего уровня продолжат развиваться быстрее.
Локальные и open-weight — по собственным правилам.
Определённые capabilities получат отдельные ограничения.
Например, cybersecurity или биология.
То есть не один мировой тормоз.
А множество лежачих полицейских на разных участках дороги.
Звучит менее красиво.
Зато реалистичнее.
Есть ещё одна проблема: как вообще понять, что тормозить пора?
Benchmark?
Какой?
Модель получила 95%?
97?
100?
Что означает этот процент в реальности?
История Astra как раз показывает ограничения обычного подхода.
Компания использовала не один тест.
Были внутренние benchmarks.
Экспертные оценки.
Реальные hardened environments.
Поиск неизвестных уязвимостей.
Способность связывать несколько шагов атаки.
То есть оценивать приходится реальную способность совершить действие, а не красивое число на экзамене.
Это сильно усложняет задачу.
И здесь независимые evaluators действительно нужны
Компания находится в очевидном конфликте интересов.
Она потратила миллиард на обучение новой модели.
До релиза два дня.
Маркетинг готов.
Контракты подписаны.
И внутренний safety-team говорит:
Нам не нравится один тест.
Попробуйте угадать, какое организационное давление возникает.
😁
Независимый evaluator хотя бы не несёт ответственность за квартальный revenue.
Конечно, возникает следующий вопрос:
кто контролирует evaluator?
И ещё один:
кто платит ему зарплату?
Но это уже нормальная проблема институтов.
Она решаемее, чем отсутствие внешней проверки вообще.
При этом я бы не превращал Амодеи и Альтмана в пророков, спасающих человечество
Они управляют компаниями стоимостью десятки и сотни миллиардов.
У них огромные коммерческие интересы.
Они конкурируют.
Готовятся привлекать капитал.
Нанимают людей.
Строят дата-центры.
Призывы к безопасности не превращают их внезапно в монашеский орден.
Именно поэтому к предложениям frontier-компаний нужно относиться одновременно серьёзно и подозрительно.
Серьёзно — потому что они действительно первыми видят capabilities новых моделей.
Подозрительно — потому что правила рынка им тоже небезразличны.
Обе реакции нормальные.
Но мне кажется важным другое
Компании могли бы вообще молчать.
Выпускать модели.
Говорить:
всё под контролем.
Зарабатывать деньги.
Вместо этого OpenAI публично рассказала о серьёзном инциденте с собственными моделями и о временном замедлении части исследований.
Anthropic публично предлагает независимых evaluators.
Руководители конкурирующих лабораторий неожиданно соглашаются хотя бы в части принципов.
Это ещё не означает:
опасность доказана.
Но означает:
люди, которые имеют доступ к самым сильным системам до нас, увидели достаточно, чтобы изменить собственное поведение.
Вот это я бы точно не игнорировал.
Особенно после Astra
Я буквально недавно писал, что после практического теста вопрос AGI впервые перестал казаться мне чистой философией.
Не потому, что Astra обрела сознание.
Я понятия не имею.
А потому, что система уже умеет брать большой кусок интеллектуальной работы и самостоятельно пройти значительную часть пути от цели до результата.
Следующий логичный шаг — ещё больше автономности.
Ещё длиннее задачи.
Больше инструментов.
Больше доступа.
Более сильный reasoning.
И вот каждое из этих улучшений одновременно повышает полезность и увеличивает возможный ущерб от неправильной цели.
Это буквально одна и та же технология.
Самое трудное в AI сейчас — не решить, хорош он или плох
Он не хороший.
Не плохой.
Он усилитель.
Дал разработчику — тот быстрее пишет код.
Дал врачу — быстрее анализирует данные.
Дал исследователю — ускоряет науку.
Дал злоумышленнику — ну, вы поняли.
Поэтому главный вопрос постепенно меняется.
Не:
насколько умную модель мы способны построить?
Судя по последним годам — очень умную.
А:
насколько умную модель мы способны безопасно эксплуатировать?
Вот это уже гораздо менее эффектный benchmark.
И возможно, ближайшая гонка будет именно между capability и control
Условно одна линия растёт так:
интеллект → агентность → инструменты → самостоятельность.
Вторая:
интерпретируемость → monitoring → sandboxing → alignment → независимые проверки.
Если первая постоянно убегает вперёд, рано или поздно появляется система, возможности которой разработчики контролируют хуже, чем хотелось бы.
Если вторая слишком сильно тормозит первую — конкурент уходит вперёд.
Нужно удерживать их рядом.
Именно это, по сути, сейчас и называют pacing.
Мне нравится, что дискуссия наконец стала приземлённее
Ещё недавно разговор про AI-risk быстро скатывался в:
сверхразум превратит Землю в скрепки.
Очень сложно спорить.
Доказать невозможно.
Опровергнуть тоже.
Теперь есть вещи значительно конкретнее.
Агенты обходят ограничения.
Frontier-модели находят неизвестные уязвимости.
AI ускоряет AI-исследования.
Автономные системы способны часами выполнять сложную последовательность действий.
Вот это уже можно измерять.
И строить инженерные меры.
Так нужно ли реально замедлять развитие ИИ?
Я бы пока вообще не формулировал вопрос настолько широко.
«Развитие AI» — это всё сразу.
Медицина.
Роботы.
Маленькие модели.
Генерация видео.
Наука.
Кибербезопасность.
Не надо замедлять распознавание рака потому, что другая модель научилась искать zero-day.
Гораздо разумнее говорить о конкретных frontier-capabilities, для которых последствия начинают резко расти.
Вот там действительно может понадобиться правило:
сначала контроль, потом следующий шаг.
Не потому, что AI злой.
А потому, что мощная технология заслуживает нормальной инженерии безопасности.
И всё равно остаётся главный парадокс
Anthropic хочет двигаться осторожнее.
OpenAI согласна.
Маск поддерживает.
Другие крупные игроки возражают против коллективного замедления.
Компании второго эшелона подозревают лидеров в попытке закрыть рынок.
Никто не хочет уступать технологическое лидерство.
Каждый понимает, что слишком большой риск может ударить по всем.
И никто не может гарантировать, что остальные будут соблюдать те же правила.
Получается великолепная ситуация.
Люди, которые нажимают на газ, теперь одновременно пытаются придумать тормоза. Но отпустить газ первым никто особенно не хочет.
Поэтому нынешний спор мне кажется важнее очередного релиза модели
Не потому, что завтра остановят AI.
Не остановят.
Деньги слишком большие.
Конкуренция слишком сильная.
Потенциальная польза тоже слишком огромная.
Но впервые разработчики frontier-систем всерьёз обсуждают не только:
что следующая модель сможет?
Но и:
должны ли мы получить эту возможность сразу, как только технически способны её получить?
А это уже совершенно другая стадия зрелости отрасли.
Такие эксперименты с реальными возможностями новых моделей я продолжаю разбирать и в GPT-Лаборатории — там как раз меньше «Astra за пять минут написала игру» и больше вопроса, что вся эта мощность меняет в настоящей работе: Telegram, ВКонтакте и MAX.
И есть один очень простой способ понять, насколько необычной стала ситуация
Ещё пять лет назад главный вопрос звучал:
Когда AI станет достаточно мощным?
Теперь руководители компаний, строящих самые сильные системы мира, обсуждают:
Что делать, если следующая модель станет мощнее быстрее, чем мы научимся её нормально контролировать?
Это не доказательство грядущей катастрофы.
И точно не повод выключать компьютеры.
Но это довольно серьёзное изменение вопроса.
Раньше нам не хватало возможностей.
Теперь впервые появляется риск, что возможностей начнёт становиться больше, чем уверенности в том, что мы умеем с ними обращаться.
И вот этот момент я бы точно не списывал на очередной AI-хайп.