10 марта 2016 года в Сеуле Ли Седоль играл вторую партию против компьютерной программы AlphaGo.
Ли был одним из сильнейших игроков в го своего поколения, обладателем 18 международных титулов. За доской он провёл тысячи партий и видел такое количество игровых позиций, которое обычному человеку трудно представить.
На 37-м ходу AlphaGo поставил чёрный камень на правой стороне доски.
Комментаторы замолчали.
Один из профессионалов решил, что программа ошиблась. Ли Седоль вышел из игровой комнаты и после возвращения потратил почти пятнадцать минут, пытаясь понять, зачем компьютер вообще поставил камень именно туда. Европейский чемпион Фань Хуэй, который до этого сам проиграл AlphaGo пять партий подряд, описал происходящее примерно так: люди так не играют.
Спустя некоторое время стало ясно, что это была не ошибка.
Камень оказался именно там, где понадобился AlphaGo значительно позже.
Сегодня ход №37 считается одним из самых знаменитых моментов в истории искусственного интеллекта. Google DeepMind пишет, что вероятность увидеть подобный ход в партии профессионального человека составляла примерно один шанс из десяти тысяч.
Но самое интересное здесь даже не в том, что компьютер победил чемпиона.
Компьютеры уже побеждали людей.
В 1997 году Deep Blue обыграл Гарри Каспарова в шахматном матче. Настоящий шок от AlphaGo был другим: машина сделала сильный ход, который не укладывался в несколько тысяч лет накопленной человеческой игровой культуры.
И именно поэтому история хода №37 гораздо интереснее обычного:
компьютер опять оказался быстрее человека.
Почему вообще все так переживали из-за какой-то настольной игры
Правила го на удивление простые.
Есть доска 19×19 линий и камни двух цветов. Игроки по очереди ставят их на пересечения, пытаясь окружать территорию и группы камней соперника.
Научиться ставить камни можно довольно быстро.
Научиться хорошо играть — уже другая история.
В шахматах после каждого хода существует ограниченное количество разумных продолжений. Пространство вариантов всё равно огромное, но компьютеры постепенно научились сокращать его с помощью поиска, оценочных функций и колоссальной вычислительной мощности.
Deep Blue в 1997 году мог анализировать около 200 миллионов шахматных позиций в секунду. Вместе с хорошей оценочной функцией, базами шахматных знаний и специализированным железом этого хватило, чтобы победить действующего чемпиона мира.
С го такая стратегия очень долго не работала.
В го вариантов просто неприлично много
DeepMind оценивает количество возможных позиций на доске го примерно как 10^170.
Для сравнения: оценка количества атомов в наблюдаемой Вселенной находится где-то около 10^80.
То есть даже если очень сильно оптимизировать перебор, идея:
давайте компьютер просто посмотрит все варианты
заканчивается довольно быстро.
Причём проблема не только в количестве ходов. В шахматах машине относительно легко хотя бы приблизительно понять состояние позиции: сколько фигур осталось, кто контролирует пространство, безопасен ли король.
В го положение может выглядеть почти одинаково, но один незаметный камень способен через пятьдесят ходов определить судьбу огромной части доски.
Человек решает эту проблему с помощью того, что мы обычно называем интуицией.
Сильный игрок не перебирает миллион вариантов
Он смотрит на доску и почти сразу понимает:
здесь опасно;
эта группа слабая;
туда играть рано;
вот это направление выглядит перспективно.
Конечно, профессионал затем рассчитывает конкретные последовательности ходов. Но сначала огромный объём вариантов отсекается на основании многолетнего опыта.
Проблема компьютерного го долго заключалась именно в этом.
Компьютер отлично считает.
Но как понять, что вообще стоит считать?
К середине 2010-х сильнейшие программы го всё ещё в основном находились на уровне хороших любителей. В статье AlphaGo в Nature авторы прямо называли го одной из главных классических проблем искусственного интеллекта из-за огромного пространства поиска и трудности оценки позиции.
А потом DeepMind соединила несколько технологий, которые до этого развивались отдельно.
AlphaGo научили сначала играть как человек
У программы было две важные нейронные сети.
Первая называлась policy network.
Грубо говоря, она отвечала на вопрос:
Какой ход здесь выглядит перспективным?
Её сначала обучили на партиях сильных человеческих игроков. Сеть видела положение камней и пыталась предсказать, какой ход в этой позиции сделал бы профессионал.
То есть первым шагом действительно было подражание людям.
Вторая сеть называлась value network. Её задача была другой:
Насколько хороша эта позиция? Кто, скорее всего, выиграет?
Обе системы затем объединялись с поиском по дереву вариантов — Monte Carlo Tree Search.
Если остановиться здесь, AlphaGo вполне могла бы стать просто очень качественным электронным учеником профессионалов.
Но DeepMind сделала ещё одну вещь.
Машине разрешили играть самой с собой
Много.
Очень много.
AlphaGo получала копию себя в качестве противника и играла партии снова и снова. Победила — хорошо. Проиграла — корректируем стратегию.
Это reinforcement learning — обучение с подкреплением.
Вместо того чтобы постоянно спрашивать:
Как здесь играют люди?
система постепенно начинала задавать другой вопрос:
Что здесь действительно повышает вероятность победы?
Разница кажется небольшой.
На самом деле она фундаментальная.
Человеческие партии давали AlphaGo стартовую культуру го.
Самоигра позволяла выйти за её пределы.
До Ли Седоля был ещё один важный человек
В октябре 2015 года AlphaGo сыграла закрытый матч с Фань Хуэем — трёхкратным чемпионом Европы.
Пять партий.
5:0 в пользу компьютера.
Впервые программа победила профессионального игрока в го на полноценной доске без форы. Результат оказался настолько серьёзным, что в январе 2016 года работа AlphaGo вышла в Nature.
Но Фань Хуэй всё-таки не считался игроком уровня лучших корейских и китайских профессионалов.
Поэтому следующим противником выбрали Ли Седоля.
И вот здесь эксперимент внезапно превратился в мировое событие.
Ли Седоль был совсем не лабораторным тестом
К марту 2016 года он выиграл 18 международных титулов и считался одним из наиболее выдающихся игроков предыдущего десятилетия.
Матч проходил в Сеуле и состоял из пяти партий. За ним следили миллионы людей, а DeepMind впоследствии оценила общую аудиторию более чем в 200 миллионов зрителей.
Первая партия закончилась победой AlphaGo.
Уже это было шоком.
Но многие профессионалы ещё могли объяснить результат ошибками Ли, необычным соперником, недооценкой программы.
На следующий день началась вторая партия.
И появился ход №37.
Почему этот ход выглядел настолько странным
Профессиональное го имеет огромную традицию.
Тысячелетиями люди играли партии, анализировали их, создавали школы, изучали типовые формы и передавали принципы следующим поколениям.
Разумеется, сильный игрок не действует строго по книге. Но в его голове существует очень мощное ощущение:
так обычно правильно;
так обычно плохо;
здесь камень ставить слишком высоко;
здесь позиция слишком рыхлая.
Ход AlphaGo нарушал именно такое ощущение.
Это был необычный удар по позиции соперника на правой стороне доски. По человеческим представлениям он выглядел странно расположенным и слишком далёким от типовых вариантов.
Комментаторы сначала буквально подозревали ошибку программы.
Но AlphaGo не обязана была уважать традицию.
У неё не было тренера, который говорил: «Так не играют»
Вот это особенно интересно.
Человек учится го среди других людей.
Учитель объясняет:
сюда ставить камень плохо.
Ученик запоминает.
Через несколько поколений определённые идеи превращаются практически в культурное знание игры.
Обычно совершенно заслуженно. Люди за тысячи лет протестировали огромное количество плохих решений и сохранили хорошие.
Но вместе с полезным опытом появляется инерция опыта.
Некоторые варианты практически перестают исследовать именно потому, что:
мы давно знаем, что так не делают.
AlphaGo никакого социального давления не испытывала.
Если необычный ход повышал вероятность победы — этого было достаточно.
Особенно забавно, что AlphaGo сама знала, насколько ход нечеловеческий
DeepMind позже сообщила оценку: вероятность того, что профессиональный игрок выбрал бы ход №37, составляла примерно 0,01% — тот самый один шанс из десяти тысяч.
Важно правильно понять эту цифру.
Она не означает:
вероятность, что ход хороший, была 0,01%.
Речь шла примерно о другом:
если смотреть на человеческие партии, люди почти никогда не выбирают подобные ходы.
То есть часть системы, научившаяся предсказывать человеческую игру, практически говорила:
человек сюда вряд ли поставит.
Но поиск и оценка дальнейшего развития позиции показали:
а поставить всё-таки стоит.
Вот здесь AlphaGo перестала быть простым имитатором.
Фань Хуэй смотрел на доску и сначала тоже не понимал
После своего поражения он некоторое время работал с командой DeepMind и хорошо знал стиль AlphaGo.
Но даже его ход удивил.
В воспоминаниях о матче приводятся его слова:
«Это не человеческий ход. Я никогда не видел, чтобы человек играл так».
А затем, разобрав позицию, он назвал ход красивым.
Ли Седоль тоже долго думал.
Примерно через пятнадцать минут последовал ответ.
Партия продолжилась, а значение чёрного камня полностью проявилось значительно позже.
AlphaGo выиграла и вторую партию.
Вот здесь термин «искусственный интеллект» впервые за долгое время зазвучал немного иначе
Deep Blue победил Каспарова и стал историческим событием.
Но человеку было сравнительно легко психологически объяснить поражение:
машина просто считает невероятно быстро.
200 миллионов позиций в секунду.
Попробуй посоревнуйся.
У AlphaGo впечатление оказалось другим.
Она не просто просчитала известную человеку идею намного глубже.
Машина выбрала решение, которое сильные люди изначально вообще не считали естественным кандидатом.
Это уже сильнее напоминало не ускоренный калькулятор.
А чужую форму интуиции.
Значит ли это, что AlphaGo стала творческой?
Здесь можно очень быстро уйти в философию.
У программы не появилось вдохновения.
Она не сидела ночью перед доской с чашкой кофе и не думала:
А нарушу-ка я сегодня многовековые традиции.
У неё не было ощущения красоты хода, желания удивить противника или творческой биографии.
Но если определить творчество более скромно:
создание нового и полезного решения, которое не было просто скопировано из существующих примеров,
ход №37 уже выглядит значительно интереснее.
Сам Ли Седоль позже сформулировал это сильнее всех:
«Я думал, AlphaGo основана на вычислении вероятностей и является просто машиной. Но когда увидел этот ход, изменил мнение. AlphaGo определённо творческая».
Мне нравится здесь слово «творческая» не как доказательство машинного сознания.
А как описание результата.
Машина нашла хорошую идею, которой у людей почти не было.
Но история была бы слишком красивой, если бы на этом человек просто проиграл
AlphaGo выиграла первые три партии.
Матч был решён.
Оставались ещё две, которые всё равно решили сыграть.
И в четвёртой произошла зеркальная история.
Теперь уже Ли Седоль сделал ход, который AlphaGo практически не ожидала.
Ход №78.
DeepMind оценила его необычность примерно теми же словами: около одного шанса из десяти тысяч. Позже этот ход получил прозвище God’s Touch — «прикосновение Бога».
После него AlphaGo начала ошибаться.
Ли Седоль выиграл.
Это оказалась единственная человеческая победа в серии.
Финальный счёт — 4:1 в пользу AlphaGo.
Эта четвёртая партия делает всю историю намного лучше
Если бы машина просто разгромила человека пять раз подряд, повествование получилось бы довольно унылым:
силикон победил биологию.
На самом деле произошло другое.
Во второй партии машина показала человеку идею, которую тот почти наверняка не рассматривал.
В четвёртой человек сделал то же самое с машиной.
На несколько часов го превратилось в странный диалог между двумя совершенно разными способами поиска решений.
Именно поэтому после матча профессиональные игроки не перестали играть.
Они начали изучать AlphaGo.
Тысячи лет человеческих правил внезапно пришлось пересматривать
Некоторые ходы, которые раньше считались неправильными или подозрительными, после AlphaGo начали рассматривать серьёзнее.
Профессионалы стали анализировать её дебюты, формы и представления о ценности разных частей доски. В 2017 году DeepMind прямо писала, что идеи AlphaGo уже заставили игроков пересматривать часть традиционных знаний го и пробовать новые стратегии.
Есть важная разница между:
компьютер стал лучшим игроком,
и
компьютер научил лучших игроков новым идеям.
Второе значительно интереснее.
Потому что здесь AI начинает выступать не заменой человеческого знания, а машиной для его расширения.
А через год DeepMind вообще убрала человека из обучения
Первая AlphaGo всё-таки начинала с партий профессионалов.
То есть внутри неё находилось огромное количество накопленного человеческого опыта.
В 2017 году появилась AlphaGo Zero.
Ей не дали партии мастеров.
Только правила игры.
Дальше система начала играть сама с собой и учиться на собственных победах и поражениях. Она прошла путь от случайной игры до сверхчеловеческого уровня и в итоге превзошла предыдущие версии AlphaGo.
Здесь идея стала ещё радикальнее.
Сначала:
посмотри, как играют люди, затем стань лучше.
Теперь:
вот правила. Разберись сама.
Потом появился AlphaZero
И тот же общий подход применили уже к нескольким играм.
Шахматы.
Сёги.
Го.
AlphaZero получала правила, играла миллионы партий сама с собой и постепенно формировала собственные стратегии. DeepMind сообщала, что в го система превзошла версию AlphaGo, победившую Ли Седоля, примерно после 30 часов обучения.
Особенно интересно было наблюдать реакцию шахматистов.
После Deep Blue люди десятилетиями говорили:
компьютер играет как компьютер.
AlphaZero многие гроссмейстеры описывали совершенно иначе. В её партиях находили долгосрочные жертвы, странные позиционные решения и идеи, которые выглядели необычно даже для сильных шахматистов.
Гарри Каспаров увидел здесь не уничтожение человеческого творчества, а возможность получить новый инструмент для него.
По сути ход №37 оказался первым очень публичным примером этой новой роли машины.
Почему это вообще имеет отношение к сегодняшнему ИИ
На первый взгляд — никакого.
Сейчас нас интересуют ChatGPT, роботы, медицина, агенты и генерация видео.
Кто там куда поставил камень десять лет назад?
Но в AlphaGo впервые массовая аудитория увидела несколько идей, которые теперь находятся практически в центре современного AI.
Первое — обучение на огромном количестве примеров.
Система сначала усвоила человеческий опыт.
Второе — самостоятельное обучение через обратную связь.
Машина играла сама с собой и получала очень простой сигнал:
победила / проиграла.
Третье — сочетание нейросетевой интуиции и поиска.
Сеть не обязана рассчитывать каждую возможность. Она помогает понять, какие ветви заслуживают внимания.
Четвёртое — способность находить решение за пределами человеческой традиции.
Вот это как раз ход №37.
Но здесь есть одна огромная оговорка
Го — почти идеальная вселенная для искусственного интеллекта.
Правила абсолютно определённые.
Доска полностью наблюдаема.
Нет скрытых карт.
Нет случайного ветра.
Не приходит клиент и не говорит:
Я вообще-то имел в виду немного другое.
В конце существует чёткий критерий:
выиграл или проиграл.
Это фантастическая среда для reinforcement learning.
Можно сыграть миллион партий и точно знать результат каждой.
Реальный мир такой роскоши почти никогда не предоставляет.
Попробуйте сделать AlphaGo для управления компанией
Как выглядит победа?
Максимальная прибыль?
Тогда можно угробить долгосрочные отношения с клиентами.
Максимальный рост?
Можно уничтожить маржу.
Максимальная удовлетворённость сотрудников?
Возможно, компания обанкротится чрезвычайно довольной.
😁
В го reward очень простой.
Победа.
В жизни правильную цель ещё нужно сформулировать.
Именно поэтому перенос методов игрового AI в реальный мир намного сложнее самого выигрыша у чемпиона.
Машина чрезвычайно хорошо оптимизирует то, что мы попросили.
Главная проблема — попросить правильное.
С роботами ситуация ещё веселее
На виртуальной доске ошибочный ход означает:
потерял несколько пунктов территории.
В физическом мире ошибочный ход роботической руки может означать:
разбил стакан.
Или:
ударил человека.
Поэтому подход:
пусть попробует миллиард раз и постепенно научится
приходится переносить в симуляцию.
Мы недавно как раз говорили про Physical AI: роботу создают виртуальный мир, где он может падать, ошибаться и ломать цифровые предметы практически бесплатно.
В каком-то смысле это попытка построить для физического мира собственную доску го.
В науке мечта ещё интереснее
Представьте систему, которой дают не игру, а научную проблему.
Не:
выиграй партию.
А:
найди новую молекулу;
предложи структуру белка;
найди более эффективный алгоритм;
открой материал с нужными свойствами.
Тогда компьютер потенциально способен исследовать пространство вариантов иначе, чем люди.
Именно такую перспективу DeepMind постоянно связывает с наследием AlphaGo. Компания сегодня проводит линию от исследований в играх к AlphaZero, MuZero, AlphaDev и научным системам вроде AlphaFold — не потому, что белок является партией го, а потому что общая идея заключается в поиске решений в огромных пространствах возможностей.
Здесь ход №37 становится почти символом:
а что, если машина найдёт вариант, который человек просто никогда не рассматривал?
Но человеку ещё надо понять, почему вариант хороший
Вот это чрезвычайно важная проблема.
С ходом №37 всё получилось великолепно.
Машина поставила камень.
Люди сначала удивились.
Потом увидели дальнейшее развитие партии.
И сказали:
А-а-а. Теперь понятно.
В реальной науке решение может быть настолько сложным, что человек не сможет быстро проверить его смысл.
Google DeepMind сейчас даже использует историю Move 37 как пример проблемы advanced AI oversight: эксперты по го изначально не понимали, насколько хорош этот ход, хотя система выбрала его правильно.
Это довольно интересный поворот.
Раньше проблема была:
машина недостаточно умная.
Следующая проблема может звучать:
машина нашла решение, а мы недостаточно быстро понимаем, почему оно правильное.
Поэтому объяснимость становится гораздо важнее по мере роста возможностей AI
В игре всё просто.
Сыграли дальше.
AlphaGo победила.
Доказательство получено.
А если система предлагает новый способ проектирования реактора?
Фраза:
поверьте, value network считает этот вариант хорошим
как-то не очень успокаивает.
😁
Нужны проверяемые аргументы.
Эксперименты.
Модели.
Независимое подтверждение.
Именно поэтому способность AI генерировать необычные идеи должна развиваться вместе со способностью человека их проверять.
Иначе получаем очень умного советчика, которому невозможно доверить решение.
Есть ещё одна причина, почему ход №37 так запомнился
Он случился на глазах у людей.
Не в таблице benchmark.
Не в научной статье со значением 94,7 против 92,1.
Была доска.
Был знаменитый человек.
Был камень.
И сильнейшие профессионалы несколько минут буквально не понимали, что сделала машина.
Мы все очень плохо чувствуем рост технологий через проценты.
Новая модель улучшила benchmark на 6%.
Хорошо.
А когда чемпион мира смотрит на решение компьютера и долго не знает, как реагировать, масштаб изменения ощущается совершенно иначе.
И именно поэтому 2016 год сегодня выглядит важнее, чем казался тогда
ChatGPT появился позже.
Современный бум генеративного AI начался позже.
Но уже в AlphaGo проявилась ключевая идея нынешней эпохи:
нейросеть не обязана просто автоматизировать то, что человек уже умеет делать.
Она потенциально способна исследовать пространство решений вместе с нами.
Иногда быстрее.
Иногда шире.
Иногда совершенно иначе.
Конечно, между доской го и реальной жизнью огромная пропасть.
Но сам принцип уже был продемонстрирован.
Причём AlphaGo не уничтожила го
Это тоже прекрасный результат.
После победы компьютера игра не закончилась.
Люди не сказали:
Ну раз машина сильнее — всё, расходимся.
Наоборот.
Профессионалы начали изучать новые идеи.
Появились новые дебюты.
Игроки пересматривали привычные оценки.
DeepMind в 2017 году прямо писала, что AlphaGo повлияла на стиль ведущих профессионалов и открыла новые направления исследования игры.
То есть превосходящий человека инструмент не обязательно делает человеческую деятельность бессмысленной.
Он может расширить её язык.
Это хороший урок и для нынешних споров об искусственном интеллекте.
Калькулятор не уничтожил математику
Компьютер не уничтожил шахматы.
Stockfish не уничтожил гроссмейстеров.
AlphaGo не уничтожила го.
Фотография не уничтожила живопись.
Но каждая новая технология меняла то, что люди считают интересной и ценной частью своей работы.
Когда машина начинает идеально считать варианты, человек меньше ценится за способность считать варианты.
Когда машина способна написать средний текст, ценность среднего текста снижается.
Когда AI сможет самостоятельно выполнять стандартную работу, человеческая ценность сместится туда, где ещё нужны:
постановка задачи;
проверка;
вкус;
ответственность;
понимание контекста;
создание новых целей.
Ход №37 не сделал человека ненужным.
Он показал человеку, что у пространства решений есть области, куда тот почти не заглядывал.
Через десять лет мы уже привыкли к этому намного сильнее
Сегодня нейросеть генерирует картинку, которую никто раньше не рисовал.
Предлагает вариант кода.
Создаёт молекулярную структуру.
Находит нетривиальную оптимизацию.
Мы воспринимаем это намного спокойнее.
Но в 2016 году идея:
компьютер может не просто воспроизвести человеческое мастерство, а показать мастерам новый сильный приём,
выглядела совершенно иначе.
Поэтому DeepMind спустя десять лет всё ещё выделяет именно Move 37 как один из символов AlphaGo.
Не финальную победу.
Не счёт 4:1.
Один камень.
Возможно, в этом и есть настоящий смысл истории AlphaGo
Человечество очень долго боялось момента, когда машина станет сильнее нас в какой-нибудь интеллектуальной области.
Шахматы дали первый большой удар по самолюбию.
Го — второй.
Но оказалось, что наиболее интересный вопрос звучит не:
Кто сильнее?
А:
Что мы можем увидеть с помощью машины такого, чего раньше не замечали сами?
Это совершенно другая перспектива.
Если искусственный интеллект просто делает существующую работу быстрее, это автоматизация.
Если помогает найти неизвестное решение — появляется что-то гораздо более интересное.
И ход №37 был одним из первых мгновений, когда это стало видно буквально на доске
Чёрный камень стоял в месте, которое профессионалам казалось неправильным.
Не потому, что машина хотела быть оригинальной.
Не потому, что у неё был творческий кризис.
И даже не потому, что она «понимала красоту» го так же, как человек.
Она просто искала путь к победе в пространстве вариантов и не считала человеческую привычку законом природы.
Через несколько десятков ходов стало ясно:
камень стоял хорошо.
Пожалуй, именно этим ход №37 и пугает, и восхищает до сих пор.
Он показывает очень простую вещь.
Иногда мы считаем решение невозможным не потому, что проверили все варианты.
А потому что никто из людей до нас так не делал.
У машины такого уважения к традиции может не быть.
И если следующая её странная идея окажется не камнем на доске, а новым лекарством, материалом, алгоритмом или инженерной конструкцией, реакция человека, скорее всего, будет точно такой же, как у профессионалов в Сеуле весной 2016 года.
Сначала:
Что за ерунду она сделала?
Потом тишина.
А затем:
Погоди. А ведь это работает.