ИИ упёрся в потолок при поиске новых лекарств. Спасли секретные архивы фармкомпаний

AlphaFold совершил с биологией примерно то же, что ChatGPT с текстом.

Ещё недавно определение трёхмерной структуры белка могло занимать месяцы и годы лабораторной работы. Потом появилась модель, которой достаточно дать аминокислотную последовательность — и она выдаёт весьма приличное предсказание структуры.

В 2024 году за эту работу дали Нобелевскую премию по химии.

Казалось бы, дальше всё просто.

Делаем модель ещё больше.

Добавляем вычислений.

Учимся предсказывать не только форму белка, но и то, как он взаимодействует с лекарством.

И постепенно превращаем разработку новых препаратов почти в компьютерное проектирование.

Но биология приготовила довольно банальную подлянку.

У модели закончились хорошие данные.

Не буквально все.

Но именно те, которые особенно нужны фармкомпаниям, десятилетиями лежали внутри самих фармкомпаний.

Закрытые.

Секретные.

И очень дорогие.

AlphaFold прекрасно знает белки. Но лекарству этого мало

Белок можно представить как длинную цепочку аминокислот.

Она сворачивается в сложную трёхмерную структуру.

А форма определяет функцию.

У белка появляются карманы, выступы, поверхности — места, к которым могут присоединяться другие молекулы.

Для лекарственного дизайна этого недостаточно.

Нужно понять не просто:

как выглядит белок?

Нужно ответить:

как конкретная молекула лекарства сядет в конкретный карман этого белка?

Чуть повернулась молекула — изменилось взаимодействие.

Одна химическая группа оказалась не там — эффект исчез.

Добавили атом — вещество стало токсичным.

Поменяли конфигурацию — препарат перестал связываться с целью.

Для разработки лекарства точность уже нужна совсем другого уровня.

И здесь данные внезапно становятся гораздо беднее.

В открытых базах лежит огромная наука

У исследователей есть Protein Data Bank.

Это гигантский международный архив экспериментально определённых молекулярных структур.

Именно такие открытые базы дали AlphaFold фундамент для обучения.

Сегодня там сотни тысяч структур.

Для фундаментальной биологии это сокровищница.

Но фармацевтическим исследователям нужен очень специфический кусок:

структура белка вместе с небольшими лекарствоподобными молекулами, которые реально связываются с ним.

И таких примеров значительно меньше.

По оценке одного из участников нового проекта, в открытых данных их порядка десяти тысяч.

А теперь представим фармкомпанию, которая тридцать лет разрабатывает лекарства.

Она синтезировала сотни тысяч молекул.

Тысячи отправила на структурные исследования.

Для каждой выясняла:

что связалось;

как связалось;

что не сработало;

что оказалось лучше;

что оказалось хуже.

Большая часть этого никогда не публиковалась.

Потому что отрицательный результат тоже стоит денег

Допустим, компания исследовала сто вариантов молекулы.

Один стал лекарством.

Девяносто девять провалились.

В научной статье чаще всего появится победитель.

А для обучения ИИ иногда интереснее именно остальные девяносто девять.

Они рассказывают:

что делать не надо.

Одна молекула плохо вошла в карман.

Вторая связалась под неправильным углом.

Третья дала красивый результат в пробирке, но оказалась нестабильной.

Четвёртая была токсичной.

Пятая просто не работала.

За каждым таким провалом стоят лаборатории, химики, оборудование и годы экспериментов.

Для компании это коммерческая тайна.

Для нейросети — великолепный учебник.

Получается довольно ироничная ситуация.

Мир потратил десятилетия на создание огромного количества уникальных научных данных.

А потом запер большую их часть в корпоративных архивах.

И пять конкурентов внезапно решили объединиться

AbbVie.

Astex Pharmaceuticals.

Bristol Myers Squibb.

Johnson & Johnson.

Takeda.

Совсем не маленькие ребята.

Вместе они создали AI Structural Biology Network и взяли открытую модель OpenFold3 — независимую реализацию идей AlphaFold 3.

Затем добавили 20 167 закрытых структур белок–лиганд из собственных исследовательских программ.

То есть набор частных данных оказался примерно вдвое больше того объёма релевантных лекарственных комплексов, который, по оценкам участников, доступен публично.

Но возникает небольшая проблема.

Фармкомпания готова сказать:

— Давайте обучим общую модель.

Она совершенно не готова сказать:

— Вот вам вся наша база неудачных и перспективных лекарств. Пользуйтесь.

Поэтому данные никуда не уехали

Использовали federated learning — федеративное обучение.

Грубо говоря, модель приходит к данным.

А не данные к модели.

Каждая компания обучает копию системы внутри собственного защищённого контура.

Закрытые структуры остаются там же.

Никто из партнёров их не видит.

После обучения наружу отправляются обновления параметров модели.

Центральная система объединяет изменения.

Получившаяся модель снова отправляется участникам.

Цикл повторяется.

Получается довольно занятная конструкция.

Пять конкурентов вместе учат один ИИ на общих знаниях.

При этом каждый продолжает держать собственные карты закрытыми.

Для фармы это почти дипломатическое чудо.

И закрытые данные действительно помогли

Для проверки заранее отложили ещё 1056 частных структур, которых модель во время обучения не видела.

Обычный OpenFold3 на открытых данных давал высококачественное предсказание взаимодействия примерно в 35,6% случаев.

После обучения на корпоративных архивах результат поднялся до 52,1%.

Другой сильный открытый конкурент, Boltz-2, получил около 40,9%.

Если смотреть именно на правильное положение молекулы лекарства внутри связывающего участка, рост получился ещё показательнее:

примерно с 28,9% до 46,8%.

Архитектуру не изобрели заново.

Не сделали модель в десять раз больше.

Не построили ещё один гигантский дата-центр.

Просто дали ей данные, которых раньше не было.

И качество резко выросло.

Причём данные одной компании оказались хуже общих

Это особенно важная деталь.

Исследователи проверяли модели, которые обучались только на частных данных одной фармкомпании.

Объединённая версия оказалась сильнее.

Почему?

Потому что у каждой компании свой исторический перекос.

Одна много работала с определённым классом белков.

Другая — с другим.

Одна предпочитала одни химические конструкции.

Другая — совершенно другие.

Если учить модель только на собственном прошлом, она хорошо усваивает собственное прошлое.

Объединение архивов расширяет мир, который она видит.

В машинном обучении разнообразие данных иногда ценнее их простого количества.

И вот здесь история перестаёт быть только про фарму

Последние пару лет бизнесу продавали довольно простую идею:

нужно внедрять ИИ.

Купили ChatGPT.

Подключили Claude.

Добавили API.

Поставили чат-бота.

Молодцы, цифровая трансформация завершена.

Только сейчас модели постепенно становятся товаром.

Сегодня одна лучшая.

Через три месяца другая.

Через год примерно одинаковые возможности оказываются у десятка поставщиков.

Конкурент может купить ту же модель.

По той же цене.

Через тот же API.

И если оба бизнеса используют одинаковый ИИ на одинаковой публичной информации, откуда вообще возьмётся преимущество?

Ответ фармкомпаний:

из данных, которых у конкурента нет.

У компании двадцать лет лежал мусор. Оказалось — золото

Практически у любого старого бизнеса есть собственный архив.

CRM.

Заявки.

Продажи.

Переписка менеджеров.

Причины отказов.

Коммерческие предложения.

История цен.

Рекламные кампании.

Звонки.

Возвраты.

Отзывы.

Результаты тестов.

Большую часть времени это воспринималось как технический хвост.

Ну лежит и лежит.

До появления современных моделей действительно было непонятно, что делать с двумя миллионами старых диалогов менеджеров.

Теперь из них можно извлечь:

какие возражения реально мешают продаже;

что говорят клиенты перед покупкой;

какие офферы работают на определённых сегментах;

какие признаки отличают хорошего лида от мусорного;

какие причины отказа повторяются годами.

Публичный интернет знает вашу отрасль.

Ваш архив знает ваш бизнес.

Это совсем разные данные.

Именно поэтому я не верю в «один ИИ для всего бизнеса»

Можно взять самую сильную модель в мире.

Сказать:

— Сделай маркетинг для производителя кухонь.

Она выдаст вполне приличный результат.

Потому что видела сайты производителей кухонь.

Статьи.

Книги по маркетингу.

Рекламу.

Но она не знает:

какие заявки приходили именно вам;

почему именно ваши клиенты отказывались;

какая комплектация давала максимальную маржу;

из каких объявлений приходили люди, которые реально покупали;

какие обещания менеджеров потом превращались в проблему.

Вот поэтому в Market GPT мы постепенно строим систему именно вокруг контекста конкретного бизнеса: сначала собрать факты, рынок, воронку, клиентов и реальные ограничения — и только потом давать модели что-либо генерировать.

Не потому что нейросеть слабая.

Наоборот.

Сильной модели особенно жалко давать плохие данные.

Фарма обнаружила ещё одну неприятную вещь

Данных недостаточно просто накопить.

Биологические данные очень грязные.

Один эксперимент проводился при одной температуре.

Другой — при другой.

Использовалось другое оборудование.

Другие клеточные линии.

Другие концентрации.

Разные лаборатории.

Разные протоколы.

Формально две записи описывают одно свойство.

Фактически сравнивать их напрямую нельзя.

В августовском обзоре Nature Reviews Drug Discovery авторы довольно жёстко прошлись по нынешнему AI-хайпу в фарме.

Проблема не только в количестве.

Нужны данные, которые действительно позволяют предсказывать важный реальный результат.

Можно собрать прекрасный набор очень чистых данных о том, что почти никак не связано с успехом лекарства у человека.

ИИ идеально его выучит.

И совершенно бесполезно применит.

Это относится не только к биологии.

Дерьмовые данные плюс умный ИИ дают быстро обработанные дерьмовые данные

Бизнес иногда ожидает магии.

Берём CRM, которую пять лет никто нормально не заполнял.

У половины лидов нет статуса.

Причины отказа менеджеры писали:

«дорого»;

«подумает»;

«хз»;

«не берет трубку».

Потом поверх этого ставим искусственный интеллект.

И ждём стратегических инсайтов.

Фарма сейчас упирается в ту же стену, только ценой в миллиарды долларов.

Модель не способна восстановить эксперимент, который никто не провёл.

Не способна получить правильную метку из неправильно записанного результата.

Не способна узнать влияние параметра, который исследователь вообще не сохранял.

ИИ резко увеличивает ценность хороших данных.

Но он одновременно гораздо ярче подсвечивает цену плохих.

Поэтому началась новая золотая лихорадка — производство данных

Один ответ очевиден:

если данных не хватает, их надо создать.

В Великобритании запустили OpenBind.

Проект получает государственное финансирование и занимается созданием новых открытых структур белков с лекарствоподобными молекулами.

Не скачивает ещё миллиард страниц интернета.

Физически проводит эксперименты.

Получает новые структуры.

Добавляет их в обучающие наборы.

Это довольно важный поворот в AI-индустрии.

Первое поколение больших моделей жило за счёт уже существующей информации.

Тексты написали люди.

Фотографии сняли люди.

Код написали программисты.

Модели пришли и всё это съели.

В некоторых научных областях бесплатный шведский стол заканчивается.

Следующий набор данных придётся создавать специально для ИИ.

А это дорого.

И большие фармкомпании здесь получают неожиданное преимущество

Старый бизнес принято считать медленным.

Бюрократичным.

Неповоротливым.

Стартап приходит с новой моделью и вроде бы должен всех уничтожить.

Но у Pfizer, Lilly, Roche или J&J может быть то, чего невозможно собрать венчурными деньгами за два года.

Двадцать.

Тридцать.

Пятьдесят лет экспериментов.

Lilly, например, уже строит TuneLab на собственных моделях, обученных более чем на 500 тысячах доклинических точек данных, накопленных более чем за двадцать лет.

И предлагает доступ к знаниям из этого массива небольшим биотехам через защищённую платформу.

Старый архив внезапно превращается в вычислительное преимущество.

Такие активы невозможно просто скачать с GitHub.

Но есть и обратная сторона

Если лучшие модели начнут появляться только внутри закрытых консорциумов, возникает новая версия научного неравенства.

Университет имеет открытый AlphaFold.

Фарма получает систему, которая работает заметно точнее, потому что видела двадцать тысяч закрытых структур.

Потом закрытая модель помогает создавать новые лекарства.

Эти проекты порождают новые экспериментальные данные.

Новые данные снова идут в закрытую модель.

Она становится ещё сильнее.

Получается маховик:

лучшие данные → лучшая модель → лучшие эксперименты → ещё лучшие данные.

И догонять такой маховик гораздо сложнее, чем просто скачать очередную открытую нейросеть.

Похоже, новая нефть всё-таки данные. Но не любые

Эту фразу повторяли лет пятнадцать, поэтому она успела порядком надоесть.

Теперь наконец становится понятно, какие именно данные действительно похожи на ресурс.

Не миллиард случайных строк.

Не огромная выгрузка из интернета.

А редкие наблюдения, получение которых стоило реальных денег, времени и экспериментов.

Фармкомпании годами платили учёным за структурные исследования.

Не ради будущего ИИ.

Просто потому что разрабатывали лекарства.

Теперь выясняется, что накопленный побочный продукт исследований способен серьёзно улучшить следующую генерацию моделей.

Старые данные получили новую цену.

И это хороший момент посмотреть на собственный бизнес

Не в смысле:

«Срочно давайте учить свою нейросеть».

Большинству компаний собственная foundation model вообще не нужна.

Но стоит спросить:

какие данные мы создаём каждый день и бездарно выбрасываем?

Почему клиент не купил?

Как сформулировал проблему?

Что спрашивал до заказа?

Какая комбинация товара покупается вместе?

Через сколько дней человек возвращается?

На каком шаге менеджер теряет сделку?

Какой рекламный запрос реально приносит деньги?

Сегодня это может выглядеть как скучный операционный след.

Через пару лет именно этот след станет тем, на чём специализированный ИИ будет работать лучше универсального.

А если хочется уже сейчас посмотреть, как разные нейросети решают практические задачи без покупки десятка отдельных подписок, я периодически использую SyntX AI — там в одном интерфейсе собрано больше сотни AI-инструментов. Но сама модель всё равно только половина системы. Вторая половина — чем именно вы её кормите.

AlphaFold дал нам довольно красивый урок

Первый большой скачок произошёл благодаря архитектуре.

Новая модель увидела структуру белка там, где раньше требовались месяцы вычислений и экспериментов.

А следующий скачок неожиданно оказался менее романтичным.

Пять компаний открыли свои цифровые подвалы.

Достали результаты старых исследований.

Научились обучать одну модель, не показывая друг другу секреты.

И она стала существенно лучше.

Возможно, это и есть следующий этап AI-революции.

Гонка моделей постепенно превращается в гонку уникального опыта.

Публично доступный интеллект будет становиться всё дешевле.

Хорошие алгоритмы будут копироваться.

Вычисления — покупаться.

А вот двадцать лет собственных экспериментов заказать на Amazon с доставкой завтра уже не получится.

И поэтому следующий большой конкурентный ров может выглядеть довольно скучно.

Не гигантский дата-центр.

Не секретная нейросеть.

А старый корпоративный архив, который двадцать лет никто не решался выбросить.