Исследователь Google DeepMind Пушмит Коли и исследователь Biohub Сал Кандидо заявили, что AlphaFold не решил задачу сворачивания белков, в дискуссии под модерацией Брэндона Андерсона. Участники назвали этот прорыв лишь началом применения ИИ в биологии: предсказание статичной структуры не закрывает вопросы динамики, неупорядоченных участков и целых систем. Главный вывод состоит в том, что одного наращивания вычислений и данных недостаточно для моделей, понимающих клетки и болезни.

После AlphaFold: DeepMind и Biohub о том, чего не хватает ИИ в биологии

Масштабирование, качество данных и пределы AlphaFold

Кандидо отметил, что законы масштабирования существуют не везде по умолчанию и поиск таких закономерностей — основная работа. Закон масштабирования возникает, когда рост вычислений и данных устойчиво улучшает результат и превращает исследование в инженерную задачу. Такой эффект зависит от архитектуры и от данных с нужной информацией и статистикой, поскольку модель извлекает и обобщает лишь то, что содержится в обучающих данных.

Коли представил горький урок как предупреждение против жесткой профессиональной идентичности, вспомнив исходное обсуждение в DeepMind. Специалистам по моделированию не следует считать набор данных заданным, а командам по данным — считать заданным моделирование. На первом месте стоит задача, а вложения в модели, генерацию данных и научную экспертизу должны определяться тем, чего требует проблема.

Участники заявили, что исследователи часто оптимизируются под доступные данные, а не под важнейшие научные вопросы. Кандидо привел пример обучения языковых моделей белков на метагеномных последовательностях, многие из которых, возможно, не являются настоящими целыми белками, однако качество проектирования реальных белков и их понимания растет. Риск в том, чтобы просто масштабировать легко получаемые данные вместо поиска нужных данных совместно с сообществом.

Что это значит для прикладного ИИ в биологии

AlphaFold опирался на специально созданную архитектуру и научную интуицию, и участники отметили, что такой подход сохраняет значение там, где данных мало. Качественные данные были названы более важными, чем просто большой объем данных, а индуктивные смещения помогают моделям эффективно использовать структуру биологической информации. Для компаний это означает совместное планирование измерений, моделирования и предметной экспертизы вместо покупки одних лишь вычислений.

Переход от отдельных белков к предсказательным моделям живых систем, включая виртуальную клетку, потребует принципиально иных наборов данных. В обсуждении упоминались динамика и неупорядоченность белков, проектирование белков, более богатые представления на основе микроснимков криоэлектронной микроскопии и скрытые знания внутри языковых моделей белков, которые пока не раскрыты. Для поиска лекарств важен вопрос, когда ИИ даст ускорение в 10–100 раз, а не постепенное улучшение.

Признаком подтверждения тренда станет демонстрация масштабируемого улучшения на новых биологических данных и переход к предсказанию на уровне систем. Сюда входят калиброванная неопределенность и надежность вместо полной интерпретируемости, а также возможная способность систем ИИ интерпретировать другие модели лучше человека. Biohub формулирует миссию как лечение болезней через прорывы в 10 раз, поэтому подтверждением станут новые наборы данных, их использование сообществом и измеримый выигрыш в проектировании и поиске.