为何AlphaFold未能解决蛋白质折叠:DeepMind与Biohub专家探讨AI生物学的未来突破
从AI 的 Bitter Lesson扩展定律,到仍未破解的蛋白质折叠之谜,Google DeepMind 的 Pushmeet Kohli 和 Biohub 的 Sal Candido 正在重新思考:要构建真正理解生物学的 AI,究竟需要什么。在这场由 Brandon Anderson 主持的特别圆桌中,他们探讨了为什么 AlphaFold 的突破只是起点,为什么单靠堆算力和数据解决不了生物学问题,以及下一代 AI 模型将如何改变我们对蛋白质、细胞和人类疾病的认知。
我们深入聊了AI 驱动的生物学的未来:如何在生物数据中找到 scaling law,科学直觉与通用架构之间的取舍,为什么蛋白质结构预测远未解决,以及构建生命系统的预测模型需要什么条件。Pushmeet 回顾了 AlphaFold 背后的经验教训、人类可解释性的局限,以及未来的前沿模型是否会比我们更懂其他 AI 系统。Sal 则解释了为什么蛋白质语言模型中可能已经蕴藏着我们尚未解锁的科学知识,为什么生物建模必须超越单个蛋白质的范畴,以及为什么实现 Biohub 治愈所有疾病的使命,需要追求10 倍级的突破,而非渐进式改进。
我们聊到了:
生物学的 Bitter Lesson:为什么只堆算力和数据不够
为什么找到正确的 scaling law 比盲目增大模型更重要
低质量的宏基因组数据如何改进蛋白质语言模型
为什么 AI 研究者总是围绕可获取的数据优化,而不是最重要的科学问题
DeepMind 在平衡建模、数据生成与科学专业知识上的经验
为什么构建虚拟细胞需要本质上不同的数据集
AlphaFold 的人工设计架构与科学直觉的作用
为什么数据质量比单纯的数据量更关键
归纳偏置、scaling law,以及专用 AI 架构的未来
为何我们尚未迈入 后 Transformer 时代,但架构仍在持续演进
为何 AlphaFold 实际上并未彻底解决 所有蛋白质折叠问题
蛋白质动力学、无序性 以及静态结构预测的局限性
低温电子显微镜(Cryo-EM)图像 如何解锁更丰富的生物表征
从单个蛋白质模型迈向 完整生物系统
费曼著名原理:为何 AI 如今能创造人类尚未理解的事物
蛋白质语言模型中蕴含的 隐性生物学知识
为何 可信性与不确定性校准 比完全可解释性更为关键
前沿 AI 模型 是否比人类更擅长解读其他 AI 系统
AI 何时能推动药物研发实现 10 倍至 100 倍 的加速
为何 治愈所有疾病 需要着眼于 10 倍级的突破,而非 10% 的改进
Pushmeet Kohli — Google DeepMind
Sal Candido — Biohub
LinkedIn: https://www.linkedin.com/in/salcandido/
Brandon Anderson — 主持人
时间戳
00:00:00 引言:生物数据的“苦涩教训”(Bitter Lesson)
00:01:00 寻找生物学领域的扩展定律(Scaling Laws)与合适数据
00:04:54 DeepMind 的“苦涩教训”:解决问题与扩展模型
00:06:50 AlphaFold、数据局限性与构建虚拟细胞
00:09:52 手工设计架构 vs. 算力规模化
00:11:53 优质数据、归纳偏置与模型设计
00:13:39 超越 Transformer:AI 架构的未来
00:14:38 为什么 AlphaFold 尚未解决蛋白质折叠问题
00:17:39 蛋白质动力学、蛋白质设计以及冷冻电子显微镜(Cryo-EM)
00:19:09 从单个蛋白质迈向完整的生物系统
00:20:43 费曼原理:无需理解即可创造
00:22:18 蛋白质语言模型中隐藏的知识
00:23:48 AlphaFold、可信度与可解释性
00:25:56 AI 能否比人类更好地理解其他 AI 模型?
00:27:43 AI 何时将彻底改变药物研发?
00:29:47 为何治愈所有疾病需要十倍级的突破
文字记录
引言:数据是否存在“苦涩教训”?
Brandon Anderson [00:00:04]: 很高兴来到这里。这真是一个激动人心的早晨,又有这么多酷炫的发布。我认为生物科学的未来正在这里被宣告。这是建模环节。我们全都是建模者,所以自然而然地要讨论数据。
关于数据,我常思考的一点是如何正确地对其进行规模化。这引导我思考在数据视角下的“苦涩教训”(The Bitter Lesson)。对于非 AI 圈的朋友,“苦涩教训”指的是可规模化的方法最终会胜出,只要规模够大,它就能赢。所以,首先想问 Sal 的是:数据领域是否也存在一种“苦涩教训”?
Sal Candido [00:01:00]: 当然有。显然,你需要合适的数据才能让其发挥作用。关于缩放定律(scaling laws),有一个误解认为它无处不在且始终存在。实际上,很多工作正是在寻找那条缩放定律。我们做的很多事都在试图弄清楚:在什么情况下,投入更多算力或更多数据,能产生更好的结果?
这是个很好的局面,因为一旦达到这个阶段,你就可以按部就班地推进,把它变成一个工程问题——这正合我意。这既取决于架构,也很大程度上取决于数据。如果你没有包含正确信息和统计数据的数据来解决你想解决的问题,就训练不出具备你想要的能力和理解力的模型。模型能做的,只是从现有数据中提取信息,并据此泛化到数据之外。
选对数据:可用性 vs. 科学影响力
Brandon Anderson [00:02:09]: 在数据采集方面,你是如何思考哪种模态最合适的?还有一个相关问题:建模者是不是倾向于做数据可得的问题,而不是最符合自身目标、或对转化医学影响最大的问题?
Sal Candido [00:02:32]: 确实如此。我没法代表所有建模者,但我比较懒,所以会用现成的数据。这样做有好的一面,也有坏的一面。
好的一面是,做传统机器学习时,人们往往追求最干净、最优质的数据样本;但如果像我这样,就会在储藏室里翻箱倒柜,看看别人不要的“破烂”里有什么。一个具体的例子是用宏基因组序列训练蛋白质语言模型——这些数据质量并不高。我敢说其中很多数据甚至不是真实完整的蛋白质。但它们确实提升了模型的能力,无论是在设计真正可用的蛋白质,还是在理解已知存在的蛋白质上。
这是积极的一面。但它也可能把你带偏:你会说“那就把我们容易生成的数据规模扩大就行了”。我不认为这是正确的路子。这也是今天我们和 BBI 讨论的让我兴奋的地方——主动走出去,问“解决这个问题到底需要什么数据?”
关键在于既要有合适的资源,也要有合适的社区。Biohub 一直坚持公开合作,与社区共同推进整体发展。这一点至关重要:如果只专注于构建模型,团队容易依赖现有数据;如果只负责生成数据,又会偏向于易于生成的类型。只有让整个社区在每一个环节都开放协作,才能明确真正所需的数据,进而发现其中的 scaling law。
问题先行:建模、数据与专业知识
Brandon Anderson [00:04:50]:Pushmeet,你认为对于数据而言,“苦涩的教训”意味着什么?
Pushmeet Kohli [00:04:54]:Rich 还在 DeepMind 时,我就开始思考“苦涩的教训”这一概念。我从他当时的演讲中领悟到的,并非单纯讨论数据是否有用或如何思考机器学习,而是一种更抽象的概念。
我们在面对问题时,往往会以一种近乎教条的方式来定位解决方案:“我是做模型的”或“我是负责生成数据的”。我认为这种固守身份的心态正是“苦涩的教训”所在。如果带着这种狭隘的心态去解决问题,往往难有建树。问题应当放在首位,在解决方案上保持灵活。既要做建模,也要获取数据。要深刻理解要解决的核心问题:若需要建模,就投入建模工作;若需要更多数据,就去收集数据。
当时机器学习领域的常见做法是,研究者认为“我们是做机器学习的,数据集已经有了,这里有训练数据,那里有测试数据,我们只需优化模型”。这种思路是行不通的。因为如果最终目标是解决问题,就必须兼顾影响这一过程的方方面面。
投入这个过程的不仅仅是数据或模型,还有专业知识。以 AlphaFold 为例,由于我们缺乏核心专业知识,甚至没有资源将蛋白数据银行(PDB)扩充数个数量级,因此我们审视了现有数据集能做到的极限。全球组织和科学家为构建这些数据所投入的心血是 invaluable 的。因此,在那种情况下,你必须专注于在模型上投入以获取最大回报。
但在其他领域,比如单细胞基因组学,我们采取同样的思路,问自己“逐细胞基因数据能做什么?”。经过大量工作后,我们非常清楚地意识到,数据尚未成熟到可以追求构建“虚拟细胞”这一宏大愿景。这促使人们聚拢在一起,专注于推动科学发展的实际挑战,而不是盲目追随数据生成或建模技术的进步。
Brandon Anderson [00:08:23]: 我很喜欢这个回答。具体的行动要点是什么?始终先定义问题,再确定在哪个解空间进行搜索。但从更宏观的角度看,随着下一代转化医学的推进,社区应如何思考这一点?
Pushmeet Kohli [00:08:47]: 我给任何刚进入该领域的人的建议是,把自己视为一个跨学科的人。先理解问题。你为什么在做这件事?你想达成什么目标?然后思考需要什么,无论是建模、计算扩展还是数据生成。理解问题极其重要,当然你还需要建立自己的专业知识。
也存在约束条件。也许你能生成的数据量有限,或者你只能负担得起特定大小的模型训练。理解这些约束,尽快试错,并审视哪些方法在长期内是可行的,从而帮助你达到预期的影响力水平。
科学归纳偏置与规模效应:构建模型的艺术
Brandon Anderson [00:09:52]: 这正好引出我的下一个问题。回顾建模方法的演进,AlphaFold 2 堪称一件艺术品,包含大量精心手工设计的特征,解决方案的每个环节都经过深思熟虑。Google 或 Alphabet 的一些工作仍停留在这一路线,但业界的普遍共识似乎正在转向更具扩展性、更通用的策略。
那么,我们还需要为某些问题保留这种“手工匠”式的精雕细琢吗?还是说资源应该优先投给规模化?在资金和资源固定的情况下,你可以投入算力、人才或数据,这个权衡该怎么看?
Pushmeet Kohli [00:10:48]: 我们从第一性原理出发来分析。构建更好的模型这门艺术和手艺,并不是碰运气。我们做了大量实验,但背后始终有清晰的愿景。生物物理和生物化学的科学直觉告诉我们,氨基酸残基并不是各自独立的,它们会相互影响。所以我们就把这个先验“烘焙”进模型里。既然已经从科学界学到了这些知识,就把它用起来,给模型一个“不公平”的优势。
这样模型的数据效率会高很多,因为它不必重新学习一切。我还想补充一点:整理好数据本身就是一门艺术。事情并不是简单地说一句“多喂点数据”就完事。如果只是复制重复同样的数据,什么进展都不会有。关键不在于大数据,而在于好数据——在于理解要取得进展需要什么样的数据覆盖。这本身就是一个更有趣、也更有挑战性的问题。
Brandon Anderson [00:12:20]: Sal,你好像有话要说,你怎么看?
Sal Candido [00:12:24]: 我非常同意,这取决于要解决的问题。当数据量较少时,给模型加入更多归纳偏置会有帮助——在小数据规模下,你确实需要它才能出结果。但随着数据越来越多,模型有时能发现一些你原本不知道的东西,而那些归纳偏置如果不够准确,反而会拖后腿。所以随着技术进步,这里存在一个临界点。
不过,我对你的问题也略有异议,因为“扩展”这部分同样包含大量工艺细节。为了让模型在更多数据上训练、投入更多算力并实现更大规模,背后涉及许多算法层面的工作。这并不仅仅关乎基础设施层面或让模型推理更快。我们正看到模型架构突破标准 Transformer 的范畴,向更具定制性的结构演进。我丝毫不认为我们已经进入后 Transformer 时代,但我们正在修改这些架构,使其更贴合具体任务、运行更高效,即便是在处理互联网规模的数据时也是如此。
随着数据量不断增加,挑战不仅仅在于数据筛选或为模型挑选下一批所需信息。更关键的是,在每一个阶段、每一个规模上,都需要思考:什么样的架构才能最大化利用这些信息。
为什么 AlphaFold 没有解决所有蛋白质生物学问题
Brandon Anderson [00:14:36]: 如果回顾当前蛋白质结构预测的状态,新闻会宣称该问题已得到解决。但如果你询问我的同行,他们会说:“这里还有很多工作要做。”功能、动态过程和设计仍是悬而未决的难题。距离 AlphaFold 2 发布已过去大约五年,期间确实取得了进展。
Pushmeet,你认为还会有下一次重大突破吗?解决这些问题存在哪些阻碍?是因为缺乏合适的数据、算法或想法,还是仅仅需要时间?
Pushmeet Kohli [00:15:28]: 科学推进的方式是隔离目标,然后分步突破。当人们说蛋白质折叠问题已解决时,在概念层面确实取得了进步。但请回想一下“蛋白质是生命积木”这种叙事。蛋白质并非积木,也不像积木那样运作。我虽然经常说蛋白质是积木,但内心其实并不这么认为。
蛋白质极其复杂且无序,其形态可能随环境背景而改变。John Jumper 和我曾讨论过这个问题:我们究竟在试图解决什么?我们并不知晓蛋白质实际占据的真实基态,也不清楚其结构分布的真实情况。我们当时做的是复现他人获取并存入 PDB 的结构。我们做到了这一点,而事实证明这很有用。
但这并不意味着我们已经完全理解了蛋白质动态过程。在最高层面上,我们更容易传达出已取得进展的信息,但在座的科学家们都知道仍有大量工作要做。有很多值得庆祝的地方,但不要因此停止资助蛋白质结构预测和蛋白质动力学研究,因为我们才刚刚开始。
冷冻电镜、分子动力学与缺失的信息
Brandon Anderson [00:17:39]:最大的障碍是什么?如果你能挥动魔杖说“我拥有更多这个东西”,并且这会加速功能、动力学或设计进程,你会创造出什么?
Pushmeet Kohli [00:17:54]:我的背景非常多元。我最初是安全研究员,随后转向计算机视觉、贝叶斯理论、判别式机器学习、深度学习、AI编码,最后才涉足科学领域。所以当你问这个问题时,我内心那个计算机视觉研究者对冷冻电镜(cryo-EM)显微照片感到非常兴奋。
我曾想:“PDB数据是什么?我应该从源头着手,我应该看冷冻电镜显微照片。我不想要那些结构,它们肯定遗漏了所有数据。我应该直接操作冷冻电镜显微照片。”
如果能获得在该层级上可扩展的模型,拥有适量数据,并提取其中捕捉到的动力学和分布信息,那将非常棒。我尝试过,但这需要更多工作。
Brandon Anderson [00:18:57]:仍有工作要做,但你认为这是一条能获取该信息的路径吗?
Pushmeet Kohli [00:19:00]:是的。我认为在某个人比我更擅长的时刻,会有人尝试这么做,最终我们会取得进展。
从蛋白质结构到更大规模的生物系统
Brandon Anderson [00:19:07]:Sal,你怎么看?
Sal Candido [00:19:09]:这很有趣,因为这些模型非常有用,但它们并不完全是大多数人想要解决的问题。它们解决的是非常特定的目的,也可以用于其他事情。例如,你可以用它们设计新的蛋白质,但这不一定是最初的出发点。
我觉得我们现在构建的这些模型,就像一个人想弄明白自行车是怎么工作的,却只在对其中一根辐条建模。这些模型可以越来越好,但真正需要做的是从辐条模型升级到车轮模型,再到整辆自行车的模型,因为人们想理解的是整车。沿用这个比喻,现在大家似乎是想用自行车的模型去设计皮卡车的零件。 当我们把这些模型放进它们所对应的特定生物学情境中,就能在更大的范围内学习这些相互作用。我认为事情正朝着这个方向发展。不过我同意应该继续研究折叠模型,因为它们会不断进步。蛋白质设计与科学理解
Brandon Anderson [00:20:43]: 说到设计,费曼有句名言:“我不能创造的东西,我就不理解。”而现在的世界里,我们可以轻松地创造出东西,却完全不理解它。那么,能帮助人类理解事物的模型有多重要?相比那种能直接一次性设计出皮摩尔级结合剂之类东西的魔法黑箱,理解型模型的价值体现在哪里?
Sal Candido [00:21:18]: 早在 AI 出现之前,我们就在用魔法黑箱做设计了。某种程度上这依然有用。但理解非常重要,这也是我思考 AI 时最关心的问题之一。
这些模型有太多东西要学。随着智能变得越来越便宜、越来越普及,你可以用它不断学习世界上正在发生的事情。但问题是怎么把机器里的知识提取出来,让我能理解?也许这只是我个人别样的好奇心。但值得学的东西实在太多了。
Brandon Anderson [00:22:05]: 很多科学家真心想理解事物,端点结果对他们来说未必那么重要。但我们是要把转化医学当作一个问题来解决,对吧?
Sal Candido [00:22:18]: 我觉得你对问题钻研得越深,就越能找到持续推动它的正确路径。我感受特别深的一点是,这些模型里蕴含的信息远比我们所知的多。
我们在模型的可解释性方面投入了大量工作,通过它我们能发现许多有价值信息。人们知道蛋白质语言模型会在其表征中习得某种结构概念,但我们还发现了关于蛋白质功能和运动的信息。即便是在我们现有的模型中,仍有大量潜力有待挖掘。随着模型能力的提升,理解这些方面对我们至关重要。
归根结底,当我们将所有信息压缩到一个模型中时,预期会有一个世界模型从中涌现。它如何运作?它如何设计蛋白质?它将来自进化的信息压缩到了模型中。除了能产出对我们有用的结果,仅仅通过观察模型内部,我们就已能学到很多东西。
AlphaFold 的置信度、校准与可解释性
Brandon Anderson [00:23:48]: Pushmeet,你怎么看?是设计能力更重要,还是理解程度更重要?
Pushmeet Kohli [00:23:53]: 我的观点略有不同,我认为某种程度的理解是必要的。让我解释一下我指的“程度”。
AlphaFold 并非完美无缺。AlphaFold 2 当时在该数据集上的 GDT 分数约为 90。但即使它的 GDT 分数达到 95,如果其 pLDDT 分数完全没有经过校准,谁还敢信任它?想象一下,它神奇地给出了好答案,却告诉你它非常有信心,结果你按此方向努力了一年后才发现它完全错误。不确定度测量的校准极其重要。
从这个意义上说,我们确实理解了 AlphaFold 2,并且在理解其运行模式方面取得了巨大进展。这与理解其内部如何找到解决方案是不同的。在这方面,我同意 Sal 的观点:可解释性在问:它为什么能起作用?它为什么给出这个答案?
从最高层面来看,AlphaFold 2 在其行为和泛化能力方面是可解释的,而我们在发布之前并未发现关于它的所有特性。当发布 AlphaFold 2 并开放权重后,人们发现它是一个优秀的无序蛋白质预测器。它能判断蛋白质的哪些部分处于无序状态。这证明了它的泛化能力。
但可解释性还需回答另一个问题:对谁可解释?如果指人类理性系统——受限于人脑的认知和计算能力——那么,AlphaFold 2 不可解释。但如果你在问它是否对更大、更复杂的模型可解释(即该模型能否理解其工作原理),那答案可能是肯定的,只是我们尚未参透。
作为 AlphaFold 2 的用户,我们必须弄清它能做什么、不能做什么。理解其行为特征、优势与局限至关重要。若缺乏这种认知就贸然使用这些模型,它们非但无益,反而可能有害。
Brandon Anderson [00:26:53]: 也就是说,严格来讲可解释性并非必需,但人们应聚焦于确保模型可靠,以便人类据此作出可执行的决策,对吗?
Pushmeet Kohli [00:27:04]: 正是如此。可解释性也因观者而异——谁在解释?如果是一位人类科学家试图解读模型如何做出预测,这与让另一个更大的 LLM 访问激活层并询问“能否预测 AlphaFold 的行为?”是完全不同的问题。未来那些前沿模型或许能预测这一点,并构建出 AlphaFold 2 如何解释和生成结果的理论。
AI 何时将变革药物研发与临床医疗?
Brandon Anderson [00:27:43]: 我们只剩两分钟了,向两位提最后一个问题。AI 极有可能在近期为人类健康带来巨大改善。我偏好量化预测:你觉得多久后我们能在临床中看到 AI 的成果?Pushmeet,你想先说吗?
Pushmeet Kohli [00:28:08]: 我认为“临床中的 AI 成果”是个表述不清的问题。事实上,AI 如今已应用于药物研发流程的各个环节。从这个意义上说,它已经在那儿了。
但如果你问的是,何时能在时间线上看到 10 倍甚至 100 倍的加速,那接下来的问题是:我们加速的是什么?是先导化合物优化?靶点发现?还是临床前研究或毒理学试验?
接下来几年里——这也是为什么今天宣布的这项工作极其重要——我们需要去攻克生物学中一些真正的难题。只有这样,才能获得真正意义上的加速突破,彻底改变药物研发。AI 当然会持续被用于各种进入临床的应用,但更大的加速,要靠这项工作试图建立的那些生物学模型带来更深入的理解才能真正解锁。
Brandon Anderson [00:29:43]: 好,谢谢。Sal,请快速回答一下,我们时间不多了。
Sal Candido [00:29:47]: 我很想以一个生物黑客的身份来回答这个问题。重要的是要想清楚,推动这个领域向前发展到底意味着什么。我们真正想看到的是结果层面的改变。什么时候才能有完全由 AI 研发出的药物?我不知道,这很难预测。但我确实认为很快就会看到飞速进展,因为这些工具都已经用起来了。
回到你刚才关于基础研究和基础理解的观点,我早年在 Google 工作时学到的一点是:有时候,问「怎样做到 10 倍的提升」比问「怎样做到 10% 的提升」更容易接近问题本质。这并不是说 10 倍的路径一定更好走,而是它能让你站得更远,看到那些你一直没去尝试的解决方案。你会回到第一性原理去思考:「我们到底该怎么做?怎样才算真正把它推上去?」
这两种思路——10% 和 10 倍——都有价值,都应该去做。我很高兴 Biohub 有一句美好而宏大的使命宣言:治愈所有疾病。要实现这个目标,就必须弄清楚 10 倍的路径是什么。能有机会去做这件事,非常难得。
Brandon Anderson [00:31:46]: 太棒了,谢谢两位。谢谢你们坐上这个「火力全开」的位置,非常精彩。