合成超级智能:从半导体到超导——Periodic Labs 联合创始人访谈
51条回复 · 99次转发 · 684个赞
一年之后,Periodic Labs 已被公认为顶尖的 AI 科学家研究机构之一,其人才密度惊人,在构建自主实验室方面取得了令人瞩目的进展:
Liam Fedus @LiamFedus 工业级规模的科学。今夏将落地到您附近的实验室。
2026年4月26日下午3:30 · 25.3万次浏览 69 条回复 · 73 次转发 · 1.3K 点赞
大多数人熟悉 Liam 和 Dogus 的经典履历,但在深入了解到 Periodic Labs 时,我们发现了一种令人惊叹的「人才斜率」:这里每一位新入职的员工,履历似乎都比前一位更亮眼:
Rohan Pandey@khoomeik确实如此 我刚入职 Periodic Labs 的前几个月,每周的中期训练会议参会人员如下:- 训练了首个万亿参数 LLM 的大牛
- 发明注意力机制的大牛
- 我
20 条回复 · 16 次转发 · 669 点赞
从构建能基于嘈杂物理实验数据进行推理的 AI 系统,到打造让每台仪器都变得智能的实验室,Periodic Labs 押注 AI 的下一个前沿并非简单地通过训练更多互联网数据来实现,而是让模型与真实世界进行实验。在本期节目中,Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 与 swyx 和 Brandon 探讨为何科学发现与数学和编程存在根本差异,以及构建能够真正发现新材料的 AI 科学家需要具备什么条件。
我们深入探讨了 Periodic 对「合成超级智能」的构想:以物理实验为基础的强化学习、AI 驱动的材料表征、模拟与密度泛函理论(DFT)、高通量实验室,以及从整个科研过程(而非仅从已发表成果)中学习的系统。Liam 和 Dogus 还解释了为什么前沿模型仍然需要真实实验、为什么失败实验可能是最有价值的训练数据、给每台实验设备赋予「140 IQ」意味着什么,以及自主实验如何把数十年的科学试错压缩到几个月。
我们聊到了:
为什么仅有智能不足以实现科学发现
当环境是物理世界时,强化学习会发生什么变化
为什么科学研究需要在不确定性、噪声和信息缺失下进行推理
材料发现闭环中的预测、合成与表征
为什么物理和材料科学远未「被解决」
「物质编译器」与 Periodic 的合成超级智能目标
相变、X 射线衍射与 AI 驱动的材料表征
DFT、模拟,以及为什么实验仍是最终的 ground truth
室温超导体、新型磁体、电池与更高效的算力
为什么量子计算未必能自动解决材料发现问题
让每台实验设备拥有「140 IQ」意味着什么
为什么数据质量和阴性结果比单纯堆算力更重要
用做科学的过程而非最终答案来训练模型
为什么即使未来的前沿模型也需要动手做实验
在 AI、化学、物理和定制硬件上扩展自主实验室
自动化实验如何大幅增加新材料发现中的「运气表面积」
Liam Fedus
Ekin Dogus Cubuk
章节时间戳
00:00:00 简介
00:02:49 物理世界中的 AI 与强化学习
00:09:17 端到端材料发现闭环
00:13:28 为什么物理学并没有被“彻底解决”
00:19:04 物质编译器与 AI 表征
00:42:27 DFT、模拟与实验基准真值
00:42:27 理想材料、算力与量子计算
00:45:57 赋予每台实验室仪器“140 IQ”的能力
00:50:02 实验室自动化
00:53:16 数据、模型与阴性结果
00:58:13 用科学过程训练 AI
01:00:20 为什么前沿 AI 仍需要实验验证
01:06:06 扩展自主实验室规模
01:10:45 组建团队并推向工业界
01:17:01 从 AI 助手到科学成果
01:20:57 自动化探索超导体
完整文字稿
引言:智能必须对接现实
Swyx [00:00:00]: 好的。我们现在身处 Periodic 实验室。今天与 Periodic 的 Liam 和 Doğuş 一起。欢迎你们,感谢邀请我们前来。
Liam Fedus [00:00:11]: 很高兴来到这里,也谢谢你们过来。
Swyx [00:00:13]: 我想从你们网站上我很喜欢的一句名言开始。它写道:“智能是必要的,但并非充分条件。只有当思想被证实与现实相符时,新知识才会产生。”这句话看似简单直白,但为什么它并非显而易见?
Liam Fedus [00:00:29]:我认为这是 Doğuş 和我在创建 Periodic 时的核心论点与前提:单靠思考无法找到解决方案。宇宙极其复杂,要真正推动知识前沿并实现进展,必须建立猜想,然后验证其是否成立。无论重读多少教科书或论文,再怎么深思熟虑或关起门来苦想,都无法穷举所有预期的或意想不到的实验结果。真正的关键在于这种迭代过程。这是我们构建该系统的核心信念,因此从最初我们就确定:既需要具备 AI 系统和物理世界模拟能力,也必须建立高通量物理实验平台。我们相信,由此会涌现出一种不同类型的智能。
Swyx [00:01:21]:值得注意的是,在 OpenAI 或 Google 这类大型实验室中,人们拥有充足的资源,而你不得不出来另起炉灶,因为你们在摸索中开创了自己的方法论。
构建面向 AI 科学的跨学科实验室
Ekin Doğuş Çubuk [00:01:34]:是的,我认为像我们这样的团队从未出现过。我们试图将固体化学家、固体物理学家、实验科学家、理论学家、硬件工程师、LLM 专家和计算机科学家聚集在一起。其中一些技术非常新颖,高通量实验和机械臂的应用仅在最近三四年间才开始尝试;力场方面的专业知识也涉及到一些最新开发的力场模型。但确实,我们认为拥有实验室至关重要,让这些人专注并协同工作非常重要。历史中最近的参考案例是贝尔实验室(Bell Labs),在那里,杰出的理论家、实验家和化学家通力合作,取得了非凡成就。我们也致力于在这里实现同样的目标。
物理世界的强化学习与不确定性
Brandon [00:02:17]:我稍后会讨论力场,但
Swyx [00:02:19]:对
Brandon [00:02:19]: 在聊那个之前……它们到底是什么?好,在那之前先补充一些背景:我们的听众既有 AI 工程师,也有科学家。对工程师们来说:在 OpenAI 这样的大实验室工作,和你们现在在做的事,有什么区别?你可能已经暗示过一些,但能否明确讲讲,你的思维方式需要做哪些调整?
Liam Fedus [00:02:49]: 有一点很有意思:我们的强化学习环境直接来自真实的物理实验室,数据也来自物理实验室,而这就是我们的终极事实。仅仅针对论文或教科书里已有的答案做优化是不够的,因为我们要突破这些已知边界,我觉得这是最大的区别之一。但随之而来的,是不确定性下的决策问题。针对数学问题做优化时,精度很高,基本不用面对方差、不确定性或异常测量,而这些在我们的流程中至关重要。比如在做材料发现循环时,从炉子里出来的东西不会自带标签,对吧?连标注过程本身都可能是随机且有噪声的。不同设备之间有时会有偏差,遥测数据也可能不完整——比如我们以为是在某个温度下运行的,实际上温度偏离了一定的量。一个智能系统能够消化这些带噪声的数据,并像科学家那样做出明智的决策,这需要一套不同的推理策略。当然,两者也有很多共通之处:标准的 mid-training、强化学习、工具使用型 agent 的构建、方差缩减、确保训练和推理的基础设施没有不一致等等。但我们还得更进一步,去思考:在高度不确定的情况下,如何做出准确的工作?如何极其高效地利用有限的数据?我们确实在大幅扩展规模,但这和数字环境不同——在数字环境里你可以随意增加更多环境或更多 rollout,我们没有那种自由度。所以样本效率是另一个关键点。
为什么实验总是充满噪声和不完整性
Brandon [00:04:48]: 这对我来说有点抽象。其实这也是科学板块聊过不少的话题,但我觉得在谈论实验不确定性时,如果能具体描述一下你们做实验时的某个环节是什么样的,以及在涉及 AI 之前人类会如何解决这个问题,可能会更有帮助。你有具体的例子吗?比如你制作某种材料时,测量过程中会遇到怎样的不确定性?
Ekin Doğuş Çubuk [00:05:17]: 我认为这件事有很多维度。其中一点是,我认为每个科学实验都必须进行维度约简,这与编程或数学完全不同。做数学或编程时,人类或 LLM 可以获取所有上下文。那只是一堆公理,一些人们从中推导出的推论,或者一堆函数和 API 调用。你需要用来推理的所有信息都是现成的,你只需要很聪明地去推导答案即可。而在物理中,如你所知,我们面对的是原子数量远超计算机存储能力的系统。因此,显然我们需要将系统原本的高维度和比特数,压缩到计算机能容纳的比特数中。我想,这正是热力学的初衷。起初人们非常困惑蒸汽机是如何工作的,但后来发现,只需五六个热力学变量就能很好地解释发生的一切,这令人难以置信。这就是物理之美所在。
Brandon [00:06:13]: 你有一屋子原子,数量是 10²³ 或 10²⁷
Ekin Doğuş Çubuk [00:06:19]: 没错
Brandon [00:06:19]: 或者更多原子在这个房间里,但你只需要温度和压强等简单变量,就能告诉你一切。不,它告诉你了你大多数需要的信息
Ekin Doğuş Çubuk [00:06:28]: 很多
Brandon [00:06:29]: 对于大多数情况下的认知,对吧?
Ekin Doğuş Çubuk [00:06:30]: 是的。
Brandon [00:06:30]: 假设你合成了一种材料,然后可以观察它的 X 射线结构。但这是一个信息损耗很大的投影,并非材料的真实结构,只呈现了主成分的部分特征。人类该如何基于这些简单的主成分进行推理?又如何将这一过程扩展应用到 AI 中?
Ekin Doğuş Çubuk [00:06:58]: 在理论物理这边,我们早就认识到能量很重要——能量的平均值和涨落。很多热力学都是从这里推导出来的。后来我们又发现反应势垒和动力学也非常关键。人类面对这么复杂的系统,办法是构建一些降维的描述符来推理。大家也很喜欢原子层面的图像,去思考局部结构长什么样,是八面体还是四面体,化学家尤其受益于此。这是理论这边的情况。实验这边呢,你会尽量多收集数据,记实验记录本,把看到的一切都写下来——当然你也清楚会漏掉很多。就像 Liam 说的,各种各样的问题都会冒出来。比如你的马弗炉会随时间老化:用着用着,烤的东西会挥发出来,附着在加热元件上,所以每用一次,炉子状态就更差一点。另一个问题是炉内温度并不是完全均匀的,样品放在哪个位置会影响结果。这个问题我们现在还没有,但说不定哪天就会遇到。光学仪器则非常怕振动,有人走动都会造成干扰。我记得读博的时候,有个实验室一直被这个问题困扰:他们的实验结果时好时坏,最后查出来是每天夜里某个时间点,楼上有人走动,振动影响了激光装置。所以说科学确实很难,但这也正是它的特别之处,对吧?Liam 和我还聊到一点:当前 AI 的进步大多集中在数学、编程和理论计算机科学上,因为这对 LLM 来说更容易。但现实世界里,需要智能的事情其实更像科学——充满不确定性、充满噪声、缺乏上下文,而你必须作为智能体自己去判断下一步该做什么。
Liam Fedus [00:08:53]:在此基础上,我认为另一个非常有意思的切入点是:做数学、做理论计算机、处理这类任务的“最优推理策略”,未必就是做科学的“最优推理策略”。
Ekin Doğuş Çubuk [00:09:04]:确实。
材料发现循环:合成与表征
Brandon [00:09:05]:如果你的输出是带噪声的晶体结构,或者是某种我说不清是什么的集体变量(collective variables),你怎么定义 RL 的奖励函数?就像。
Liam Fedus [00:09:17]:也许,我先讲讲这个循环的一部分,并深入挖掘一下。因此,作为材料发现循环的一部分,我们首先必须弄清楚要制造什么。也就是说,原子结合在一起是否稳定,以及我们是否预期它具有我们想要的性质。因此,我们想要的不仅是一种新颖的原子构型。我们希望当把它们组合在一起时,它们具有我们关注的性质。下一步是你如何合成它?你如何实际制造出这个东西?这也并非易事。因此,即使你知道某种东西能结合在一起,实际制造出它的工艺条件是什么这一过程,也极不平凡。但再次强调关键点。一旦你完成这两个步骤并制造出某种东西,它并不是自带标签的,所以你实际上必须对其进行表征,弄清你到底制造了什么。因此,在这种情况下,与其思考 RL 环境——即我们启动一个实验,等几天,然后尝试更新“你是否找到了室温超导体”——那完全是不可行的。
Brandon [00:10:15]:是的。我正想问这个。是的,你不能让 GPU 空转一周什么的。
Liam Fedus [00:10:19]:嗯。是的,这完全不可行。
Brandon [00:10:20]:是的。
Liam Fedus [00:10:20]: 因为你的 agent 数量不足以充分降低方差。不同仪器之间的 rollout 耗时很长,你得等待。实验本身存在物理极限,比如合成或熔炉的实际耗时。所以整个过程既慢又充满噪声。我们构建 AI 程序的思路,基本上就是围绕我们已经产生的这组数据构建 agent。以表征为例,你需要寻找能奖励“识别出实际存在的相”的 RL 环境。给定原始实验数据,你能否有效拟合?我们的做法是对材料进行 X 射线照射。X 射线的频率或波长与原子间距大致相当,因此会产生清晰的衍射图案,就像晶体结构的“指纹”一样。通过这种方式,识别其中实际存在的物质并非易事。因此,我们早期的 AI 工作主要在于构建执行此任务的系统。这也让我们能更快地推进,因为当你运行大量实验时,你的理解能力会迅速成为瓶颈——即理解实际产出了什么。同样,现在的强化学习环境相当直接:奖励对现有相的识别,惩罚那些看似存在但缺乏真实化学合理性的虚假相。这就是一个简短的模块,你可以将其应用于各个部分。当把这些环节串联起来时,就形成了端到端的发现循环。
在新颖实验数据上训练,而非记忆答案
Brandon [00:12:02]: 好的。你
Liam Fedus [00:12:02]: 也许另一个
Brandon [00:12:03]: 是的。哦,抱歉
Liam Fedus [00:12:03]: 另一方面,随着我们积累大量实验数据,基本上相当于给世界状态打上了时间戳。你可以这样记录:“截至这个日期,我们拥有的实验证据是这些。”然后就能构建强化学习环境,问:“基于这些实验证据和当时的各种选项,科学家下一步做出了什么选择?实验得出了什么结果?”这非常有意思,因为它让我们能做一些外部条件下更难实现的训练。因为如果预训练模型已经记住了某些数据,你再对它做强化学习,它已经知道答案了,这时构建依赖该答案的任务,它就可以“装模作样”——反正答案它都知道,根本不需要真正去做艰难的物理推理,也不需要真的跑计算和仿真。但它照样能得到正确答案,于是你强化了这个策略,提升了这些推理路径的权重。可这些推理路径无法泛化到新系统上,对我们没用。但当我们积累了成批的实验数据、把它们串联起来、保留了全过程的数据谱系,我们就能构建其他地方根本不可能实现的新型训练环境。
为什么物理定律已知却不等于能完美仿真
Swyx [00:13:27]: 我想问个问题。
Brandon [00:13:28]: 问吧。
Swyx [00:13:28]: 不过我怕把话题带偏了。管他呢,我还是要问,毕竟我不是科学家出身,是工程师背景——机器学习这块我熟,物理那块不熟。问题有好几个版本,但核心就是:物理定律我们不是基本都搞清楚了吗?那为什么到现在还没有完美的仿真器?
Brandon [00:13:50]: 哦,这个问题问得很好。
Swyx [00:13:52]: 我觉得这问题挺基础的。刚才他反应是“哈,这问题挺可爱”,不过……
Brandon [00:13:56]: 不,这确实是个好问题。
Swyx [00:13:57]: 老兄,我这儿全是物理书。什么意思,怎么就还没完呢?
Ekin Doğuş Çubuk [00:14:03]: 是的,这里情况有点复杂。所以
Swyx [00:14:07]: 是的。
Ekin Doğuş Çubuk [00:14:07]: 首先我认为,物理定律的研究肯定还没做完。即使是
Swyx [00:14:12]: 在量子尺度上确实如此。在极大尺度上也许也是,但在人体尺度、材料尺度上,我们还剩些什么没搞懂?
Ekin Doğuş Çubuk [00:14:22]: 还没完。这是个很好的问题,有趣的是为什么我们还没搞完。大家常讲这样一个故事:狄拉克在二十世纪二十年代末研究量子力学时,写了一本量子力学的教科书,他当时将其描述为一切已经结束。人们喜欢引用其中一句话,我不确定准确度如何,但据说是狄拉克说的:“剩下的就是化学了。”意思是他说他可以解算氢原子。
Swyx [00:14:50]: 然后把所有东西组合起来就行。
Ekin Doğuş Çubuk [00:14:51]: 没错。他或许能解算一维氢原子链,但他目前无法解算比如氮与氧的相互作用。但这没关系,那只是化学的事。
Swyx [00:15:00]: 嗯。
Brandon [00:15:00]: 物理学家真的喜欢单原子近似,也就是那些极其简单的系统。
Ekin Doğuş Çubuk [00:15:05]: 简单系统。
Brandon [00:15:05]: 那些是你们唯一能解算的。
Ekin Doğuş Çubuk [00:15:07]: 球形牛。
Brandon [00:15:07]: 对,球形牛。
Ekin Doğuş Çubuk [00:15:08]: 但事实证明,我认为过去百年我们学到的是:并非如此。它不仅仅是氢原子问题的简单延伸。剩下的不仅仅是化学,其中还有大量的物理问题。据我所知,我们至今未解的一个难题就是高温超导。除此之外还有很多
Swyx [00:15:25]: 对你而言,175K、200K 算高温吗?
Ekin Doğuş Çubuk [00:15:28]: 哦,当人们提到高温超导时,他们通常指的是非常规超导。我们熟悉的常规超导主要驱动机制是电子-声子耦合,在这种情况下,你可以观察到同位素效应。如果用同一系统但更换其中某个元素的同位素(改变原子质量),超导临界温度会按预期速率下降,这就是常规行为。然而,像铜氧化物这类高温超导体,比如超过77开尔文、达到93开尔文的那些,竟然不遵循这套物理规律。我们目前甚至不知道它们遵循什么规律。它们只是拥有不可思议的超导特性。但这还不是全部,高温超导绝对是一个极受关注但我们尚未建立理论基础的热门话题。实际上,还有许多其他未知领域。例如,即使在简单的量子力学系统中,强关联效应我们也还无法精确模拟。密度泛函理论是一个强大的工具,在某些方面精度极高,但一旦涉及强电子关联,它就无法捕捉部分效应。有太多谜题等待解开,所以我对AI在该领域的应用感到非常兴奋,因为从理论、计算到实验,处处都有待探索的空间。我们在这一领域的每一点进步都将改善人类生活,因为我们越能理解材料和凝聚态物理,就能制造出越好的器件。
Brandon [00:16:41]: 这里有一个菲尔·安德森的名言:“更多即不同”。大意是,你或许理解某个事物的所有基本规律,但当众多事物组合在一起时,它们会表现出质的不同,与简单物理预测的行为截然不同。理解众多事物如何协同运作,听起来应该很简单。基本规律是简单的,但集体行为极其复杂,导致建模非常困难。
Ekin Doğuş Çubuk [00:17:07]: 它是涌现的且普适的,这太疯狂了。我们在深度学习中也能看到这一点,对吧?我们在深度学习中到处看到幂律分布,虽然我们还不完全理解,但这非常让人联想到物理学中的涌现与普适性。
Brandon [00:17:20]: 物理学界有很多关于神经网络中涌现现象的理论论文。
Ekin Doğuş Çubuk [00:17:24]: 对,确实如此。
Brandon [00:17:25]: 嗯。
合成预测与物质编译器
Swyx [00:17:26]: 我的另一个追问是关于过程和最终结果的关系。假设你确定了材料的目标性能,接着就要找出实现它的工艺路线。有没有必要把这两件事分开来做?比如训练一个模型,只要给定任何理论上的最终状态,它就能完美地逆向推导出所需的工艺。这有意义吗?
Ekin Doğuş Çubuk [00:17:54]: 回到我们之前聊过的:原子数量超过阿伏伽德罗常数,我们永远不可能完全掌握发生了什么的具体细节。我想这也是为什么我们永远无法完美逆向推导一切的原因。但我们的目标只是逆向推导到足够用的程度,能提升材料性能就行了。
Swyx [00:18:13]: 对。
Brandon [00:18:13]: 你问的是,有没有一个前向模型,输入之后能预测输出,然后你想反过来——
Swyx [00:18:19]: 对。
Brandon [00:18:20]: 你想构建一个能理解这个映射的代理模型——
Liam Fedus [00:18:22]: 输入是最终的原子构型,然后预测的是——
Swyx [00:18:27]: 因为这样你几乎可以把工作拆开:一个团队负责工艺侧,另一个团队负责性能侧,然后——
Liam Fedus [00:18:33]: 没错。
Swyx [00:18:33]: 让他们赛跑,看谁先跑通。
Liam Fedus [00:18:36]: 是的,我觉得在这些方面还有很大进步空间。把这些 agentic 工作流拆分到不同领域,此外在合成预测上也有很多实证工作可以做。
Swyx [00:18:49]: 是的。
Liam Fedus [00:18:49]: 面对某种原子构型,你应该用什么工具?拿到实验证据、既往文献和论文后,你实际是如何推导这些属性的?最终关键在于验证,你能否真正复现它?
Swyx [00:19:04]: 我之所以这么提,或许还隐含了一层公司视角。想想 TSMC,它之于半导体制造厂(fab),但 TSMC 并不设计芯片。你可以是材料领域的 TSMC,客户带着需求来找你,说“我想要这个”,然后你去琢磨工艺和……
Liam Fedus [00:19:21]: 没错,就像物质编译器(matter compiler)。
Swyx [00:19:23]: 对。
Liam Fedus [00:19:24]: 那基于这些要求……
Swyx [00:19:26]: 很有《星际迷航》那味儿。
Liam Fedus [00:19:27]: 是啊。但问题是,给定这些要求,这组构型在物理上是否合法?它真的可能存在吗?
Swyx [00:19:33]: 这是一个好的目标函数(objective function)吗?不确定。它显得太大了。
Liam Fedus [00:19:37]: 对。我们把使命之一描述为“合成超级智能(synthesis superintelligence)”,我认为这与这个方向一致。
相变、X 射线衍射与 RL 奖励
Swyx [00:19:44]: 是的。
Brandon [00:19:44]: 我想回过头细究你刚才提到的一点,关于“相(phases)”。这也呼应了 Doğuş 关于“涌现(emergence)”的评论。我认为“相变(phase transition)”这个概念对很多听众来说可能比较陌生。你能解释一下什么是相变,以及为什么它是 RL 环境中很有用的信号吗?
埃金·多古什·丘别克 [00:20:08]: 相变非常迷人。我觉得人们在生活中最容易联想到的例子,大概是冰融化或水沸腾。你给冰加热,它看起来还是冰,行为也像冰,但当温度达到某个临界点时,它就不再升温,而是直接变成液态。于是,它从固态迅速转变为液态。另一个与我们紧密相关的例子是 Ising 模型。我认为计算机科学和数学家们可能用其他名称研究过它,但本质上,你可以有向上和向下的自旋,它们在都向上时与一上一下时具有不同的相互作用项。在足够高的温度下,它们通常随机向上或向下。熵占据主导。你降低温度,它看起来还是一样的。但在某个时刻,它们突然开始完美对齐。是的,这就是相变。相变之所以很棒,是因为它让物理学家在研究某些事物时变得更轻松。它们通常具有某些空间关联,这对我们也非常有帮助。好的,在我们的实验室里,相变通常发生在我们混合不同的前驱体时,基本上是不同的晶体,但我们随后提高温度或采取其他措施以鼓励它们反应,然后原子开始反应并形成这种新晶体。并且,这会在 XRD 图谱中显现出来,因为如果原子的几何结构发生剧烈变化,XRD 图谱通常会大幅改变。但在典型的实用材料发现项目中实际发生的是,当你首先尝试某样东西时,它不起作用,结果并不只是明确的“是”或“否”,通常是一个混合相。它通常会有一些前驱体。它可能有一些非晶相,然后它会有一堆你可能没有试图制造的相。这就构成了挑战,这就是为什么我们发现很难将模拟和人工智能结合起来进行表征。模拟总是可以说:“哦,这个相看起来不像我们预测的,但它是它的一个微小变体。让我现在对其进行力场计算,看看它是否仍然稳定。”或者人工智能可以说:“根据之前的实验和这个,这可能不是我们想要制造的相,所以让我们改变条件。”
Liam Fedus [00:22:18]: 是的,在某些情况下
Swyx [00:22:19]: 给听众说明一下,XRD 就是 X 射线衍射,你刚才已经介绍过了。
Liam Fedus [00:22:22]: 对。有时候会遇到一种从未被记录过的相,任何论文或数据库里都不存在。这时 AI 就得真正动用这些工具去推理:“什么样的原子构型才能解释这些衍射相?” 这对指导科学实验流程非常关键。比如说我们心里有一个目标相,就需要不断爬山式地优化,获取更好的测量数据。假如现在相纯度只有百分之一,而我们的目标是提高纯度,那就必须对实验数据有非常可靠的测量,才能判断到底有什么、没有什么。
Brandon [00:22:57]: 所以这其中一个优势是,你们有一个可以直接观测的独立变量。回到刚才怎么处理不确定性的话题,你的答案之一似乎是把可观测信号做到尽量无歧义,不需要额外解读。是这个逻辑吗?还是说你们纯粹就是需要找到新相,所以关注点在这里?
Liam Fedus [00:23:20]: 我认为很多情况下其实仍然存在歧义。最笨但有效的办法就是重复实验。
Brandon [00:23:25]: 嗯。
Liam Fedus [00:23:26]: 我们当然会做重复实验。
Brandon [00:23:27]: 对对。
Liam Fedus [00:23:28]: 但这是个很有挑战性的任务,因为整个过程并非完全确定,确实存在各种歧义。两种不同的相可能对应同一个衍射图谱。
Brandon [00:23:42]: 是。
Liam Fedus [00:23:42]: 所以系统的化学直觉就很重要,它要能判断:“考虑到合成条件和已有知识,这种情况出现的可能性极低。”用这些先验知识来帮助消除歧义。
化学先验、多模态测量与歧义
Swyx [00:23:58]: 所以你其实是在根据预期注入一些先验。
Ekin Doğuş Çubuk [00:24:03]: 没错。我认为热力学是最大的先验条件。
Swyx [00:24:06]: 是的。
Ekin Doğuş Çubuk [00:24:07]: 另外,物理学也是一个重要的先验条件。这里还有一个我们特别受益的领域,那就是多模态或多材料表征。我们可以进行 XRD(X射线衍射)分析,虽然某些物相在 XRD 图谱上可能看起来很相似,但我们可以进一步测量它们的电学性质、磁性,以及通过电子显微镜等手段观察其形貌。在这些维度下,那些在 XRD 上看似相似的物相往往会表现出差异。这种多模态方法非常有用。AI 在此处也发挥了巨大作用,因为人类的上下文处理能力和计算能力有限。如果你让人类同时分析 10 种不同的模态数据,并要求保持一致性,这相当困难。但对于 AI 来说,这并不具备“超智能”的门槛,它能很好地完成这项任务。
Liam Fedus [00:24:46]: 对,这种“超智能”体现在它能进行海量的计算,全面审视所有数据。这正好契合了“在不确定性下做出更好决策”这一观点:AI 正在纵向整合来自多种仪器、不同实验以及重复样本的信号,从而构建出更底层的准确模型。
Swyx [00:25:08]: 是的。
Liam Fedus [00:25:08]: 而不是过度依赖某一台仪器的单次测量结果。
信息极限、遥测与麦克斯韦妖
Swyx [00:25:12]: 我想补充一点。你之前也提到过,数据量远超任何合理计算机的存储或处理能力。因此,即便拥有这些重复样本,即便你有十种方法测量同一事物,在某个节点你不得不舍弃部分数据。毕竟,如果某个温度传感器出错了呢?那你什么时候该丢弃数据?如何决定取舍?作为一个对数据极度饥渴的机器学习从业者,我本能地希望获取所有信息,然后……
Ekin Doğuş Çubuk [00:25:37]: 确实如此。
Swyx [00:25:37]: 就是让机器去学一切。我不知道自己不知道什么,所以就是把所有东西都喂给机器。
Ekin Doğuş Çubuk [00:25:42]: 是的。我们不会删除任何数据。我之前的意思可能是指“潜在的”(potentially)。假如上帝在观察这个实验
Swyx [00:25:50]: 是的。
Ekin Doğuş Çubuk [00:25:50]: 实验中的数据量远超计算机的存储极限。遗憾的是,我们这些凡人无法观测到所有原子。尽管实际存在的数据量大于我们的存储能力,但我们根本触及不到那些数据。例如,我无法追踪所有原子的位置。因此,目前我们仍处于一个阶段,所收集到的任何数据都极其宝贵,绝不会删除任何部分。
Brandon [00:26:11]: 如果要建立与 AI 领域的联系,可以这样理解:想象进行探测(probing),比如对基础模型进行线性探测(linear probing)。基础模型拥有海量数据,而“上帝”则掌握着材料微观状态的全局图景。实验就像一个微小的线性探针,输出仅为 8 比特左右的信息。这相当于将一个庞大系统粗粒度化(coarse-graining)成极少量的信息。随后,无论是由人类还是由你的 Agent,都需要从这 8 比特信息中重构出原本的状态
Liam Fedus [00:26:43]: 这是一个类比。
Brandon [00:26:44]: 即内部实际发生的情况。
Liam Fedus [00:26:45]: 这是一种类比,你无法对每个参数权重或每个激活值拥有完全的可见性。你得到的只是其中的一部分子集,或者是跨越整个系统的粗粒度特征。
Ekin Doğuş Çubuk [00:26:58]: 是的。你大概会发现麦克斯韦妖(Maxwell's demon)的论点非常有趣,因为它实际上
Swyx [00:27:05]: 你能复述一下吗?我不记得了。他之前提过,但我总是忘
Ekin Doğuş Çubuk [00:27:10]: 19 世纪,人们意识到一个封闭系统的熵必须增加
Swyx [00:27:18]: 是的。
Ekin Doğuş Çubuk [00:27:18]: 或者保持不变,但绝不能下降。
Swyx [00:27:20]: 是的。
Ekin Doğuş Çubuk [00:27:21]: 这涉及的是热力学第二定律。有个经典的思想实验:假设有一个无所不知的微型“麦克斯韦妖”,它能观察每一个原子,每当发现低能量的原子,就打开一扇门把它放进另一个房间。这样不断操作,就能降低系统的熵——但这会违反热力学第二定律。长期以来,这个问题一直没有令人满意的解答。直到上世纪(对我们来说算比较近的年代),Landauer 提出了一个论证:删除信息是要消耗能量的。麦克斯韦妖在这个过程中会积累大量信息,最终不得不删除一部分;而删除信息必须消耗能量,这就保证了熵还是会增加。所以虽然我们还达不到麦克斯韦妖的能力,但我觉得你的问题很有远见——未来我们存储的数据多到不得不删一些的时候,这个道理就派上用场了。
Swyx [00:28:17]: 哈哈,我没想那么远。这倒让我想起空调,空调的工作原理其实差不多。不过我的问题其实是:为什么不干脆把世界上所有传感器都买下来,把一切都布置上极度过剩的仪器、做极度过剩的复制?
Liam Fedus [00:28:33]: 哦,我们就是这么干的。
Swyx [00:28:34]: 是嘛?行,好,那就没问题了。
Liam Fedus [00:28:35]: 对,没错。
Swyx [00:28:35]: 好,那就说得通了。
Liam Fedus [00:28:37]: 对,我觉得关键在于——
Swyx [00:28:39]: 得到确认了。
Liam Fedus [00:28:39]: 对,就是这个意思。要看到单个原子的级别是不现实的,但我们部署了大量遥测设备,这基本上减少了所谓的“隐藏变量”的数量。
Swyx [00:28:49]: 对,对。顺便好奇问一句,你们只待在加州,不担心吗?不想去尼泊尔、澳大利亚也搞一个?
Ekin Doğuş Çubuk [00:28:59]: 可以啊,我们计划开设更多实验室。
Swyx [00:29:02]:因为显然,重力、你面向哪里、你在哪里,这些都很重要。
Ekin Doğuş Çubuk [00:29:07]:专业能力也会变化。这里我们有特定的专长领域。例如,斯坦福大学物理系和工程系拥有某些特定专长,这对我们非常有帮助,因为我们可以从那里招聘研究人员进行合作。正如你所说,地理位置确实重要,但不同城市在物理、化学等细分领域的专长也有所不同。
Swyx [00:29:27]:是的。哦,我们有 Zoom。
Ekin Doğuş Çubuk [00:29:28]:是的。
Swyx [00:29:28]:用于这个目的。
Ekin Doğuş Çubuk [00:29:29]:是的。但仍然
Swyx [00:29:31]:你的实验并不一定因为你在哪里而受到影响。
Liam Fedus [00:29:34]:是的。是的,Periodic 的未来不会只是一个实验室。
Swyx [00:29:38]:是的。你得坐上你的私人飞机,飞去太空,你知道的。
Liam Fedus [00:29:42]:没错。是的,我认为建立一个这样的实验室网络是必要的。正如 Doğuş 刚才指出的,根据专业特长或材料限制,每个实验室都有一个最佳位置。还有很多不同的约束条件,比如许可审批等。
将模拟与物理实验相结合
Brandon [00:29:56]:好的,其中一个是。我一直很好奇的一件事是,你们如何处理计算工具?或者说,你们如何将计算工具整合到决策流程中,特别是当计算结果和实验结果不一定吻合时?这也涉及到高层面的理论理解。是的,这些是如何协同工作的?
Ekin Doğuş Çubuk [00:30:22]: 是的。这里有个很有帮助的事实:有些任务在模拟中更容易处理,且模拟结果更精确;有些任务则在实验上更容易操作,且实验数据更准确。总体而言,实验当然更精确,但某些测量在实验上极难实现。如果勉强尝试,往往只能得到一个粗糙的版本,导致数据失真。我举几个例子。比如,我们使用密度泛函理论来估算材料的生成焓,以及
Brandon [00:30:51]: 抱歉,先暂停一下。能否解释一下密度泛函理论和生成熵?
密度泛函理论与生成焓
Ekin Doğuş Çubuk [00:30:55]: 是的,当然可以。
Brandon [00:30:56]: 抱歉,是生成焓,对。
Ekin Doğuş Çubuk [00:30:57]: 好的。密度泛函理论(DFT)可能是目前最常用的材料模拟方法。它源于 Hohenberg–Kohn 定理,Kohn 也因此拿了诺贝尔奖。他意识到,量子力学计算代价极高,因为每个波函数都对应一个指数级增长的 Hilbert 空间,随着系统规模变大,求解会变得非常困难。而 Kohn 和 Hohenberg 发现,其实根本不需要在指数级空间里做计算——至少对于量子力学系统的基态来说,你只需要关注电荷密度就行。这个定理本身相当简单,我觉得物理系本科生都能理解。核心思想是:量子力学系统基态的所有性质都是电荷密度的泛函。这非常了不起,因为电荷密度只是一个三维对象,而 Hilbert 空间和波函数是指数级的。这是一个非常有趣的发现。后来 Kohn 又和他的博士后 Sham 发表了另一篇论文,也就是 Kohn–Sham 波函数,为求解材料量子力学性质的近似值提供了一条实用路径。如今,无论在我们实验室内部还是外部,这个方法都被广泛使用。生成焓则是我们用来理解材料能量的一个测量指标。简单说,我们想知道这种材料具有多少能量——因为如果这个能量高于这些原子能够形成的其他材料,那这种材料就很可能无法被制造出来。所以“稳定”的意思就是,它处在其他材料及其能量构成的凸包(convex hull)之上。我说得够清楚吗?还是需要再解释一下?
Brandon [00:32:42]: 或许可以简单概括一下:密度泛函理论就是把一个随电子数量呈指数级增长的难题
Ekin Doğuş Çubuk [00:32:51]: 没错
Brandon [00:32:52]:或者是系统尺寸的数量级,然后通过引入一定误差将其近似化简,通常得到三次方(n-cubed)阶的近似结果。这样一来,你就可以计算那些原本不可解的量了。当然,这需要付出一定代价。如果能完美做到这一点,我们就不需要实验室了。但我们做不到。这其实可以呼应我们最早的第二期节目。Heather Kulik 曾有一句名言:“材料科学没有 AlphaFold,不仅因为计算量巨大,更是因为基准真值(ground truth)根本不存在。”也就是说,我们其实并不清楚材料晶体的真实结构是什么样,而 DFT 通常是我们获取相关信息的最佳途径。
Ekin Doğuş Çubuk [00:33:34]:是的,我同意。我想补充两点。首先,从定义上讲,DFT 并不必然是近似解。Hohenberg-Kohn 定理表明
Brandon [00:33:42]:它并不一定……
Ekin Doğuş Çubuk [00:33:42]:它可以是精确解。但正如你指出的,交换关联泛函(exchange correlation functional)我们目前还无法获取。而对于基于电荷密度的模型,我们也不知道动能泛函(kinetic energy functional)是什么。其次,即使我们拥有完美的 DFT,我认为我们仍然需要实验室。因为即使 DFT 再完美,我们也没法把 $10^{23}$ 个原子装进电脑里。
Brandon [00:34:03]:没错。
Swyx [00:34:04]:你对这个数字真是执念很深。
Brandon [00:34:06]:但是……不。好吧,是的。但如果算力呈指数级增长,你可以论证在三次方扩展规模下,原则上最终是可以计算出结果的,只需要等待足够长的时间即可。
Ekin Doğuş Çubuk [00:34:17]:哦,是的。我们需要超级计算机。
Brandon [00:34:19]:嗯,是的。但只要
Ekin Doğuş Çubuk [00:34:20]:这会花很长久时间。
Brandon [00:34:20]:是的。但只要三次方是良好的缩放规律,你就……
Swyx [00:34:24]: 作为非科研背景的人,我有个观察,不知道你们是否愿意展开聊聊。我之前在金融行业工作,当时我们使用 Gaussian copula 来给信用违约互换定价,通过计算相关性将一切都归结为一个单一的 kernel。这让我联想到 VAE,感觉两者在精神层面很相似,都是将复杂事物浓缩为单一参数。我好奇是否到处都是这种套路。你们的听起来维度比我高,VAE 差不多就是一个 sigma 的事儿,但原理听起来是一样的?
Liam Fedus [00:35:01]: 是的,电荷密度文件仍然是一个相当大的文件。
Swyx [00:35:04]: 对,没错。你可以稍微含糊带过,但这已经足够了。这是最高阶的部分。是的。
Ekin Doğuş Çubuk [00:35:10]: 我个人不知道有比这更好的方法来预测新材料的稳定性。它肯定不完美,但绝对优于我能想到的其他方法。回到你的问题,我们使用它们是因为对于某些情况,模拟比实验更容易操作,而且两者能很好地互补。然后我们可以形成一个闭环。我们认为仅靠模拟永远是不够的,但在“模拟、AI 和实验”的循环中,我相信我们能比过去更快地取得进展。
当模拟失效时:微观结构与校准
Brandon [00:35:41]: 模拟让你能做的一件事是更快地扩展规模。因为现在计算资源比开设新实验室更容易扩充
Ekin Doğuş Çubuk [00:35:48]: 是的
Brandon [00:35:48]: 那么如何避免... 或者假设你大规模扩展了 DFT,如何避免模型过度依赖于此,同时确保模型基于现实世界这个终极真理?你知道的,你如何平衡这一点?
Ekin Doğuş Çubuk [00:36:05]: 嗯,我们也在扩展实验室。
Brandon [00:36:06]: 是的,你们扩展实验室。
Ekin Doğuş Çubuk [00:36:07]: 对,是的。
Brandon [00:36:07]: 但理论上可以做到。我想 DFT 在现代算力下可以扩展到数百万甚至上亿规模,而你们的实验室,我猜每天也就几百上千次?我不确定。就算高通量场景,和前者比还是相当有限,对吧?
Ekin Doğuş Çubuk [00:36:27]: 是的。人和 LLM 其实都很清楚 DFT 的局限。比如,就算像你说的,我们能用 DFT 做上亿次试验
Brandon [00:36:39]: 嗯
Ekin Doğuş Çubuk [00:36:39]: 我们也没法真正去尝试它们的微观结构。所谓微观结构,是指 DFT 通常模拟的是完美晶体,但现实中的晶体往往并不完美,而这种中等尺度上的微观结构会显著影响材料性能。另外还有一些问题,比如超导温度这类性质,DFT 很难直接模拟。所以就算做上亿次 DFT 试验,也还是不够,必须借助启发式方法、实验等手段。
Liam Fedus [00:37:08]: 所以从海量计算结果到真正在实验室里执行的实验,中间还有一道巨大的筛选。
Swyx [00:37:13]: 这个筛选是靠人、靠 LLM,还是两者结合?
Ekin Doğuş Çubuk [00:37:17]: 可以是两者结合。
Swyx [00:37:17]: 明白。
Ekin Doğuş Çubuk [00:37:18]: 比如长期以来,最好的开源 DFT 数据库 Materials Project 就用实验数据来校准 DFT。我们内部也这么做:只要对某个化学体系感兴趣,就会同时拿到实验结果和模拟结果,然后进行校准。
为什么无机材料和生物领域不一样
Brandon [00:37:37]: 还有一点。我跟很多生物学家朋友聊过,一提到材料,他们总是很困惑——你没法只做一次 XRD 就真正确定结构。因为在生物学领域,看一个蛋白质的晶体结构,通常能以不到一埃的精度大致重构出来。材料的 XRD(X 射线衍……X 射线衍射,对)到底差在哪?
Ekin Doğuş Çubuk [00:38:05]: 衍射。
Brandon [00:38:06]: 衍射,抱歉。在材料科学的实验 XRD 和生物学领域中相比,你会损失哪些信息?为什么说这是一种有损投影?
Ekin Doğuş Çubuk [00:38:16]: 回答这个问题时,很难不显得有点疯。但你不觉得,有机化学和生物学几乎都源于较低的 VC 维数,或者更低的 Kolmogorov 复杂度模型吗?比如,你可以将它们表示为一维序列,几乎可以编译出来。从 Kolmogorov 复杂度的角度来说,这确实更简单。
Swyx [00:38:38]: 一维?
Ekin Doğuş Çubuk [00:38:40]: 就像 DNA 只是一维的
Brandon [00:38:43]: 是的。
Ekin Doğuş Çubuk [00:38:44]: 或者 RNA。
Brandon [00:38:44]: 我想大多数人会认为它是二维的,但
Ekin Doğuş Çubuk [00:38:47]: 好吧,嗯,确实。我不是生物学家,所以
Brandon [00:38:49]: 是的。