“我们有语言的基座模型,却没有物理的基座模型”——Anima Anandkumar 谈物理 AI
🔬“我们有语言的基座模型,却没有物理的基座模型”——Anima Anandkumar,计算学 Bren 讲席教授几年前,加州理工学院教授、Accelerated Understanding 联合创始人 Anima Anandkumar 着手用 AI 开发首个开源天气模型。她去咨询领域内的专家,听到的却满是怀疑:天气是混沌系统,物理模拟很困难、已经发展了几十年、需要超级计算机,数据根本不在那里。尽管心存疑虑,Anima 还是动手去做了。不到一年,她的团队就开发出了 FourCastNet——一个与现有最好的物理模拟相比也毫不逊色的预测模型。多亏了 Anima 和她的后续工作,如今任何人都能用消费级 GPU 在短时间尺度上准确预测天气。1
在 Latent.Space 已发布的约十五期科学节目中,我们聊过原子、分子、材料、生物和数学。Anima 是研究连续物理系统的先驱。天气、核聚变、流体或热流,都是极其难以建模的庞大科学领域:它们规模巨大、高度混沌,而且本质上是多尺度的。这是 AI 社区多少有些忽视、但我们预期会快速增长的领域。在接下来的节目里,我们计划更多地覆盖大型物理系统。
从 Anima 的工作中你还能看出,AI 的这个分支抗拒着席卷领域其他方向的 scaling 思路。数据并不存在:这些领域的开源数据集大多只有几万到几十万个样本,远达不到“吃 token”的 Transformer 所需的量级。更糟的是,物理所要求的分辨率会把上下文长度推到千亿级别,所以你没法靠往问题里砸更多 token 来解决。但这并不是天花板,只是一条更慢的路:这里的进步来自把结构与归纳偏置构建进模型。抱歉了,各位被“苦涩教训”深度洗脑的语言模型研究者。
“如果每个维度哪怕只有几百个网格点——这只是工业规模的起点……我们说的就是千亿乃至万亿的上下文长度。所以别指望用 transformer 处理这种规模的问题,全世界的算力加起来都不够。”
底层的数学
为了对付这类系统,Anima 开创了一种名为 Neural Operators 的技术,它是过去十年里 AI 领域最美的理论进展之一。2 它让你把数据与物理定律结合起来,实现多尺度的输入与输出。我们建模的不再是一张网格,而是一个在多个尺度上演化的函数。这让 Anima 和她的团队能把基于物理直觉的先验构建进模型。

想看物理先验对 AI 建模仍然多有帮助,不妨重新审视全球尺度的天气预报问题。地球是个球体,这意味着精确建模需要用对基函数集——3 即 球谐函数(Spherical Harmonics)。在网格上跑天气模型,它很快就会崩掉。换到这个问题的自然基上,稳定性则能维持得久得多,足以把预报从几天外推到几个月。Anima 的 Fourier Neural Operator 直接在这个频域中学习,其球面变体支撑着 FourCastNet 3——它对全球天气建模,并能长时间稳定地持续推演到未来。

物理世界是宽容的
Anima 还把 Neural Operators 应用于其他物理领域,一个引人注目的观察是:物理世界比你想象的更宽容。在核聚变中,几千个样本就足以预测等离子体破裂,而且比传统模拟快一百万倍。
这些都不是对 scaling 的否定,而是通往 scaling 的另一条路。Anima 归根结底仍想打造一个“物理的基座模型”——一个横跨多种现象、既能做模拟又能做设计的模型。通往那里的方式,是把物理世界已有的结构构建进去,而不是等待永远不会存在的数据。这只是一个开端,而且会比 AI 中由 token 驱动的部分花更长时间,因为对物理世界而言,token 从来都不是答案。
“深度学习里所有管用的东西,我们都拿过来,但让它们更有原理性一点。”
天气只是开始
Neural operators 和天气建模是我个人的心头好,所以这篇博客和这期节目花了不少篇幅探讨这方面的工作。而 Anima 的成果远不止于此!在节目中,我们还聊到了她的另外几项近期进展:
Anima 有一系列整合神经网络与自动证明技术的工作。我们聊到了 TorchLean——一个新框架,让你可以在证明助手 Lean 中编写 PyTorch 风格的网络,并对它们进行形式化验证。这对证明神经网络的各类界(bounds)意义重大——比如,有人想把神经网络作为控制回路的一部分装进聚变反应堆时,这会非常关键!
Anima 最近获任命加入联合国科学咨询委员会!我们和她聊了她把基于证据的观点带入政策制定的目标,以及科学领域的 AI 如何改善全世界人们的生活。
这期节目对每个 AI 或科学极客都有看点!优美的数学?✅ 老派的调和分析?✅ 现代 AI 的基础性进展?✅ 建模物理世界的实用方法?✅
1这项工作已经开花结果,发展为 AI 预报的一整个领域,接下来几个月我们会在播客中更多地覆盖这个主题。
2这是一篇优雅且技术上极具深度的论文。如果你有一大块完整的时间去钻研,它是一记绝佳的“极客陷阱”(nerd snipe)!
3本文所有破折号均由人类生成。
关于本期节目的讨论
评论 转发
Latent Space: The AI Engineer Podcast由 AI 工程师打造、也为 AI 工程师服务的播客!2025 年,超过 1000 万读者和听众来到 Latent Space,了解 Software 3.0 的新闻、论文与访谈。
我们直接对话推动前沿的创始人、构建者和思想者,覆盖正在改变每个领域的基础模型:代码生成、多模态、AI Agent、GPU 基础设施等等。既为你带来对当下热点的权威解读,也率先介绍你三个月后就会用上的技术!我们首发过 OpenAI、Anthropic、Gemini、Meta(Soumith Chintala)、Sierra(Bret Taylor)、tiny(George Hotz)、Databricks/MosaicML(Jon Frankle)、Modular(Chris Lattner)、Answer.ai(Jeremy Howard)等公司的新闻与独家访谈。
完整节目笔记请见 https://latent.space
赞助与商务合作:[email protected]由 AI 工程师打造、也为 AI 工程师服务的播客!2025 年,超过 1000 万读者和听众来到 Latent Space,了解 Software 3.0 的新闻、论文与访谈。
我们直接对话推动前沿的创始人、构建者和思想者,覆盖正在改变每个领域的基础模型:代码生成、多模态、AI Agent、GPU 基础设施等等。既为你带来对当下热点的权威解读,也率先介绍你三个月后就会用上的技术!我们首发过 OpenAI、Anthropic、Gemini、Meta(Soumith Chintala)、Sierra(Bret Taylor)、tiny(George Hotz)、Databricks/MosaicML(Jon Frankle)、Modular(Chris Lattner)、Answer.ai(Jeremy Howard)等公司的新闻与独家访谈。
完整节目笔记请见 https://latent.space
赞助与商务合作:[email protected]订阅收听平台Substack AppApple PodcastsSpotifyRSS 订阅源本期出场
Brandon Anderson近期节目
Simulation: the new Scaling Law — Joon Sung Park, Simile AI8月21日
🔬The BioAI Phase Shift - Matthew McPartlon & Neil Patil, Chai Discovery8月11日 • RJ Honicky
The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten8月3日
Codex from 0 to 10M Users: Building ChatGPT Work — Akshay Nathan, OpenAI7月28日
Inside the Model Factory — Eiso Kant, Poolside AI7月23日
🔬Causal Models Need Causal Data - Xaira’s X-Cell model for Drug Discovery (Bo Wang & Ci Chu, Chief Discovery Officer & Chief AI Scientist)7月21日 • RJ Honicky
🔬 The Lab of the Future Should Feel Like a Data Center — Andy Beam & Rafa Gómez-Bombarelli, Lila Sciences7月16日