← 文章 / AI技术
Simon Willison 3小时前 · 2026-09-09 07:59:12 · 1 阅读

关于 Navier–Stokes 千禧年大奖难题

关于 Navier–Stokes 千禧年大奖难题via)OpenAI 交出了一份令人瞩目的成果:用一个未发布的模型,给出了 Navier–Stokes 方程解的存在性与光滑性问题的解答。这是自 2000 年 5 月 24 日起悬赏 100 万美元的七大 千禧年大奖难题之一。

不过这一成果多少被指控蒙上了阴影。纽约大学数学教授 Tristan Buckmaster 指责其中存在不光彩的操作——他此前正与目前就职于 Anthropic 的优秀数学家 Levent Alpöge 合作研究相关问题。

Tristan 在提出质疑的同时,还仓促发布了自己一方的结果。这份 PDF 说明了事情的经过。极简版本是:Tristan 和 Levent 在这个问题上研究了近一年,大量使用 Claude 和 Codex(主要是 GPT-5.6 Sol),并在 8 月 15 日取得突破。随后数学圈流言四起,两人听说 OpenAI 获悉 Anthropic 解决了"一个重大开放问题",于是他们主动联系,得知 OpenAI 有一个团队正用类似方法研究相关问题。引用 Tristan 的话:

我问他们第一次发送 prompt 是什么时候。OpenAI 一段时间内没有正面回答这个问题。最终确认,那是在我们工作的信息传到 OpenAI 之后的几天内。

我问该模型是否在训练中使用过、或能访问我们在 Codex 里的会话记录——整个项目期间我们的草稿全都放在里面。对方告诉我模型不会查询用户数据。我再问关于训练的事,就没有得到回答了。

之后的情节就更加复杂了。OpenAI 团队提出可以等 Tristan 先发表,或者让他在关于他们成果的论文上署名,但明确表示不会邀请 Levent 担任共同作者——因为 OpenAI 与他的雇主是竞争关系。

以下是 OpenAI 对自己工作的描述:

9月1日星期二,我们得知传言称两个千禧年大奖问题已被解决。受此传言以及内部模型性能跃升的启发,我们启动了评估工作,将该模型应用于所有尚未解决的千禧年大奖问题及其他若干高影响力问题。[…]

智能体于9月5日星期六得出了证明结果,距首批智能体启动约88小时。随后通过 GPT‑6 Astra 进行 Lean 形式化验证,又耗时17小时。

在所有尝试的问题中,智能体共发送了490万条消息,消耗约3000亿输出 tokens。其中解决 Navier–Stokes 问题的过程中,智能体发送了270万条消息,消耗约1300亿输出 tokens。

(我们不了解他们所用内部模型的成本结构,但按 GPT‑6 Astra 的公开 API 价格计算,3000亿输出 tokens 的费用为 $15,000,000。)

以下是他们对 Tristan 和 Levent 工作的回应(强调为笔者所加):

我们的工作始于9月1日,起因是一则传言,后来我们意识到涉及 Anthropic 员工 Levent Alpöge 和纽约大学数学系教授 Tristan Buckmaster。在完整项目及 Lean 验证全部完成后(9月6日),我们基于传言认为他们同样得到了 Navier–Stokes 的解法,便主动联系他们,提议联合发布成果并在公告中认可其工作优先权。[…]

我们(研究人员与智能体)在他们公开发表之前,从未以任何方式接触到其工作成果——尤其是,解决该问题的过程中未访问任何特定用户数据。虽然可能性不大,但我们无法排除:他们使用我们产品时产生的去标识数据在某种程度上帮助改善了我们的模型improve our models)。不过,我们的证明存在显著差异,即使在 Euler 方程的情形下,所证明的具体结果也不尽相同(有外力驱动 vs 无外力驱动)。

在我看来,事情的来龙去脉是这样的:OpenAI 听说有些千禧年大奖难题已经被 LLM 解出来了,便抓住机会展示最新模型的实力,却没怎么考虑过——抢在别人前面发表这件事,观感上相当微妙,毕竟被抢的那支团队大半年时间都在用 OpenAI 自家的模型研究这道题。

这个局面很像当下计算机安全领域的现状。Anil Madhavapeddy 最近指出,如今哪怕只是听道有 bug,就足以触发漏洞挖掘——只要知道某款软件存在未修复的漏洞,就能让 agent 去把它找出来。数学界现在也是同理吗?仅仅知道某个问题存在一份尚未发表的解法,就可能驱动数百万美元的 LLM 算力支出,只为抢先到达终点。

这也再次戳中了我长期以来对这套机制的困惑。AI 实验室说你的数据"用于提升模型性能",这话到底是什么意思?

过去我最爱提的两个假设性问题是这样的:

  • 如果我在使用 Codex 时,某条 API key 意外被写进了上下文,将来别人问模型要一个 API key,我的被原样吐回来的概率有多大?(我有一次问过 OpenAI 的人,他们管这叫"regurgitation"问题,说他们非常小心地防止这种情况……但也不会告诉我具体怎么防的。)
  • 如果我用 ChatGPT 讨论公司未来的新方向,六个月后某个竞争对手问"X 公司下一步可能做什么",我的信息被泄露的概率有多大?

现在我最想提的假设性问题变成了:

  • 如果我用 ChatGPT 辅助解出一道千禧年大奖难题的一部分,我的成果渗入训练数据后,后续模型帮别人先解出完整答案的概率有多大?
原始来源: Simon Willison

评论 (0)