← 文章 / AI技术
The Decoder 4小时前 · 2026-09-11 07:09:48 · 2 阅读

GPT-6 Astra 让数学家稍松一口气,OpenAI 称这是有意为之

图片描述

OpenAI 的 GPT-6 Astra 在面向开放数学问题的 ErdosBench 榜单上登顶,但首席科学家 Jakub Pachocki 表示公司并未专门针对数学做优化。这本身就说明了"AGI"目前的真实水平。

Astra 发布之后,数学家们可以稍微喘口气了(虽然很可能只是喘一小口气)。这个领域近来一直在为各种存在层面的焦虑所困扰,而新模型确实推动了数学研究的进展,只是速度既没达到一些人的期待,也没引发另一些人的担忧。

在 ulam.ai 的 ErdosBench 上,Astra 曾拿下第一(更新:随后被 Fable 5.1 反超,后者解题数更少但综合表现更好)。这个基准包含 226 道受著名 Erdős 问题启发的开放数学题。Astra 得分 3.23,共解决 106 道题,其中 43 道完全解决,另外还推翻了 27 道题的既有结论。

与 Sol 相比——后者在最大推理强度下解决了 78 道题——Astra 的科学写作更扎实,也更少夸大结论,某些情况下甚至对自己的成果有所低估。基准的开发者 Przemek Chojecki 总体评价它在各项数学研究能力上有"5% 到 10% 的稳定提升",但这个基准离饱和还很远。

Fable 5.1 后来把 GPT-6 Astra 从 ErdosBench 榜首挤了下来,以 3.25 的得分险胜 Astra 的 3.23,不过解题总数仍是 GPT-6 Astra 最多。| 图片来源:ulam.ai

OpenAI 刻意没有为数学做优化

OpenAI本可以把Astra在数学研究上做得更强,但选择不这么做——尽管它在首次公布时把数学上的突破放在了最显眼的位置。OpenAI首席科学家Jakub Pachocki在文章"An Alien Mind"中写道:"……我们认为,如果把更多精力集中在数学研究上,模型在这方面确实可以做得更好,但我们没有把这个方向放在优先位置,因为我们对RSI和自动化对齐研究有着强烈的紧迫感,这一点我稍后会详细讨论。"

也就是说,目前能力最强的数学模型并非针对性优化的结果,而是其他优先事项的副产品。OpenAI正把资源大量投入RSI(递归自我改进)和确保未来AI系统的安全性,Pachocki写道,"我们相信这是在未来AI研究前沿保持领先地位的唯一途径。" (注:该文发表后,据报道OpenAI已训练出更强的内部数学模型,此事颇为复杂;而RSI和AI安全议题也迅速发酵。)

Pachocki的这番话还有另一层意味:它表明在AI发展的陡峭前沿,确实存在艰难的优化取舍。一个在数学上称王的模型,未必在所有领域都称王。这让我想起剑桥大学研究员Adam Hunt做的一张可视化图,它对比了AI的两种可能路径。"主流AGI"路径假设模型会逐步、全面地提升,直到覆盖人类的所有任务。

另一种场景描绘的是一条越来越"尖刺化"的轨迹——模型在编程、数学等少数领域表现极强,却在语言质量、常识或社交推理等方面停滞甚至退步。这样得到的将是一个高度专业化的模型,而非大多数人所说的通用人工智能(AGI)。当然,想怎么叫都随你。

AI 发展的两条路径:全面渐进式提升(上)与极端专业化、基础能力停滞(下)。| 图片来源:Adam Hunt

Pachocki 提到 OpenAI 在 Astra 中刻意跳过了数学优化,这恰好印证了"尖刺化"假说。即便是头部 AI 实验室,也无法同时在所有方向上追求极致。能力在优化哪里就长在哪里,强化数学就意味着在别处做减法。不过,RSI 优先级背后寄托着一种期望:模型最终能自行完成这些优化,在所有维度——包括数学——上实现更快速的全面提升。

数学正在与 AI 搏斗,也在与自身搏斗

无论 Astra 比前代提升了 5% 还是 50%,更深层的问题始终悬而未决——数学界正面对一个算力爆发的新世界,算力能帮人解题,却未必能帮人理解。数学家陶哲轩在 2026 年国际数学家大会上提出了这一隐忧:如果 AI 模型生成证明的速度持续快于人类验证的速度,数学界面临的将不再是证明稀缺,而是证明过载。

届时,关键任务将不再是解题,而是判断哪些结果真正有意义。陶哲轩认为,数学正面临一场价值与实践层面的危机,他将之与 20 世纪初基础体系震荡相提并论。

数学领域最难的问题目前仍未被攻克,这多少为这门学科争取了一些时间。不过大方向似乎已经确定,即使有些数学家认为语言模型缺乏人类式的创造力,难以带来真正的突破。出于类似的原因,也有人对 AI 能否真正实现自我改进心存疑虑。

原始来源: The Decoder

评论 (0)