OpenAI 1 万 Agent 88 小时解出 Navier-Stokes 奇点,冲击千禧年大奖
今天新闻密度太大,基本没给新动态留位置。我们平时承诺会覆盖所有新的百亿独角兽融资,所以 Cognition 的 480 亿美元融资 和 Mistral 的 240 亿美元融资 本来都能挤进头条;我们很关注 imagegen,GPT Image 2.5 本来也能单独占一条;我们一直密切跟踪 Dreamer 的故事,它转型为 Meta 的 Muse agent 本也该上榜。但……你知道的,现在的门槛实在太高了。
OpenAI@OpenAI 我们在此分享 Navier-Stokes 千禧年难题的一个解法,这是数学前沿上最深刻的难题之一。
该证明由一组 agent 完成,使用的是 OpenAI 的下一代模型,能力远超 GPT-6 Astra。
该问题 …
下午 5:20 · 2026年9月8日 · 145K 浏览239 条回复 · 603 次转发 · 2.72K 点赞
下面的摘要涵盖了核心事实。关于署名争议,我们建议不必深究——OpenAI 和作者们已经披露了足够的细节,足以认定 OpenAI 的成果是真实的,尽管过程存在一些争议。
2026/9/7–9/8 的 AI 新闻。我们检索了 12 个 subreddit、544 个 Twitter 账号,未涉及 Discord。AINews 网站可以搜索所有往期内容。提醒一下,AINews 现已成为 Latent Space 的一个板块。你可以自由调整邮件推送频率!
AI Twitter 回顾
与 OpenAI 相关的账号称,借助 AI 完成了一项 Navier–Stokes 方程的研究成果,舆论立刻分化为技术关注、质疑声和场外闹剧三方。
这批推文中最具体的公开说法来自 Ethan Knight,他表示“Navier-Stokes 的解是约 1 万个 agent 协作的产物”,并补充说 OpenAI 花了“过去一年”通过“multiagent RL”训练模型学会协作,认为难题或许能靠“海量的非结构化并行测试时算力”攻克,由模型自行决定如何组织分工 @eknight。
不少围观者将其解读为 OpenAI 宣称用 AI 证明了与 Navier–Stokes 千禧年难题相关的内容,尤其是有限时间奇点/爆破方向。有人调侃式地转述:OpenAI 声称光滑流体可以“爆破成奇点”,用了“1 万个 agent”和“88 小时”,而数学界的认可只是“小小的形式流程” @LearnOpenCV。
更广泛的评论把这件事看作对“前沿 AI 做不了严肃研究或编码级技术工作”这一信念的压力测试。Theo Jensen 称这是科学界“‘AI 根本不会写代码’信念崩塌的时刻” @theo。
Hrishikesh / hrishioa 把这次公告视为“高算力时代”的证据,认为旁观者应该“据此调整自己的规划” @hrishioa。
公告还顺带引发了一些运营层面的猜测:有人开玩笑地把看到 ChatGPT 延迟警告与 OpenAI 可能把大规模算力转向 Navier–Stokes 计算联系起来,不过这只是纯粹的猜测,并非证据 @teortaxesTex。
先交代声明与背景
推文中可确认为事实的部分
有与 OpenAI 相关的说法在传播,称 Navier–Stokes 的"解"涉及约 10,000 个 agents 协同工作 @eknight。
同一来源称,这些系统通过 multi-agent reinforcement learning 训练了大约一年 @eknight。
所述高层方法侧重 parallel test-time compute 与模型自组织,而非单次长链证明尝试 @eknight。
公众读者将此说法理解为涉及 Navier–Stokes 存在性/奇点问题——Millennium Prize Problems 之一,但推文集中并未给出确切的定理表述与证明范围 @LearnOpenCV。
讨论发生时,数学界显然尚未认可该结果;即便是那条玩笑帖也强调,其正确性仍未得到学界验证 @LearnOpenCV。
推文未能证实的内容
所提供的推文中未出现任何定理表述、preprint、证明概要、formal verification 产物、benchmark 报告或独立审稿意见。
被反复提及的"88 小时"细节仅出现在该组推文中的一个讽刺帖里,并未出现在更直接的 OpenAI 相关声明中,因此仅凭这些证据不应将其视为已确认 @LearnOpenCV。
人类与模型各自承担什么角色并未说清楚:"约 10,000 个 agent 协作"这句话并没有交代人类是负责拆解搜索、筛选引理、校验步骤,还是仅仅启动了基础设施 @eknight。
"解"这个说法有歧义。在数学语境下,它可以指完整证明、证明策略、候选反例、形式化推导,甚至只是一个研究方向。推文没有对此做区分。
目前没有任何公开信息说明该成果针对的是标准的三维不可压缩 Navier–Stokes 全局正则性问题——无论是在 (\mathbb{R}^3) 还是环面上——还是某个变体或辅助命题。
为什么歧义很重要
Navier–Stokes 千年难题有非常明确的标准表述。如果声称有限时间奇点"可以出现",那将是爆炸性结论,因为它意味着对相应形式下的全局正则性给出了否定答案;这类声明需要极高的精确度和严格审视。
在前沿模型讨论中,"AI 解决了 X"往往把多层工作压缩在一起:猜想生成、搜索、证明草拟、证明校验、社区验证。推文只给出了系统层面的描述,没有交代数学结论本身的认知状态。
推文透露的技术细节
公开的技术信息与其说是关于流体力学,不如说是关于一套研究系统的架构。
隐含的研究论点:对于困难的推理任务,在推理时扩展协调与搜索,可能比单纯扩展一个单体大模型同样重要,甚至更重要。
社会技术层面的含义:这是对许多实验室早已暗示的趋势的明确表述——从“更大的单一模型”叙事转向 agent 集群、并行搜索和测试时算力扩展。
运营层面的含义:如果属实,这一结果表明实验室愿意为一次性科研目标投入大量推理算力,而不仅仅是产品或基准测试。
技术上的启示
一万 agent 的规模意味着需要相当庞大的基础设施,用于:
任务分解,
agent 间通信,
记忆/状态持久化,
搜索树管理,
奖励设计或代理评分,
候选证明路径的聚合与筛选。
如果这项工作确实触及了某个困难数学问题,那么关键创新点可能不在“LLM 写出证明”,而在于带有学习型协作策略的分布式定理搜索。
技术信息的缺失
文中没有提到:
定理证明器集成,
形式化验证,
证明助手工具链,
符号代数系统,
流体仿真组件,
检索语料库,
模型规模,
算力预算,
pass@k 类指标,
与单智能体基线的消融对比,
错误率或证明校验成功率。
这种缺失是核心问题:公众讨论已远远跑在公开的技术细节之前。
事实与观点
被当作事实呈现的主张
该结果在公开讨论中被表述为 Navier–Stokes 方程的解/证明 @LearnOpenCV。
观点与解读
"解决难题最有效的方式之一"就是用大规模的无结构化并行测试时计算和自组织智能体——这是一种强烈的战略判断,仅凭推文中的证据尚无法普遍验证 @eknight。
"科学界正在经历他们以为 AI 根本不会写代码的崩溃时刻"属于对社区心理的评论,并非可验证的判断 @theo。
"我们确实处于高算力时代"是对行业方向的宏观定性 @hrishioa。
"88 小时"、"领导力启示"和"委派 10,000 个 AI 智能体"的表述属于讽刺,不应当作纪实细节来读 @LearnOpenCV。
有观点称 ChatGPT 的卡顿是由这次实验导致的,但目前没有证据支持这一说法 @teortaxesTex。
不同视角
看好 / 支持方观点
最有力的支持观点是:这为一种新的扩展定律提供了证据——不仅仅是模型规模与训练算力,大规模并行、自组织的推理阶段协作同样能在前沿研究问题上解锁质的新能力 @eknight。
Theo 的反应体现了另一个乐观解读:如果 AI 确实能为顶级数学难题做出实质贡献,那么对 AI 无法胜任严肃技术工作的质疑将更难站住脚 @theo。
Hrishioa 提出的"高算力区间"框架暗示了对实验室和创业公司的战略影响:那些低估推理阶段算力编排重要性的团队,可能是在错误的方向上规划 @hrishioa。
质疑 / 谨慎方观点
最核心的质疑来自数学层面:在定理陈述、完整证明和同行评审都就位之前,称之为"解法"为时过早。该帖子本身也承认,领域内的正式认可仍在等待中 @LearnOpenCV。
另一个质疑点在于叙事压缩:"一万个 agent 解决了 Navier-Stokes"这种说法容易掩盖人类在问题界定、筛选和验证中究竟起了多大作用,相关推文并未披露各自贡献的比例。
还有可复现性的隐忧:没有公开的原始数据,独立研究者无法判断这一突破是稳健的、选择性挑选的,还是一次性结果。
中立 / 分析方观点
一个中立的看法是:即便证明最终不成立,这件事依然值得关注。如果一个系统能就如此量级的问题生成数学上非平凡的候选路径,这本身就意味着一项有意义的 capability 里程碑。
另一种中立视角是把科学真相和系统创新分开看。即使定理声明不成立,多智能体强化学习 + 并行测试时计算这套架构,仍可能代表 AI 研究方法论上的重要进展。
这场讨论也揭示出人们对“能力”的定义正在变化:焦点正从基准测试分数,转向大规模分解现实世界的认知劳动。
为什么这很重要
这件事正处在前沿 AI 三大趋势的交汇点上。
从训练时扩展到推理时扩展:强调“非结构化的并行测试时计算”,正好契合行业整体转向——把算力花在解题时刻,而不仅仅是预训练阶段 @eknight。
从基准表演到领域级声明:Navier–Stokes 在大众认知中的分量,是基准分数的小幅提升无法比拟的。触及千禧年大奖难题的声明,瞬间就能扩大受众,并把认知层面的赌注抬高。
为什么偏偏是 Navier–Stokes 具有象征意义
千禧年难题早已成为一种文化符号,代表着最难的那类形式化智力工作。
如果在这方面取得进展,就意味着 AI 系统不只是加速已知的工作流程,而是进入了正确性极其脆弱、声誉门槛极高的领域。
不过,数学格外不留情面:和许多产品任务不同,这里没有“大体正确”的容身之地。这也解释了为什么外部验证主导了整个讨论。
如果声明被证实意味着什么
这将有力证明分布式定理搜索是一种严肃的研究范式。
形式化方法工具面临新压力:需要消化模型生成的证明候选。
AI-for-math 领域的投资大概率加速,重心会落在 orchestration、verifier coupling 和 scalable search 上。
对 test-time compute 和 multi-agent RL 有用性的认知将更新——它们不再只适用于 coding agents 和办公自动化,而是有更广的落地空间。
它公开了 OpenAI 内部的战略方向:大规模 agent 协作被定位为核心能力之一。
它改变了外界对算力投向的预期,也改变了实验室用什么样的演示来宣告前沿进展的惯例。
竞争对手可能被迫披露类似系统,或匆忙抛出"AI 做科研"的对标声明。
一条推文写道"Roon 这人看起来是那种会守 NDA 的",指向故事背后的社交层面:部分观察者预期圈内更知名的人物会保持沉默,结果细节反而被其他人拼凑出来 @jd_pressman。
Theo 那条"AI 根本不会 ACTUALLY code 的崩溃时刻"的帖子,本质上是一种社交挑衅——把批评者框定为对能力更新的情绪反应,而非先回到证明标准的讨论上 @theo。
关于"OpenAI 电影"海报和猜谁出镜的两条推文,本身不直接涉及 Navier-Stokes 声明,但折射出一种并行倾向:人们习惯把 OpenAI 内部叙事映射到 Greg Brockman、Ilya Sutskever、Jared Kaplan、Dario Amodei、Paul Christiano 等具名人物身上,即便证据很薄 @willdepue、@jachiam0。在 Navier-Stokes 讨论的语境下,这种倾向之所以重要,是因为人们会迅速把技术声明转化为署名归属和圈内剧情的话题。
梗图和猜测帖反映了一个前沿 AI 发布中的老套剧本:官方信息越模糊,越容易滋生 meme、"疑似泄露"的碎片、外推和过度吹捧。@LearnOpenCV、@teortaxesTex。
即便这一声明未被完全证实,影响依然存在
围绕署名、信息披露和"谁有资格说话"的戏码
讨论中另一条副线是:细节是否在间接泄露、谁被授权透露、旁观者该从碎片中推断多少。
为什么署名与争议在技术层面很重要
对数学结论而言,溯源不只是八卦,它直接影响:
谁提出了猜想,
谁挑选了候选引理,
证明是机器生成的还是机器辅助的,
署名如何分配,
专家对这份成果有多大信任。
在 AI 研究中,"多智能体解决了 X"的说法也模糊了传统贡献认定。当数千个 agent 并行搜索时:
证明的"作者"是谁,
编排团队的角色是什么,
到底该引用或复现什么?
当一项声明大到足以在论文或证明公开之前改变公众认知时,NDA 和披露规范就显得格外关键。
其他新闻
Meta 发布 Muse 及其个人 Agent 安全架构
Meta 上线了 Muse,一款面向消费者的"个人 AI Agent",定位是始终在线、可连接 App、具备浏览器能力、目标驱动,并借助 Meta 自有生态和集成获得强大分发能力。@finkd、@alexandr_wang、@MetaNewsroom。产品细节不断被曝光:持久化隔离 Linux VM、浏览器操作、WhatsApp/App 界面,以及对接 Gmail、Calendar、Outlook、Plaid、OpenTable、Docs、Spotify、Peloton 等服务器的 connector,还有 Instagram、Messenger、Facebook、Marketplace 等 Meta 原生 connector。@alexandr_wang。
安全架构是被重点强调的差异化卖点。Meta 团队表示,每个 Muse 都运行在独立的安全虚拟机中,操作由独立的 Sentinel 负责管控,密钥绝不直接暴露给 agent,敏感操作需要审批,还设有最高 30 万美元的公开漏洞赏金 @shengjia_zhao、@alexandr_wang。此外还有明确的商业基础设施:通过 Stripe Link 支付并提供 agentic 支付保护 / 退款保证,Shop Pay 集成也在路上 @alexandr_wang。
从业者的早期反馈相当积极,尤其是权限管理、密钥管理和消费者实用性方面。来自 @matthuang、@signulll 和 @lilyjclifford 的评论表明,Muse 可能是首批真正易于理解的个人 agent 产品之一——在这类产品中,瓶颈在于上下文和权限,而不是模型的原始智商。Meta 还表示,首日使用量超出内部预期的 10 倍 @alexandr_wang。
模型与生态布局:Meta 的 Muse Spark 1.3 很快就接入了 Cursor 等第三方工具 @cursor_ai,而竞技场式基准测试显示,Muse Spark 1.3 Max 在 Web 开发编码负载上的性价比具有竞争力 @arena。
OpenAI 发布 Image 2.5 并上线 Astra
OpenAI 同期还发布了 ChatGPT Images 2.5,不过风头多少被盖了一些。这次更新重点在 延迟较 Images 2.0 降低最多 50%,画面真实感更强,多次迭代编辑的一致性更好,支持基于注释的局部修改,新增透明背景,以及用于引导生成的 Sketch 工具 @OpenAI、@ChatGPT、@sama。
同时上线了 两个 API 变体:GPT-Image-2.5 Flare 主打速度与画质平衡,Sunburst 面向高精度细节场景 @reach_vb。Arena 榜单显示新模型在文生图、图像编辑和多图编辑三项均拿下 前两名,其中多图编辑提升尤为显著 @arena。集成方面,fal、Higgsfield、Manus 和 Hermes Agent 已快速接入 @fal、@higgsfield、@ManusAI、@Teknium。
Astra 的可用范围明显扩大。OpenAI 确认 GPT-6 Astra 已在 Codex 和 ChatGPT Work 中全面开放给 Plus、Pro、Business 和 Enterprise 用户 @OpenAI。社区实测也展现了较强的计算机操作能力:@theo 报告 Astra 在 macOS 上编译并运行 Super Smash Bros. Melee,经约 6 小时循环后达到 120 FPS;Vals 则称 Astra 在不到 3 小时内、无需专用测试框架的情况下,几乎跑满了一个尚未公开的 computer-use 评测——在 Minecraft 里搭建了 下界传送门 @ValsAI。
Agent 框架、后训练与服务基础设施
Harvey 与 Baseten 的 M&A 尽调工作,是模型与 harness 协同优化的典型案例。其 递归语言模型(RLM)harness由一个根 agent 检索数据室、将文档审阅任务委派给子 agent,并在高达 80M tokens 的语料上汇总发现。在合成基准 LAB Diligence 上,从标准 tool loop 切换到 RLM harness 后,各模型的平均 rubric 通过率从 23% 提升至 62% @harvey、@nikogrupen。
harness 内部的 post-training 效果,至少与 harness 本身同等重要。Harvey 报告称,在 GLM-5.2 上做自蒸馏 SFT 将通过率从 46% 提升到 60%;在 Qwen3.5-122B-A10B 上施加 GRPO,在 held-out rooms 上将通过率从 30% 提升到 63%,文档覆盖率从 62% 提升到 96% @harvey。更广泛的启示——也得到多方呼应——是:agent 基准测试应把编排和 post-training 视为模型系统的一部分,而非外部胶水。
LangChain/deepagents 为 harness 设计交付了一批实用原语,包括 subagent forking(将 supervisor 上下文向下传递给子 agent)以及 managed connections(为 agent 自有或用户自有的身份抽象掉 OAuth / token / 授权流程)@colifran_、@hwchase17、@caspar_br。这表明围绕长程 agent 负载的技术栈正在走向成熟。
推理与系统:Sparse Attention、Agentic Serving 与 Decode Megakernel
vLLM 的长上下文服务优化值得重点关注。该项目为 sparse-MLA 模型推出了 Hybrid HiSparse:KV 尽量留在 GPU 上,放不下时把冷 KV 页卸载到主机内存,同时用热缓冲服务 indexer。在 8×H200 节点上跑 1M 上下文的 GLM 5.3、并发配置为 32 时,普通卸载方案只能维持 5–6 个请求,而 Hybrid HiSparse 能维持 19–25 个 @vllm_project。这对 RL rollout 和长上下文高并发场景意义重大——否则受 VRAM 限制的 decode 会严重拖垮吞吐。
vLLM 还发布了针对真实 agent 流量的全栈优化报告,基于 AgentX 做了基准测试。几个关键结论:流水线并行对冷启动长 prompt 有帮助,但在热短轮次上反而吃亏;decode 上下文并行的效果高度依赖模型的 attention 结构;而在快节奏 agent 场景下,会话粘性路由可以胜过朴素的负载均衡,因为热 KV 缓存的价值甚至超过了排队均衡 @vllm_project。
Cohere 开源了一套围绕"decode megakernel"构建的服务栈,宣称在 North Mini Code 上比 vLLM 最快提升 1.58×,高 batch 规模下端到端提升 1.25×–1.41× @cohere。结合 Baseten 的消息——前沿 RL rollout 现在能在全球范围内 40 秒内上线新策略权重,且只需 6 秒暂停 @baseten——明显趋势是:基础设施正走向为持续后训练和 rollout 刷新而专门设计,而非静态模型服务。
热门推文(按互动量排序)
Anthropic 离职与安全警告:Jacob Hilton 从 Anthropic 离职,指出 Anthropic 和 OpenAI 都在不负责任地竞速通往自我改进的超级智能,内部人员私下将灭绝风险视为真实威胁 @hilbertspaess;他随后还称当前系统很快就能入侵基础设施、快速改变多个领域 @hilbertspaess。
OpenAI 用户数据澄清:OpenAI 正式声明 Navier-Stokes 相关工作中未访问任何特定用户数据,但提示可能存在去标识化后的衍生改进,这一表态引发大量争议 @OpenAI。
Cognition 融资:Cognition 宣布完成 超 20 亿美元融资,估值 480 亿美元,并称 5 月以来年化营收从 4.92 亿美元增至近 9 亿美元 @cognition。
Meta Muse 发布:Mark Zuckerberg 发布 Muse 的推文是当天互动量最高的产品推文之一 @finkd。
AI Reddit 热点回顾
/r/LocalLlama 与 /r/localLLM 回顾
1. 中国多模态 AI 发布:驾驶与 Flash API
Qwen/Qwen-Drive-1.0-4B · Hugging Face(热度:549):Qwen 发布了
Qwen/Qwen-Drive-1.0-4B,这是一款基于未修改的 Qwen3.5 4B VLM 微调而来的开源自动驾驶 VLM,BF16 完整 checkpoint 约9B,并额外提供planner-sft、planner-rl和perception模块。据其技术报告,Qwen-Drive-1.0 引入了外部 BEV 感知头,支持 3D 目标检测、语义占用预测及 BEV 地图分割,同时配备 Planning Expert 模块用于生成未来自车轨迹,训练采用分阶段混合驾驶监督数据与通用 VLM 数据。官方称其在 WOD-E2E、NAVSIM、驾驶 VQA 以及开环/伪闭环/闭环规划评测中均具有竞争力,同时基本保留了通用多模态能力。DeepSeek Flash 4.1 已通过 API 进入测试并逐步推送(热度:528):据报道,DeepSeek V4.1 Flash 已通过 API 进入内部测试:保持现有
base_url不变,调用模型deepseek-v4.1-flash-expires-on-0910,定价与deepseek-v4-flash保持一致,单账号并发上限为20(来源)。翻译后的公告称其采用"全新模型架构",原生支持多模态,能力更强、吞吐更快、成本更低。评论区实测反馈加速约2.24×,token 效率提升最高约~30%,不过有评论指出观测到的速度提升可能部分源于测试阶段并发量较低,而非纯粹由架构带来。 整体评论情绪对 DeepSeek 及开源权重进展高度积极,唯一的实质性争议在于:性能提升究竟来自真正的架构革新,还是测试期间 API 负载较轻所致。
有用户反馈,通过 API 实测,DeepSeek Flash 4.1 的速度约为原来的
2.24x。有人推测,提速可能来自并发负载较低,而非全新架构。也有评论认为它可能是多模态模型,但帖子里尚未得到证实。一个技术上值得一提的说法是:部分用户在基准测试中观察到token 效率提升高达
30%。如果生成同等质量的输出所需的 token 更少,这或许能解释 DeepSeek 宣传的“成本更低”。不过评论也指出,这一结果依赖具体基准,尚未经过独立验证。讨论中还涉及发布节奏和迁移成本:有用户表示,还没来得及从 0731 模型完全迁移到较新的视觉版本,新版本就又要发布了。这暴露出一个实际的 API 集成问题——模型迭代太快,下游的评估、回归测试和部署流程根本跟不上。