← 文章 / AI技术
Hacker News 4小时前 · 2026-09-16 09:04:52 · 2 阅读

为什么看完 Navier-Stokes 求解后我依然看空 LLM

[感谢 claude fable 5.1, holden saberhagen, gabriel kammer, andres erbsen, alice mckean, 和 tristan wylde-larue 对本文的评论]

首先,我提出几个观点供读者细品:

  1. 前沿实验室的估值基于一种叙事:它们已经或即将在极短时间内推出能完全替代大多数知识工作者的自动化程序。但现实是,当前的前沿模型即使处理最简单的任务,也需要人工费力监督并设置护栏。那些被头条式的炫技(如 Navier-Stokes 方程、FreeBSD 远程代码执行漏洞、HuggingFace 事件)和前沿实验室的言论误导,认为模型已实现有意义自主性的人,不妨看看那些仍在雇佣和下层级招聘软件工程师的软件公司。这些工程师在当下流行的基准测试中得分远低于他们所监督的模型。
  2. 模型仅在与其训练任务非常相近的小邻域内表现良好,且即便在此范围内也存在严重局限。前沿实验室已摸索出一套通用配方,能教模型完成几乎任何特定的、具有明确性能评估标准的任务。虽然许多任务已被训练数据覆盖,但对覆盖范围内任务的微小扰动,往往导致模型彻底失败或出现奖励黑客(reward hacking)行为。
  3. 当前的奖励黑客问题只能由领域专家通过严谨的规范定义来解决。领域专家的时间非常昂贵。严谨的规范制定本身是一项技能,需要超出特定问题领域之外的专业知识。即使许多技术娴熟的软件工程师也擅长此道。对于绝大多数领域而言,同时具备领域专家和规范制定专家这两类能力的人,交集小得令人难以置信。
  • 严谨规格说明的劳动成本可能远超直接实现非正式说明的成本。硬件工程领域就是最好的案例:据传闻,一个典型的 CPU 项目中,规格与验证工程师的数量大约是设计工程师的三倍,5:1 的比例也并非没有先例。更糟的是,很多任务并不存在"写好规格就撒手不管"的便利模式——也就是一次性写好规格说明,然后照着持续实现:严谨的形式化规格往往要在实现过程中不断迭代演化,因为按照非正式规格去实现时产生的洞见会反过来推动规格本身的更新。对于少数能享受高水平"一次成型"规格的任务(比如为一系列 CPU 架构编写可执行的 ISA 规格说明),以现有技术针对这种高规格做验证的成本根本无法承受,只能退而使用更低层的规格——而低层规格构建成本更高,且在设计变更面前脆弱得多。
  • Navier-Stokes 这类纯数学命题,是对抗性智能体工作面对严谨规格的绝对最佳场景。定理陈述本身就已经是一份严谨的规格,经过数学界数十年的审查检验;它在 Lean 中的形式化只是一次直白的翻译,全部基于 mathlib 中久经考验的数学对象。验证器 Lean 定理证明器经过大量审计,并在设计上刻意规避了那些可能被 reward hack 利用的不可靠性。不过即便是 Lean 和同类定理证明器也并非无懈可击:可靠性漏洞曾让 LLM 把伪造的证明洗白通过证明内核,类似的漏洞很可能还存在。这已经是最理想的情形了;人类绝大多数知识工作都不是这个样子。下面我会谈谈少数在这一点上与纯数学相似的知识工作领域。
  • 严格规范的最佳替代方案是人工审核。但人工审核无法适配语言模型产生的海量输出。更糟糕的是,即便是专家级的人工审核,也极易受到“奖励作弊”(reward hacking)的影响:回想 xz 后门事件,以及那些混入 Linux 核心的臭名昭著的明尼苏达大学(UMN)伪善代码提交。只要人工审核仍是智能体生产循环中的关键环节,生产速度就必然受限于人类时间和注意力的极限。对于那些数据中心前沿实验室的 CEO 们——他们总喜欢哄骗你相信那里满是天才,且前沿突破永远只在未来几个月内——人工审核这种“天才满屋”的设定,从根上就不可行。
  • 综合来看,在大多数领域,LLM 看起来就像一个能力有缺陷的实习生:在成年人手中既快速又有效,但不被允许独当一面。大多数公司无法采用全自主 AI,原因并非“技能问题”或技术扩散滞后,而是源于当前架构特有的结构性弊端。据我统计,能够接受使用全自主 LLM 的公司类别很少,仅有三种:

    1. 那些能廉价承受失败的主体:比如原本会雇佣实习生的公司,或从事快速原型开发的企业等。
    2. 那些需要在现有明确护栏下完成少量、定义狭窄任务的主体:如在受控环境中进行重复性体力劳动、呼叫中心及客户服务聊天等。
    3. 那些因行业性质能够接受或本就承担严格规范与验证成本的主体:如芯片设计、药物发现,以及其他部署失败即意味着生存危机的领域。

    前两类公司对价格敏感,可以说它们并不需要从廉价模型跨到前沿模型时所带来的推理质量提升。这类公司中最多数家,使用运行在廉价硬件上的开源模型效果最佳,甚至可能在本地部署。对于第一类和第三类公司而言,那种在数学和安全研究领域取得突破性成果、看似模糊的组合式搜索,似乎更依赖于代理集群的宽度而非推理能力——参见小型开源模型复现了引发 2026 年春天炒作潮的 Mythos CVE。如果情况确实如此,使用廉价的开源模型以在更宽的集群中运行相同工作负载的理由就更强了。

    第三类公司可能仍会使用前沿模型,但也不完全清楚其工作是否无法用 DeepSeek V4.1 Flash 等廉价模型完成,而且我上述假设的集群宽度优势让他们更有动力去推动更便宜的模型。这类公司另一个有趣的特点是,他们通常对其知识产权非常保密,可能并不高兴将数据发给 Anthropic 和 OpenAI,即便双方有所谓的协议,承诺不会将用户数据用于训练

    现在,你可能会提出:即便前沿实验室已陷入困境,“装满笨蛋的数据中心”场景所带来的 AI 算力需求,也与“人工超级智能”场景相当。区别在于,装满了天才的数据中心是自驱的,仅受其可消耗算力量的限制;而笨蛋集群则会受到人类协调员的严重瓶颈限制。我的个人押注是,其影响范围将远远超出前沿实验室。

    原始来源: Hacker News

    评论 (0)