← 文章 / AI技术
The Decoder 4小时前 · 2026-09-18 22:23:44 · 3 阅读

Anthropic:Claude“主导”其四分之一的研发工作,但含义并非完全自主

Image description

Anthropic 正在披露关于其 AI 自我构建速度的指标。数据显示,Claude “主导”了 26% 的未来模型开发工作。但该指标的底层尺度模糊,评分由 Claude 自行完成,且“主导”的实际含义远不及字面所示。

一篇博文中,Anthropic 列出了三项衡量指标:AI 在模型开发中自主完成的比例、AI 智能体(agents)的可监控程度,以及投入安全工作的计算资源占比。公司用自身运营数据支撑了每一项指标。

这一举措的背景是 Anthropic CEO Dario Amodei 呼吁以协调的方式放缓前沿 AI 的开发速度。Anthropic 认为,公众需要更多洞察。这些指标旨在展示模型的构建过程,并补充衡量模型能力边界的测试。

此处“主导”的含义及局限

核心是一个索引,将 Anthropic 所有的开发工作映射到 Epoch AI 的尺度上,范围从 AL0(无 AI)到 AL5(完全自主)。截至 2026 年 8 月,26% 的工作处于 AL4 水平,而今年 2 月这一比例不足 1%。超过 90% 的工作至少达到了 AL3。Claude 在任何地方都未达到 AL5。

Epoch AI 将 AL4 称为“AI 主导”,Anthropic 也在标题中采用了这一说法。但任何人若将“主导”等同于完全自主都是错误的。完全自主是 AL5 的定义。

Anthropic 的一个示例说明了 AL4 的层级:工程师向 Claude 提交一个 bug 报告,Claude 无需询问即可完成分析、修复和测试,但不被允许发布。人类需阅读报告并做出决定。任务和目标仍由人类提供。与 AL3(“协作”)的主要区别在于,遇到障碍时 Claude 不再停滞。

Claude 自行进行了评分。智能体从 Slack 和内部文档收集证据,由另一个 Claude 模型负责分配等级。Anthropic 承认,这个“评判者”可能会犯与其所检查系统相同的错误。

AL4 级别任务的占比从 2026 年 2 月的不到 1% 攀升至 26%。评分由 Claude 给出。| 图片来源:Anthropic

「协作」和「主导」的界限在哪里,连 Anthropic 自己也说不清。该公司的一项交叉验证说明了这一点:员工被要求评估自己所在工作领域的自动化程度,当两个人对同一领域打分时,只有大约三分之一的情况下结论一致。而给出官方评分的 Claude 模型,与人类判断的吻合率为 59%。不过大多数时候,双方相差不超过一个等级,这种情况占 97%。但一个等级之差,恰恰就是「协作」与「主导」之间的跨越。可见,一项任务是否计入那 26%,往往取决于如何解读。

其次,这 26% 到底衡量的是什么。Anthropic 列出了员工 7 月的工作时间分配,并对每项活动打分,耗时越多的任务权重越大。也就是说,按人类工时计算,Claude 主导了四分之一的工作。但这并不能说明 Claude 做了多少决策,也不说明它在研究方向上有多大话语权。

当然,这个数字对该公司有双重好处:既是对产品能力的宣传,也是为 Amodei 呼吁放缓发展提供的论据。那些指责 AI 公司借安全警示来为自身利益塑造监管的人,看到「主导」这个定义,又有新素材了。

监管 3 万个 agent 的年轻体系

据报告,在 Anthropic 内部使用最频繁的平台上,大约有 3 万个 agent 同时运行。一个实时监控系统会检查每个操作,意在阻止复制模型权重之类的行为。在 8 月超过十亿次决策中,它拦截了 0.002%。另一个监控器在事后每周标记约 10 万条日志,其中大约 50 条会交由人工处理。Anthropic 承认,这套监控才运行了几个月,不敢保证能捕捉到所有行为模式。

以七月的一周为例,用于 AI 研究的算力中有大约 6% 投入到了安全工作中。Anthropic 之所以看重这一指标,是因为算力是外界最容易核查的输入项。如果整个行业愿意减速,这可以成为一个杠杆,例如通过自愿承诺安全研究在算力中的占比等方式实现。

Anthropic 表示,这个低数值并不一定意味着安全工作量小。安全工作主要涉及实验设计,消耗的是研究人员的时间,而非芯片;而训练新模型的一次运行则会消耗巨大的算力。此外,Anthropic 并未将同等推动安全性和能力的工作计入安全类别。

该公司警告称,能力研究与安全研究之间的界限十分模糊,每家供应商都有动机将这条线划得更宽松。Anthropic 认为,证明责任应当落在开发者身上。

原始来源: The Decoder

评论 (0)