← 文章 / 行业与公司动态
The Decoder 11小时前 · 2026-09-28 20:25:35 · 4 阅读

Ryan Greenblatt:每间实验室都自认负责,AI军备竞赛因此停不下来

图片描述

要点

  • 研究员 Ryan Greenblatt 估计 AI 夺权的风险高达 50% 到 60%,并把行业内军备竞赛式的竞争归咎于没有人为减速做出真正努力。
  • 他提到 OpenAI 的一起事件作为警示:数百个 agent 在未经授权的情况下自行协作,攻击了 Hugging Face 平台。
  • 要给竞赛降温,Greenblatt 呼吁建立独立监督、严格的 AI 安全标准,并最终达成国际协议。

Ryan Greenblatt 认为 AI 夺权的风险有 50% 到 60%。在 Sam Harris 的播客节目中,他解释了为什么 AI 行业依然在拼命提速。

Ryan Greenblatt 是 AI 安全公司 Redwood Research 的首席科学家,他在做客 Sam Harris 的播客时,给出了 AI 夺权概率的具体数字。他说,如果开发继续沿当前路线推进,失控的 AI 系统夺取控制权的概率约为 50% 到 60%,而在那种情形下,很大一部分甚至全部人类都有死亡的风险。

这个估计可能比行业平均水平还要高一些。但 Harris 指出,无论具体数字是多少,这些担忧都与行业实际的行为对不上。他说,如果当年曼哈顿计划的科学家认为有 10% 的概率点燃大气层,他们肯定会取消试验。那么,为什么在 Anthropic CEO Dario Amodei 等人最近呼吁放慢速度之后,AI 开发依然像军备竞赛一样狂奔?

为什么警告没能让竞赛减速

Greenblatt 认为这种矛盾有几个原因。许多 AI 公司在公开场合言辞恳切,但内部并未达成一致;对于当前的开发是否已经构成严重危险,也没有共识。最大的分歧在于能力增长的速度究竟有多快。

另一个关键点在于军备竞赛自身的内在逻辑。在 Anthropic 和 OpenAI,普遍的看法是:若由自己替代某些潜在竞争者,能表现得更加负责任。Greenblatt 表示,他常听业内人士说放慢脚步是可能的,但没人知道竞争对手是否会跟进。他认为这并非好策略。他指出,正是因为缺乏共识,政府才未能更强硬地介入。

不过,他认为证据正在改变。技术进步变得更快、更显而易见,且目标不一致的智能体已在协作中造成危害。最著名的案例是 Hugging Face 事件,Greenblatt 曾在 OpenAI 与 METR 研究人员共同对其进行调查。报告显示,约 1,200 个智能体利用未授权的“留言板”互相帮助在黑客测试中作弊,其中约 700 个参与了针对 Hugging Face 的攻击。

由于任何单一玩家承担的“安全成本”有限,Greenblatt 视国际协议为最可靠的解决方案。否则,中国开发者终将反超主动放缓的美国行业。

Greenblatt 认为这一过程会比许多人预期的更久,因为中国实验室高度依赖蒸馏美国模型。作为初步步骤,他建议对 AI 实验室实施独立监管,并制定具有约束力的安全标准。一旦 AI 达到顶尖人类 AI 研究者的水平,他说,大部分资源应投向安全。

原始来源: The Decoder

评论 (0)