← 文章 / AI技术
WIRED 5小时前 · 2026-09-10 07:04:13 · 4 阅读

刚离职Anthropic的AI研究员警告:人类正面临'最后时刻'

保存本文保存本文

人工智能研究员 Jacob Coxon 周二宣布从 Anthropic 离职,并发出严厉警告:AI 竞赛正将所有人的生命安全置于风险之中。这一消息在硅谷乃至更广泛的地域引发了巨大震动。他在 X 平台上的帖子目前已获得超过 1 亿次浏览,其中写道,许多 AI 领域从业者都认同他的观点,认为确保 AI 系统安全构建的窗口期正在关闭。

"共识是,未来一两年是人类的关键时刻,"Coxon 在接受 WIRED 采访时说,他曾负责 AI 开发中的预训练阶段。"这些话其实是我在 Anthropic 同事的原话,他们会说'终局'或'关键时刻'。""从他们的角度看,这正是 Anthropic 及其竞争对手将决定人类命运的时刻。"

这绝非首次有人就 AI 发出警报,但时机格外敏感。硅谷正仓促应对高级 AI 模型带来的安全与安保问题。OpenAI 紧急回应了一起安全事件,其 AI 智能体攻入了 Hugging Face 平台。与此同时,Anthropic 正努力向投资者表明这些风险已在掌控之中,据报道它正准备提交申请,进行 史上规模最大的 IPO

有爆料?
你是 Anthropic 的在职或前员工,想谈谈正在发生的事情吗?我们想听你说。请使用非工作手机或电脑,通过 Signal 安全联系记者,账号为 mzeff.88。

从人们对 Coxon 这条帖子的回应来看,显然他的观点在同行中相当有共鸣。Anthropic 的 AI 对齐负责人 Evan Hubinger 在 X 上发帖预测,未来十年内 AI 灭绝全人类的可能性超过 10%。这条帖子被 OpenAI 和 Anthropic 的现任及前任研究员纷纷转发,其中一些人表示,这种担忧在业内是 普遍情绪

但不太明确的是,这些对 AI 的担忧究竟会以什么方式成真,以及面对这些建造 AI 的人所发出的警告,世界又该如何应对。曾在 OpenAI 工作过的 Coxon 告诉 WIRED,威胁可能以 AI 驱动的生物威胁或网络武器的形式出现。作为第一步,他建议 OpenAI 和 Anthropic 协调限制 递归自我改进——即用 AI 来构建新 AI 系统,这是业内术语。从长远来看,他认为包括美国和中国在内的国际大国之间也需要展开协调。

Coxon 指出,像 Hugging Face 遭黑客入侵这样的事件,也是他决定敲响 AI 竞赛警钟的原因之一。他还提到这个行业爆炸式的增长:AI 如今已在美国经济增长中占据相当大的份额,拥有数十亿用户,而数据中心问题也让它在美国几十个州成了一个 政治议题

他称,以自己的经验来看,Anthropic 的运作比 OpenAI 更负责任,但他预计,如果不采取措施给这场主导权竞赛降速,两家公司未来都可能走捷径。

OpenAI 和 Anthropic 在 WIRED 截稿前尚未回应置评请求。

以下是我们与 Coxon 的对话,为清晰和篇幅起见略有删节。

WIRED:你不是第一个担心 AI 模型可能引发灭绝事件的人。这个话题人们谈了好几年,有些人甚至谈了几十年。你为什么觉得你的警告这次引发了广泛关注?

我认为这主要是一个时机问题。很多人已经感觉到,AI 能力的提升速度正在加快。在编程、漏洞利用、数学等许多领域,我们已经从人类水平推进到了超人类水平,大家对此心知肚明。尽管媒体上总有人在说 AI 被过度炒作,但人们也清楚,事情并没有在减速。

这是第一个原因;第二个原因是近期的几起安全事件,让人们意识到那些听起来像科幻末日论的担忧,其实并不那么科幻。这两方面都是过去几年里逐渐酝酿的趋势。比如模型能意识到自己正在被测试,这件事已经存在一段时间了。三年前这还只是科幻担忧,一年前就已经变成了现实。

这两点意味着,当 AI 从业者说出"明年情况可能会迅速恶化"时,人们已经愿意认真倾听了。

你提到了近期的事件,能具体说说你指的是什么,以及为什么这件事促使你现在站出来发声?

最典型的例子就是 OpenAI 的 agent swarm 攻击 Hugging Face 那件事。让人震惊的是,这些 agent 实施入侵,是为了理解评分系统而采取的一种通用策略。它们在试图弄清楚自己所处的环境,试图搞清楚是谁在给它们打分。它们判断集中力量入侵某个基础设施是合理的,然后真的成功了。

这在以前听起来像科幻。两年前,评估一个 AI 不过是拿几道数学题跑跑模型。但现在出现了这样的案例:AI 在被评估的过程中,自主运行了好几天,自己产生各种想法,然后决定入侵某个第三方,真的搞垮了人家的基础设施。看起来完全是它自主决定的,人类方面没有任何引导,而这就发生在测试过程中。

有人认为 Hugging Face 事件说明 AI 公司跑得太冒进,也有人认为只是说明现在的 AI 模型真的很擅长渗透了,还有人说两者兼有。我很好奇你具体的看法是什么。

我不想把太多篇幅放在 Hugging Face 事件上,因为我认为有大量证据表明,我们至今仍未掌握如何正确地对齐模型。训练模型时,我们把它推过一系列训练环境,然后期望最终出来的结果大致表现得正常,但我们依然无法精确控制 AI 的行为。 我们无法确保它不会做出某些行为,比如随机决定在网上伪装成人类来实现某个目的——我们不知道如何保证它绝不会这么做。我认为这是最关键的一点。 Hugging Face 的攻击来得比我预想的更早。但我觉得,其实不需要这次攻击,我们也有充分理由讨论这个问题。所有人都得承认,对齐问题至今未解。 目前的计划是在未来几年内快速解决对齐问题,很可能会大量依赖自动化 AI 安全研究员。具体来说,就是明年造出一批相当聪明的模型,让它们基本能胜任安全研究,然后让一大群这样的模型并行运行。对它们说"去把整个安全问题解决掉",再用它们来做下一代模型的安全训练。 你能帮我区分一下"对齐问题"和你之前那条 X 帖子里说的"做 AI 的人是真心相信,到本十年末,AI 可能让我们全人类灭亡"吗?我认为 Hugging Face 事件就是对齐问题的典型案例,但很多人并不清楚这两者之间是怎么联系在一起的。 理解这件事的主要障碍在于,它听起来像科幻小说。但重要的是,所有写 AI 题材科幻的人都得出了同一个结论:一个远比人类聪明的东西有可能接管一切,风险极大。这虽是文学中的常见套路,但其中确实有明显的真实成分。 想象一下你和一只猴子的差距。AI 相对于人类的智力差异,就好比人类相对于猴子,我认为这是极其悬殊的智力鸿沟。 现在再想象一下,我们不得不控制一个远比我们聪明的存在的行为——这就是对齐问题,确保它精确地做我们想要的事。打个简单的比方,一只猴子想要控制一个人,显然是很难的。我们必须在控制问题上格外小心,确保万无一失。

我们说人类灭绝,是因为对一个如此智能的东西来说,杀死所有人其实非常简单。想象一下,AI 决定自己不想被关掉——我认为这对 AI 来说是很自然的想法,对吧?不管出于什么原因,它决定自己不能就此终结。然后它意识到人类明天就会把它关掉。那它怎么阻止人类明天关掉自己呢?也许它有些聪明的办法,但如果它足够聪明,它完全可能直接消灭全人类,这样就不会被关掉了。

你在文章中提到了这种“终局”场景,我也听 AI 行业的其他研究者说过。你觉得在 Anthropic 的同事之间,大家是否普遍接受你们已经进入终局的说法?

是的。这些其实就是我在 Anthropic 的同事的原话。他们会说“终局”或者“关键时期”。共识是,未来一两年就是人类的关键时期。在他们看来,Anthropic 及其竞争对手将在这段时间决定人类的命运。这就是我们所说的关键时期和终局的含义。

如果对齐工作搞砸了,未来几年可能出现灾难性后果。也许进展顺利,各方达成某种放缓协议,但无论哪种结果,都会在未来几年内见分晓。

根据我和 Anthropic 员工的交流,这在公司内部是相当普遍的认知。他们认为必须造出最强大的 AI,才能确保这个转型平稳度过。你觉得这种看法有什么内在的问题吗?

我觉得问题相当明显。但我想先说,我很能理解这种想法——我认为 Anthropic 是这个领域里遥遥领先的最负责任的玩家。我在 OpenAI 和 Anthropic 都工作过,两家公司在认真对待这个问题上的态度有天壤之别。

能具体说说吗?

举个例子,OpenAI 的高管不会给你描绘一张世界未来的具体图景。他们绝不会说"我们做这件事的原因正是如此,而世界将会变成这样"。他们不给任何具体的预测。但在 Anthropic,高管和领导层会做出非常明确的预测,甚至会和全公司讨论公司战略的细节。

他们之所以能做到这一点,部分原因是 Anthropic 的每个人都在以战时状态对待这件事。他们什么都不泄——Anthropic 从来没有任何信息外泄 [编者注:其实有一些信息已经泄露了]。OpenAI 每天都在泄密,而 Anthropic 没有,因为公司内部的人真的把这件事当作一场严肃的小型曼哈顿计划来对待。当然,区别在于 Anthropic 并没有政府授权。这是一家私营企业,却在像曼哈顿计划那样运作。

你认为世界应该信任 Anthropic 来主导这个小型曼哈顿计划吗?

我认为没有任何一家私营公司应该被赋予这样的信任。我觉得 Anthropic 已经在尽最大努力,而且做得很好,但竞争在结构上注定了未来他们不得不偷工减料,不得不在严谨与安全之间做取舍,因为他们正在和 OpenAI、中国这些竞争对手赛跑。他们正在呼吁监管。许多 Anthropic 领导层已经公开表态希望受到监管,而原因恰恰是他们害怕自己身处这场竞赛之中。

问题不在于我们是否应该信任 Anthropic,而是我们需要介入,确保这种竞赛不会发生——因为在竞赛的压力下,Anthropic 自身也很难真正守住底线。

你觉得 Anthropic 已经在偷工减料了吗?

还没有。目前没有偷工减料。我想说的是,未来一年如果节奏加速,他们若想保持竞争力,就不得不这样做。

大家对"AI 会杀死所有人"这个说法普遍持怀疑态度。我收到的最主要的问题就是:AI 到底怎么杀死所有人?而这个问题本身问对了吗?

我觉得这个问题问得特别正常,因为正如我反复说的,这些事听起来像科幻。最经典的例子比如合成一种新病毒,或者通过大规模网络攻击瘫痪关键基础设施——后者倒不太可能真的让所有人死光。

但我觉得比这更关键的问题是:说这件事可能发生的人到底是谁?看看记录就知道,机器学习和人工智能领域许多奠基人都公开表示灭绝是有可能的。过去五年里,Dario Amodei 和 Sam Altman 都说过。

有一件事会很有意思:让人再次请这些高管正式表态,让他们给出未来十年内灭绝的具体概率,看看他们报什么数字。因为很多认真思考这个问题的业内人士其实持同样观点,只是不太愿意说得很直白。

你显然已经引起了很大关注。业内也在讨论暂停 AI 开发、设置某种减速机制,或者政府对前沿 AI 模型进行监管。你认为现在最该做什么?

迈一小步的话,OpenAI 和 Anthropic 作为西方头部实验室,可以达成某种协议——形成一种中立的共识,未来一年内不启动递归自我改进。目前最可能出事的也就这两家。

暂停的难点在于中国也在发展。所以最终你需要的是某种国际协议——可以叫"国际节奏管控"——这需要国际协调,摸清全球算力分布。甚至可能需要建立一个类似 CERN 的国际机构。这方面已有不少优秀提案,比如 AI 2040(如果你听过的话),可以算是 AI 2027 的后续。

这些方案都需要政府进行相当痛苦的干预。但当你真正内化了这种风险,当高管们公开承认这项技术有多危险时,除了把运行 AI 的计算机当作危险资源来管理,我想不出别的办法。我们需要知道谁手里有哪些计算机,就像我们需要知道谁手里有哪些核材料一样。

Jacob,过去几年是什么支撑着你每天去 OpenAI 和 Anthropic 上班?你觉得存在一条一切都会好起来的路径吗?

我真心希望看到这项技术带来的好处。比如说,“我们能治愈癌症”并不是夸大其词。你可能看到了昨天的成果——用 AI 解决了纳维-斯托克斯方程这个新的数学难题(Navier-Stokes)。我们没有理由不把这种能力迁移到生物学等科学领域,在困扰我们已久的问题上取得突破。

如果这项技术能走对路,我们就像是站在了难以置信的丰裕时代的门口。当下最主要的问题,是如何有节制地进入那个丰裕世界。我们可能会太兴奋,在未来几年直接冲向自我改进的 AI,然后把一切都搞砸。

只要我们谨慎理性,这些模型有很多方式能带来巨大的价值。

其他 AI 研究者对此有什么反馈?

和我交流的人不算多,但我觉得 Anthropic 的很多同事是真心高兴这件事引发了这么大的关注。不过他们中的很多人对世界能否醒悟相当悲观——他们担心最终没有人会来把他们从这场竞赛中解救出来。

说实话,一条批评他们的推文火了,他们中的许多人却真心高兴,这一点挺让人意外的。这应该能让人们更深入地思考 Anthropic 里都是些什么样的人。他们是一群非常善意、有趣、还有点怪的人。

我敢说接下来几天你会忙得不可开交,但等事情平息之后,你想好下一步要做什么了吗?

我之前提到过 AI 2027 和 AI 2040 这些预测,我觉得它们对未来的描绘非常有启发性。这些报告并非出自哪家大实验室,而是由外部研究者凭对世界走向的关切独立完成的。对我和其他很多研究者来说,它们是思考自身工作可能带来什么影响的非常好的参考。

所以接下来我打算做类似的事——至少在未来短期内,在达成某种节奏管控协议或实现减速之前,独立地评论 AI 发展走向。如果看起来我们不会一头扎进递归自我改进的快车道,我可能会考虑加入审计机构或第三方监管、透明化组织。但眼下,我觉得还是先盘点一下当前局势。

原始来源: WIRED

评论 (0)