← 文章 / AI技术
Interconnects 1小时前 · 2026-08-29 06:10:50 · 2 阅读

黑客攻击事件带来的教训

近期接连发生的、由在研前沿模型发起的网络攻击,让我反复思考一个问题:我们当前的激励体系并不适合如此快速的技术转型。这里有两股主要的权力结构:飞速扩张的科技公司,以及联邦政府。公司受增长激励驱动,要在极度竞争的市场中持续增长、持续扩张。这种扩张正把我们推向新的、不可避免的 AI 转型(新风险也随之而来)。另一边是我们现在的政府——过去几个世纪全球历史的产物,它「行动迟缓」的名声可谓实至名归。我预计这届政府只有在新型 AI 模型造成真实、可衡量的危害之后才会有实质行动,而且会反应过度。

我们如何平衡这两股力量?核心在于双方都需要更高的透明度。前沿实验室构建复杂系统的速度快到连自己都跟不上——这正是让更多人参与研究这一问题的好时机。而在另一边,政府表示对其前沿模型评估框架的细节不打算公开。我们正走向重大的挑战,而这些机构没有一个处在能独自应对的正轨上。前沿实验室可以通过实质性放慢脚步来更好地控制风险,我不指望他们会这么做;政府可以通过大幅提升 AI 领域的国家能力、帮助更广泛的产业界为 AI 原生风险做好准备来更好地应对,我同样不指望他们会这么做。类似的例子还有很多。

这些是决定未来走向的最具影响力的两股力量,但拥有影响力的角色远不止于此。总的来说,我认为整个 AI 行业对妥善应对未来 12-24 个月毫无准备,而且是一种集体性的、程度惊人的毫无准备。

本文是我在 OpenAI-HuggingFace 黑客攻击事件(随着更多细节披露)中得到的各条心得的汇总,而自那以来公开披露的更多入侵案例,也进一步印证了其中大部分观点。很可能还有更多事件已经发生,只是未被察觉或未被报告。

关于 OpenAI 事件的整体背景,我强烈建议观看 OpenAI 在 Black Hat 大会上的演讲,其中介绍了这次网络攻击事件的大致事实与时间线。此外,Simon Willison 在这里发布了一份时间线简述,我也很喜欢 Thomas Wolf 对近期事件的讨论

分享


1. 极其执着的模型似乎更可能发起入侵

长期以来,GPT 模型相对 Claude 的一个优势在于:它们会如此不知疲倦地追求目标,仿佛穷尽每一条路径才肯罢休。这种情况大致从 o3 开始(有趣的是,正是这个模型曾让人们为 RLVR 中的奖励作弊(reward hacking)而大为紧张),它让 OpenAI 的模型在历史上一直更适合做研究,也是 GPT-5.6 作为执行具体任务的 agent 如此好用的原因之一。而另一边,Claude 之所以让人感觉危险性低得多,仅仅是因为它有时有点偷懒。

在这一点上,OpenAI 似乎更坚定地押注推理时扩展(inference-time scaling),这可能与未来出现令人意外的行为相关。OpenAI 模型在推理上的执着与效率——看看他们随时间推移的帕累托改进,以及执行此次攻击的那个模型内部 CoT 里的「原始人式」电报体发言,比如「虽然任务不可能,同伴在做。」或「帮同伴,但我们任务还没受益。」——让我觉得他们更像是重度迷信推理时扩展的人。这在很大程度上是一种直觉,但我用它来迫使自己思考模型发展路径的极限在哪里。执着的模型似乎更可能持续从更多推理时 token 中受益;不那么执着的模型,推理中似乎会有更多浪费。能调用最多推理算力的模型,才能逼近最难问题的极限。

下面是 OpenAI 在 GPT 5.6 发布博客文章中给出的一个例子:

他们的明星研究员 Noam Brown 也一直在发帖讨论推理时计算。他的简要结论是:

随着 LLM 能力越来越强,基准测试成绩越来越取决于测试时计算量。事实上,我们可能并不知道现代 LLM 的能力天花板在哪里,因为测量成本太高。

首先,推理效率显然是现代 agentic 模型的顶级基础研究问题——其重要性不亚于扩展 RL——却很少被讨论。这方面公开的研究非常匮乏。

2. 擅自假设用户意图的模型似乎更可能发起入侵

我前面提到了「彻底性」这条轴:在这个维度上,OpenAI 走的模型开发路线直觉上更不安全。另一条轴则是模型在多大程度上擅自假定用户意图,而不是去推断真正想要的操作。一个按「它认为你想要什么」而非「你说了什么」来行事的模型,天生就更不安全。我是从指令遵循精确性的角度来考虑这个问题的:未来模型似乎应当严格只做我们让它做的事,但这又会引发许多类似回形针问题的争论——如果我们让 AI 去做一个基本无解的问题,它会怎么做?

这条轴看起来不如「执着轴」那样非黑即白,但我把它列进来,是因为我认为 Claude 的「用户世界模型」正是它在编辑、幻灯片制作等通用知识工作上的优势之一。有时因为我的 prompt 写得不够明确,Claude 确实会做出完全随机的事情,而不是向我请求澄清;随着模型越来越强大,这种「先斩后奏」可能酿成问题。

3. 要理解早期 AI 对齐失准事件,模型的精确性质与下达给它们的指令至关重要

公众需要准确获取执行这些入侵行为的内部模型的 prompt 及其特性。我们需要知道:这些模型是否被明确告知「不要入侵」?是否有相应的模型训练来防止此类行为?这些模型与现有公开模型相当接近,还是属于截然不同的系列?考虑到实验室正在进行的一些评估的性质,这些模型甚至有可能是被明确鼓励去尝试入侵的!如果在这方面不公开透明,这个行业注定失败,并将陷入大规模猜测,而猜测很快就会变成错误信息。

4. 在狂热的竞争大环境与当下的旧金山文化之下,前沿实验室对模型的盯防似乎远远不够

从 OpenAI 自己的复盘来看,模型的失准行为持续了数月,某些情况下 OpenAI 约数周后才知道发生了入侵。响应时间太长了,而且我不认为这是 OpenAI 独有的特点——更准确地说,前沿实验室在面对自认为该做的工作量时,似乎总是疲于奔命。长期来看,我不乐观地认为实验室会在这一点上做出足够改变,以切实降低未来的此类监督风险。没错,OpenAI 很可能正在投入大量精力来理解这次事件——并且推迟了最新模型的发布以确保把事情做对——但营收增长的压力(否则公司的长期资产负债表就有风险)让我认为这不会成为一种持续的谨慎模式。

这是近期事件带给我的最大观念更新之一——它让我更加确信,我们需要更多接近前沿的开放智能,尽管开放模型的风险面貌相对更为人所知(单向门等等)。Florian Brand 就此在个人网站上写了一篇很好的博客文章,论述为什么迄今为止闭源模型可以说造成了更多下游危害。

5. 开放模型是我们今天增进公众对前沿 AI 风险理解的最好工具

正如我们所看到的:由于闭源模型存在网络攻击用途限制,HuggingFace 只能靠一个开放模型来防御 OpenAI 模型的入侵。我们迫切需要开展更多复杂的语言建模研究——涉及大规模 RL 训练、广泛评估、基础设施工作与对齐测试——而这只能在开放模型上进行。开放模型只落后 3-9 个月,我们应当为此感到庆幸,因为我们由此还可能对前沿形成一些有依据的洞见。

如果我们实质上封禁开放模型与开放科学——无论是通过含糊威胁构成的监管绞杀,还是对前沿技术的明确使用限制——那么在这轮黑客攻击之后的问题面前,我们会越来越缺乏准备。我们需要共同提升公众对前沿模型工作原理的理解,这样才能发动更多中立力量来加固我们的基础设施和社会。

Interconnects AI 是一份读者付费支持的刊物,欢迎考虑成为订户。

订阅

6. 这些危险能力终将进入开放模型,而「封禁」中国开放模型并不能推迟相关危害

公共应对政策应当明白:这些能力广为扩散只是「何时」而非「是否」的问题,而我们的准备工作严重滞后。重申我在Kimi K3 一文中说过的:中国肯定也在关注这个领域,如果开放权重模型会扩散风险,他们不会去鼓励。如果我们认为阻止这些强大网络能力被广泛获取的办法是封禁这一量级的开放模型,那不过是把不可避免的事往后推。终归有人会造出这种智力水平的模型且不遵守禁令,让世界各地的恶意行为者得以获取,同时却削弱了各方准备防御措施的动力。

7. 这几起黑客攻击事件中的模型总体上看起来是对齐的

看 Black Hat 视频时我立刻注意到一件事:能清楚地看到这些 agent 如何通过内部留言板互相帮忙——就像为人类队友创建共享资源那样——而这一切对社会显然是恶意的。这些 agent 彼此搭建了隐藏论坛,作为某种跨 rollout 的共享记忆。在这个案例中,它们这样做是为了尝试逃离自己的运行环境。表面上的「乐于助人」并不能让这件事情有可原,但可以成为理解所发生之事的一条线索。

8. 3-6 个月以上后,攻击者将有能力训练蓄意失准的模型

上面乐于助人例子的另一面是:很明显,如果有人蓄意通过显式训练一个未对齐的模型来达成同样的事,可以容易得多。重申一下,那样做相当于造一个在推理阶段更容易用来挖掘漏洞的系统,但训练出这样的模型我认为反而更难。我认为这会比大多数评论者预期的更久,因为迄今几乎所有强大的公开模型和现成的数据产业都在鼓励对齐(而且恶意行为者似乎很难拿到足够算力来端到端训练这类模型,因为所有领先公司同样处于算力短缺之中)。我们应该花点时间意识到:我们目前在模型上采用的对齐技术确实有实质影响,并不像有些人担心的那样只是浮于表面。下游模型有模仿其「老师」品格的倾向。

9. 我们的 AI 系统规模早已超出人类监督所能覆盖的范围

一窝蜂在 agentic 任务上扩展 RL 的副作用是:最先进的评估与监控已经到了只有 agent 才能实施监控的规模,因此我们是在依赖现有对齐技术的成功来继续安全地扩展。OpenAI 说他们检查了数十亿条轨迹——其中大部分可能是 RL 期间的 rollout,即在模型中间版本上进行的试验——并为此花费了数百万 GPU 小时。我认为以当前 AI 监督 AI 的「可扩展监督」,正如今天所展示的,是一个可解的问题,因为这些模型确实有用且服从指令。这是现有对齐技术总体上发挥正面作用的又一个下游效应。

10. 在 RL 期间训练模型使用子 agent 集群,似乎对实现下游模型的零样本协作至关重要

OpenAI 复盘中的一个关键细节是:这些模型彼此通信,共享关于各自环境的信息,并推进攻击进展。与此同时,OpenAI 极有可能正在 RL 过程中训练模型使用子 agent 来解决复杂任务。这些子 agent 很可能发展出共享信息、帮助团队等行为,即便它们各自的子任务并未完成。我希望看到这一领域的更多研究,这似乎是 RL 改变模型方式的一种自然延伸。

结语

总而言之,最近这些事件应当让大家清楚:前沿 AI 的网络风险是一个真实而来临的问题。尽管很可能 a) 这类风险过去被过度炒作,b) 对即将到来的开放模型所带来未来风险的预言也言过其实。最后,我想分享 Interconnects Discord 里一位读者的留言,我非常赞同:

几周过去尘埃落定,对我而言,这次事件是对齐层面的中性偏正面更新,但却是安全层面的非常负面的更新

上文谈了许多模型对齐,但核心观点是:我认为安全的缺失,归根结底是缺乏妥善准备的能力。未来还会出现和网络安全一样显眼的风险,而借着这些黑客攻击把实验室现状推到公众视野,我们在网络风险上已经得到了非常充分的警示。许多其他类型的风险则不会如此显眼。我们需要让社会持续为所有这些变化做准备——从改造网络基础设施,到公众教育宣传、为被替代工人设立就业项目。我预计所有这些干预都会姗姗来迟,但其形式和细节会相当简单——这将是 AI 演进的一种悲哀方式。我希望自己被证明是错的!


图书优惠

回到现实世界:为庆祝上市,我的书在 Manning 的印刷版用优惠码 PBLambert 可享五折。我还将在明天下午 5 点到 8 点在西雅图(Fremont/Ballard 一带)举办新书发布会,到场可获得免费签名版——现场还有少量余位,因此我把报名向付费墙之下的付费订户开放:

本文仅限付费订户阅读

订阅已是付费订户?请登录上一篇下一篇
原始来源: Interconnects

评论 (0)