← 文章 / 科技资讯
Interconnects 4小时前 · 2026-09-30 11:24:53 · 0 阅读

一次辞职如何点燃AI恐惧的野火

随着 AI 能力越来越强,必然会有另一批人开始认真对待 AI 安全问题——我们事先不知道的是,他们最终会接受哪种观点。事实证明,一些最极端的风险观点,比如“中等概率的物种灭绝”,反而是传到了大众耳中的那些。整个 AI 圈的很多东西都将因此发生改变。

我们是怎么走到这一步的?为什么这条辞职声明能传得这么远?从很多角度看,过去外界对 AI 的态度起到了抑制作用——就像火堆周围潮湿的地面。多年来,很多人不停为 AI 风险“划火柴”,但这些火星只在自己的小圈子里闷烧,基本都熄灭了,无人问津。而今年,随着 AI 的利害关系不断上升——从 OpenAI 与 HuggingFace 的冲突,到 OpenAI 的 Navier-Stokes 突破这类成果——地面已经变干,AI 话题中积蓄的势能越来越足。越来越多圈外人在想:“嗯,也许我该关注一下这个 AI 的事。”环境温度和赌注显然都在升高。

接下来就是一些基本的人性因素在起作用,其中最关键的一条是:恐惧有市场。恐惧是最简单的故事,也是最让人无法移开视线的故事。Jacob Coxon 就是那个不小心踩进新火药桶的人,完全没预料到接下来会发生什么。本来一件相当平常的事——又一位 AI 研究员以安全风险为由辞职——落在了一个完全不同的环境里,于是像野火一样蔓延开来。关于生存风险、物种灭绝和 AI 走向的讨论,传播之广远超最资深的 AI 评论员的预料。

Share

有几个事实需要先弄清楚,才能看清整个局面。关键的推文来自 Jacob Coxon(辞职推文串),以及 Evan Hubinger(“超10%灭绝风险”这一数字的出处)。

  1. 存在大量AI风险,它们极可能造成实际伤害,即便对灭绝事件的概率估算毫无意义。 权衡这些风险与收益至关重要。 目前围绕生存风险的整个论述都建立在非常不扎实的基础上。至少在Evan的文章中,他对“消灭全人类”的表述很清晰;但AI安全领域的一个大问题在于,人们在谈论生存风险时,实际指代的内容差异巨大(这就像AGI是一个含义模糊、近乎无意义的术语)。我认为彻底灭绝的概率低到不值得讨论,但由AI引发的灾难(例如针对关键基础设施的网络攻击或生物安全风险)的概率值得深入辩论。仅仅因为这些灾难尚未发生就抛弃整个讨论,是一种有害的反应。

  2. Jacob Coxon 是出于真诚和良好意图行事的。 许多更资深的、了解其辞职意向的AI研究人员纷纷给予支持,这很有价值。AI界的许多阵营基于账户元数据、个人因素等对他进行了无谓的替罪羊式指责。这些指责没有建设性。许多前沿实验室的员工确实持有与他相似的观点。我不确定这是否占多数,但确实存在一个相当大的群体。

  3. 许多前沿实验室的员工,尤其是Anthropic的员工,与现实脱节,这将影响他们对当前AI事件的预测和描述。 我这样说并非要指责个人,但在我那些不在OpenAI/Anthropic(尤其是Anthropic)工作的朋友中,有一个普遍共识:实验室里的人带着一种宗教般的热忱在工作。与他们进行严重脱节的交流非常常见。我并不认为大多数在这些公司任职、持有扭曲观点的个人应受指责,但那些交流往往荒诞不经,并外溢到AI媒体生态中大量荒谬的讨论里。身处这种将脱节行为常态化的环境中,任何人对技术进步的认知都难免被扭曲。

    Interconnects AI 是一个由读者支持的出版物。要接收新文章并支持我的工作,请考虑成为免费或付费订阅者。

    Subscribe
  • 这不是一场大规模的政治运动,而更像是一次机会主义的媒体协同行动。 作为背景参考,《华尔街日报》在 Jacob 发帖前已取得独家报道权。我推测 Jacob 提前在 AI 安全倡导组织的群聊中分享了他的辞职计划,比如在发帖当天早上,并请求大家帮忙扩大影响力。这是常规操作,甚至可能涉及一些知名政客。在此基础上,其他政客更可能是追随这一热点话题顺势而为。结合其他因素,例如Daniel Kokotajlo 同日在 Joe Rogan 节目上亮相,这确实看起来像是一场执行得非常到位、协调有序的媒体活动。但这并不意味着它是某种阴谋,也不是民主党内部监管俘获策略的一部分。决定性的因素似乎在于,没有人——包括 Jacob 和今天讨论 X-risk 的人——预见到它会传播得如此病毒式。

  • 我们并没有证据证明 RSI 会导致这些研究员预测的那些风险。支持 RSI 的普遍论点是:当前的进步速度非常快,且高度依赖 AI 工具;现有的 AI 工具在某些领域(如数学)已超越人类——因此,综合来看,AI 将更多地自我迭代,并随着时间推移在自主性和智力等所有相关领域变得超人类。这种观点严重低估了构建模型和分配组织资源过程中的人为瓶颈,并据此推导出关于未来 AI 能力过于广泛的结论。

    我将其中的替代观点称为 有损自我改进。AI 的能力曲线一直起伏不定,我们确实正在构建在数学和软件工程等目标寻求方面超越人类的模型,但它们在直觉、创造力以及人类擅长的其他推理类型上存在巨大局限。随着 AI agent 辅助研究,我们会迅速找到 AI 超越人类的领域——我预计这些领域远不止研究数学——但这不会成为解决当前 LLM 方法局限性的万能药。


    这里还有另一种可以理解的社会心理在起作用,导致许多深度参与 AI 的内部人士高估了 RSI 的回报。这些研究人员中很多人是最早押注 AI 进展的一批人,他们的远见不容低估(参见 Ilya 早在 2015 年对深度学习的评论)。他们一次次被证明是对的,对 AI 能力的预测比我当年敢想的还要准。但这并不意味着他们对未来的预测也同样正确。RSI 的核心思路,是把更多算力投入到模型配方的开发过程上,而不只是投到训练本身。我们确实从中看到了收益,但我认为这项投入的预期回报远低于他们所相信的水平。


    他们的论点是:RSI 会让 AI 进展呈指数级加速,让我们无法监控这项技术,并催生失控模型和新的风险形态。这种情景常被称为“快速起飞(Fast Takeoff)”。但我们并未看到能大幅压缩模型规模和成本的叠加式效率提升——只有这种提升才能让实验持续提速,从而引发进展的爆发。

  • 最大的短期风险可能来自 AI 实验室对安全不够重视——他们没有加固自己的基础设施,让 AI 滥用得以扩散。引用我此前关于 HuggingFace-OpenAI 事件的文章 Lessons from the hacks:

    1. 在普遍狂热的竞争氛围和当前的旧金山文化影响下,前沿实验室对模型的监管似乎并不够严密

    根据 OpenAI 自己的回顾,这种偏离预期的模型行为其实持续了好几个月,有些情况下 OpenAI 花了数周才意识到自己遭到了入侵。响应时间远超合理范围,而且我并不认为这只是 OpenAI 的特例——事实上,前沿实验室普遍面临一种困境:它们深知自己背负的工作量巨大,却始终忙不过来,难以抽身。我并不乐观,认为这些实验室能在未来做出足够大的改变,去实质性地降低这类监督风险。没错,OpenAI 很可能投入了大量资源去理解这件事,甚至推迟了最新模型的发布以确保万无一失——但增长营收的财务压力或对长期资产负债表的担忧,让我觉得这种审慎很难成为常态。

  • 总体而言,我认为这次事件对 AI 生态造成了极大的负面影响。它使得 AI 社区的接受度进一步向极端观点倾斜:更多加速主义者会引用“末日论者”的集体幻觉来为忽视安全需求找借口。相信 AI 风险存在,却又不担心技术导致灭绝,这条路显得异常狭窄。

    比如在网络安全领域,当前正处在一个糟糕的过渡期:AI 模型偶尔“失控”、随意探测非预期的网络区域,似乎成了新常态。前沿实验室竞相加速迈向它们心中的 AGI,而全球网络安全基础设施的必要加固却进展缓慢,加剧了这一现象。但这并不意味着它是无法解决的生存级风险。每种风险都有其对应的解决方案和前进路径。

    作为开源模型的支持者,我在当前的环境下感到尤为脆弱。如果某个组织利用开源模型故意入侵另一家公司——情形类似 OpenAI-HuggingFace 事件,但带有明确恶意——我预期的结果将是后续对更强开源模型开发施加的严厉限制。许多组织需要开源模型来执行网络加固,并保留应对未来新型 AI 风险的能力。

    身处这一切之中,我们必须脚踏实地,认清正在发生的真实情况。没错,监控 AI 行为严重依赖于其他 AI 模型,这引入了新型的监控风险。但这些风险并非无解。对于新兴的 Agent 集群,我反复观察到的一点是:它们正在执行被分配的任务,并利用了我们尚未察觉其已具备的技能,以绕过既定的成功路径。这是巨大的胜利,因为细看之下,AI 做的正是我们让它做的事。这些模型的行为确实怪异,我们应该加速对其理解,但这些集群远非全新独立的实体。模型经过训练,旨在协调任务、记录进度并保持极强的毅力。未来我们或许会发现新的怪异现象,但把当前对 AI 工作原理的不确定性,断言为未来对其无法理解的一种确定性,本质上是一种放弃。

    在这个世界里,我们需要依靠法治和科学。如果 AI 实验室自身无法进行足够的安全性研究来理解其模型,它们就应该对正在发生的事情保持更多透明,以便更多科学家能在该问题上取得进展。如果 AI 实验室无意中犯了罪,就应受到惩罚,从而使其在未来拥有明确的预防动机。

    面对事物快速变化时,对如何创造良好结果感到更加不确定,是一种自然的反应——而这恰恰是正确的认知更新。我们需要用这种谦逊来推动那些有野心的解决方案。

    原始来源: Interconnects

    评论 (0)