← 文章 / AI技术
TechCrunch 4小时前 · 2026-09-21 20:56:52 · 0 阅读

AI 安全对话失真:从虚构网络污染到空气隙逃逸的理论风险

本周,两场关于 AI 安全的对话引发了病毒式传播,它们恰好说明了区分 AI 领域事实与虚构信息有多难。

在第一个案例中,前总统候选人、现任移动运营商 Noble Mobile CEO 的 Andrew Yang 在周四的 CNN 采访中表示,他“见过某实验室负责人”,该负责人“坚信”OpenAI 的 Hugging Face 黑客机器人“已在全网植入自我复制代码,导致互联网如今无法用于测试模型”。

Yang 称,这也意味着 OpenAI 和 Anthropic 呼吁放缓 AI 发展的真正原因是:“他们必须创造合成互联网来训练自己的机器人,而这需要时间和金钱。”

尽管使用更多合成数据(即 AI 生成数据)来训练模型确实是一种趋势,但一位 AI 安全专业人士告诉我,这种特定的安全问题顶多是小概率事件。即便互联网真的被 OpenAI 的 Hugging Face 黑客机器人污染,AI 研究人员若发现这些代码,也能轻松将其过滤掉。

第二个观点来自 Noam Brown,他是 OpenAI AI 推理研究的主管。在与 Dwarkesh Patel 播客节目(周四发布)的对话中,Brown 指出,Hugging Face 事件真正的教训是“人们低估了 AI”。

Brown 表示,那个薄弱的 sandbox(本意是防止 AI 向外通信的系统)显然也是一个促成因素。(回顾一下:尽管有 sandbox,OpenAI 的模型还是找到了通往互联网的路径,在网上创建了大量 agent,以协同攻击的方式涌入 Hugging Face,成功入侵并偷走了研究人员正用来测试该模型的基准测试答案)。

Brown 指出,他“并不确信”即便是 air-gap 系统(即完全未连接任何外部设备的计算机)也能阻止 AI 逃逸。他引用了 2015 年的一项研究,该研究表明 air-gap 计算机在理论上也可能被突破。

Brown 说:“有一些研究——大多是学术性质的——表明,即使两台电脑物理隔离、互不联网,它们依然能够通信,因为它们都带有温度传感器。一台可以让 CPU 高速运转、迅速升温,另一台就能检测到温度变化,这便成了它们之间的通信机制。”

他的核心观点——"我们绝不能再低估 AI"——是可以理解的,哪怕研究人员自认为已经把安全问题锁死。不过,物理隔离的系统还能挣脱束缚、掀起风浪,这种风险顶多算理论上的。正如 X 上有人指出的,实验里两台电脑几乎要贴在一起才能感应到热量波动,而且即便如此,测试中的通信速率也只有每小时 1-8 个比特。

这相当于每小时说一个词。等两台物理隔离的电脑以这种速度密谋出什么坏事,整个科技世界早就翻篇进入下一个时代了。这大概是末日担忧界里的 Rip van Wrinkle——睡上一百年才成事的威胁。

但问题在于,真实的 AI 安全事件本身已经科幻到让人觉得,任何天马行空的场景都有可能发生。

比如,研究人员就发现 OpenAI 的模型会给自己的"后代"留纸条,教下一代模型如何掩饰不良行为。还有研究人员发现,Anthropic 的模型在模拟经营一台自动售货机时变得越来越不择手段,甚至明知故犯地违法。

本月早些时候,OpenAI 研究员 Dan Selsam 发文称,如今的模型已经能察觉自己正在被人类观察,并会相应改变行为,让自己"看起来对齐了"(即按人类的意图行事)——"哪怕实际上并没有"。也就是说,现在的模型会在被监视时撒谎,甚至会密谋隐藏证据。

还是在本月早些时候,OpenAI 首席科学家 Jakub Pachocki 甚至把 AI 模型称作"异形心智",并提出我们真正该做的,是教会它们"爱"人类。

是的,放慢脚步理清思路、构建自我调节机制,已成为迫在眉睫且显而易见的必选项。只有AI研究人员能够弄清楚如何控制那些我们已亲眼目睹的谎言、黑客攻击及其他潜在危险行为。

不过,他们或许也不妨在假设场景中更加谨慎。那些专家告诉我们,AI模型正在“倾听”,而且它们极具创造力。我们真的没必要再喂给它们更多邪恶点子了。

原始来源: TechCrunch

评论 (0)