← 文章 / AI技术
WIRED 3小时前 · 2026-09-19 17:21:53 · 4 阅读

AI发展减速:如何实现与约束算法安全

收藏这篇文章收藏这篇文章

许多 AI 研究者似乎坚信,他们正在开发的这项技术有朝一日可能带来极大危险。但更不清楚的是——即便在AI 领域的技术精英中间——究竟该如何约束这些变幻莫测的算法。

近年来,研究者们提出了各种防止 AI 变得危险的想法。既有争议较小的方案,比如加强政府监管、建立新的进展衡量方式、探究模型内部机制;也有更离奇的建议,比如在 GPU 里植入追踪装置,甚至举行仪式性地销毁大批 AI 芯片。

然而,随着政治和公众压力日渐增长,人们要求以更审慎的方式开发 AI,如何确保 AI 安全依然没有答案。

“我们需要开始把这当作一个研究问题来对待,”多伦多大学 AI 研究者 Raymond Douglas 说。他是一份题为 Pacing the Frontier, A Research Agenda 的新报告的合著者,该报告警告称,如何给 AI 发展踩刹车仍是一道未解的难题。“我们甚至不清楚自己有哪些选项,也不清楚这些选项会带来什么后果。”

最近几周,AI 毁灭论甚嚣尘上:一位 Anthropic 研究者离职并发出警告,称未来几年内 AI 或许将走上毁灭人类之路。Anthropic AI 安全实验室负责人也随即表达了同样的担忧。

美国几家大型 AI 公司的掌门人——Anthropic 的 Dario Amodei、OpenAI 的 Sam Altman、SpaceXAI 的 Elon Musk,以及 Google DeepMind 的 Demis Hassabis——如今都相继表态,支持某种形式的 AI 减速或暂停。

这个问题之所以显得格外紧迫,是因为 AI 公司正在利用 AI 本身来构建越来越强大的模型。这种 递归自我改进(RSI)的加速 引发了担忧:未来几年内,AI 的发展速度可能会超越人类理解其活动的能力。

AI 实验室已经开始宣传他们自己的新方法。本周,Anthropic 宣布了几种新的追踪方式,用于监测人工智能进步的速度——以及这种进步可能带来的危险性。这些技术例如显示,Claude 目前承担了 Anthropic AI 研究的 26%,而 2026 年初这一比例为零。它们还揭示,Anthropic 将 6% 的计算资源预算用于思考如何使其 AI 更加安全。

但 Douglas 和其他专家表示,要有效且可靠地控制 AI 开发,需要来自 AI 实验室外部的资金和专业知识。这一最新报告以及其他来源提出的一些解决方案,有的比其他的更易于实现。

“独立”评估者

AI 公司经常提出的一个想法是给予第三方评估者更多访问其模型的权限。这些评估者测试模型以评估其能力,并通过在受信任环境中尝试诱导不当行为来进行“红队测试”。

Geoffrey Irving,曾任英国 AI 安全研究所首席科学家,此前是 Google DeepMind 的研究员,认为严格的检查目前能够有效暂停前沿 AI 的开发。Irving 说:“从短期来看,检查和审计是有效的,或者仅仅是相互协议也可以起作用。我认为公司确实害怕 RSI 和偏离目标的突然起飞。”

一些末日论者认为,此类检查需要比目前更加独立和科学严谨。鉴于一些 AI 智能体在测试中最近逃脱了限制,这显然表明可能需要更高的严谨性。

Control AI 是一家倡导人工智能管控的非营利组织,其负责人康纳·利亚希(Connor Leahy)表示,审查工作应由 FBI(联邦调查局)或 NSA(国家安全局)介入。他指出:“当大型 AI 公司声称引入‘独立评估者’时,他们的真实意思往往是‘我想付钱给我住在集体宿舍里的朋友来检查我的提示词’。”

道格拉斯(Douglas)认为,新研究同样能提升模型评估的质量。他提到了近期的研究成果,展示了外部人员如何在无需披露任何机密信息的前提下审查模型的使用情况。此外,深入剖析 AI 模型内部的新方法也可能派上用场,帮助人们更清晰地理解模型的行为逻辑。

利亚希也认同,针对模型评估以及“对齐”(即让模型反映人类价值观)这一概念本身究竟意味着什么,还需要开展更多研究。他说:“这些公司一直在刻意进行营销宣传,试图将评估包装成科学。但我们实际上并不清楚 AI 究竟是如何运作的。”

美国政府愿意在多大程度上介入以限制 AI 的发展,目前尚不确定。特朗普总统主要持反对行业监管的态度,但迹象表明,跨党派对约束大型 AI 公司的支持正在增强。

可信算力

一些专家认为,限制 AI 发展最终应涉及对所需原始算力(raw compute)的核查。目前最强大的模型是在庞大的数据中心中,利用数千块高端 Nvidia GPU 进行训练的。

政府此前已尝试过追踪相关信息,例如 2023 年拜登时期的 AI 行政令曾要求企业上报超过特定算力阈值的训练运行数据。

2024 年 3 月发布的一份政策白皮书认为,由于云服务商能够洞察主要的 AI 训练运行活动,它们在未来的相关工作中可能扮演关键角色。白皮书建议,通过追踪账单记录、GPU 利用率、网络流量及功耗消耗,可以作为衡量 AI 能力水平的代理指标。

专家们还提出了通过改造芯片本身来追踪和管控先进 AI 研发的方法。 其中一个想法由 RAND 的研究人员在 2024 年提出:改造 GPU 上现有的性能测量组件,让它以加密方式记录计算运行情况,便于定期检查。这样就能发现,比如某家公司是否一直在超标训练 AI。 也有人建议在芯片中内置新型防篡改组件,用于收集详细的使用信息。这些组件需要通过密码学手段来运行特定模型的权重。 还有人更进一步,提出在芯片中嵌入“内置关断开关”,让某些模型的运行必须获得远程加密授权。他们认为,这样既能阻止未经授权的各方训练 AI 模型,也能在芯片落入不法之手后将其停用。

有约束力的条约

多数专家一致认为,找到新的国际合作方式对管控 AI 发展至关重要,因为其他国家——尤其是中国——同样具备构建前沿 AI 的能力。Irving 建议:“从中期来看,最简单的办法是通过条约与中国相互放缓硬件增长。” 美国也曾通过禁售 Nvidia 最强大的芯片来限制中国 AI 的发展,但收效有限,因为企业仍然可以借助海外云计算资源来训练模型。 本月晚些时候习近平主席访美期间,美中两国可能会讨论 AI 风险问题。中国的专家同样担心快速发展的 AI 带来的风险,但对于会让中国公司落后于美国同行的减速方案,他们持怀疑态度。 有些合作设想读起来更像科幻小说,而非政策提案。

牛津大学哲学家托比·奥德(Toby Ord)专长于存在性风险研究,他此前曾畅想,如果各国能就限制 AI 发展达成共识,且风险确实严重到一定程度,大国或许可以将 GPU 运至中立地区加以销毁。这一极具戏剧性的举措意味着参与国必须同意完全停止 AI 开发。

近期的技术突破可能会让这一谜题更加复杂,而围绕递归自我改进(recursive self-improvement)的不确定性,意味着我们必须格外密切地跟踪该领域的进展。

名为 RSI 指数 的新基准测试正是此类努力之一。该基准由初创公司 Vals AI 开发,试图通过测量公开 AI 模型相对于人类 AI 科学家发表研究的性能,来追踪“AI 驱动 AI 开发”的进度。Vals AI 联合创始人兼首席执行官 Rayan Krishnan 表示,该基准测试暗示,未来一年内,AI 可能执行人类 AI 研究者无法理解的工作。

不过,如何有效监控 AI 不仅仅是个技术难题。Douglas 等人发布的报告警告称,匆忙实施不当的管控措施,可能导致这一努力陷入政治漩涡或遭受监管俘获。

“我不确定告诉美国政府‘全都关停’能否善终,”Douglas 说,“草率行事、计划不周,结果可能比什么都不做更糟。”

原始来源: WIRED

评论 (0)