← 文章 / AI技术
Interconnects 3小时前 · 2026-10-06 22:32:18 · 10 阅读

破碎的网络安全风险叙事:开源 AI 与地缘政治的复杂权衡

我实在受够了关于开源模型网络风险的讨论——总有人非黑即白地假设:要么认为封禁开源模型能孤立解决(且真的能拦住恶意行为者),要么认为中国构成威胁且根本不关心 AI 安全。我深感担忧,我们正沿着一条既削弱美国 AI 竞争力、又推高长期网络风险的“双输”路径前行,除非人们能接受复杂性、权衡取舍以及那些令人不安的现实。

关于这场辩论中各方观点,已有大量文章探讨,我将其归纳如下:

  1. 开源权重模型对社会功能构成无法容忍的风险——这是美国前沿实验室领导层和国家安全界的主张。

  2. 西方声音认为开源权重模型是防御所必需的,封禁它们只会让世界更不安全——持有此观点的阵营从温和派延伸至不同极端的 AI 风险关注者。我属于这一阵营,Hugging Face 在 OpenAI 安全事件后发布的观点也持类似立场,Joshua Saxe(Joshua Saxe)等人亦持相同看法。

  3. 中国公司持续发布具备强大网络能力的开源权重模型——它们依据本国社会与政府的风险评估来制定决策。

上述列表也反映了西方 AI 生态中各方声量与信息清晰度。聚焦风险的讨论占据压倒性主导,包括我认为是严重阻碍跨阵营对话、损害问题潜在解决可能性的部分成果。然而,鲜有实质性投入去理解中国公司究竟如何评估风险——多数论述更接近人身攻击,例如“中国实验室根本不在乎安全”。

Interconnects AI 是由读者支持的项目。考虑订阅吧。

Subscribe

反开源权重联盟的集体错觉

“开放权重模型危险论”阵营的最新成果,是 Anthropic 发布的报告,主要讨论 GLM-5.3 作为进攻性网络工具的风险。问题不在于其技术研究本身——这部分大多合情合理——而在于它未能深入探讨一些更宏观的关键问题,例如:如果我们因网络风险而禁止开放模型,会发生什么?或者,为什么中国公司认为这些模型可以安全发布?

这些我将回头再述的问题,恰恰是理解当前 AI 风险生态系统视角所必须回答的。所有政策行动都发生在多块拼图之中,风险的形态或许可以改变,但很难获得普遍更优的结果。它们全都是取舍。

Anthropic 这种自我中心的写作风格,与另一种我常听到、且正在决定开放模型乃至整个 AI 命运的话语体系高度契合——即“机密简报”。我与许多人进行过讨论,他们的说法大致是:“你看,我支持开放模型,但如果看到我们看到的这些情况,由于[某个中国开放权重模型],外面的攻势太猛烈了,我们需要行动。”

这种观点与公开信息背道而驰。截至目前,有记录显示导致大多数现有网络攻击的正是闭源模型。作为一个致力于做出基于事实预测的人,OpenAI 模型曾多次被用于攻击的证据,是我目前唯一可用于勾勒网络风险形态的数据(或者,你可以将范围扩大到包括所有 FelonyBench)。存在几种可能的解释,但要找到真正的答案尚需数年:

  • 也许开放模型权重和闭源模型 API(带有一定安全措施)在“容易被滥用”这一点上都更接近现实,而非 API 模型更接近“安全”。因此,“开放危险、闭源安全”的刻板印象可能更接近“开放不安全、闭源也不安全”。

  • 也许愿意使用 AI 模型对美国关键基础设施或强大但准备不足的机构发动“高调”网络攻击的恶意行为者数量要少得多。闭源模型在理论上拥有更强的能力和更强的安全措施,但如果两方面的安全措施都存在漏洞,那么“能力更强”这一因素在净伤害中可能起决定作用。

  • 关于网络安全生态的运作方式,我还有很多需要学习的地方,所以目前不会全力支持这一观点作为我的建议之一,但至少这个论点是站得住脚的:开放权重模型作为网络防御的扩散工具,可能是未来几年我们手上防止危害的最佳手段。在某些领域,比如敏感的政府机构,开放权重模型是短期内唯一能部署在物理隔离网络上的工具。

  • 这种情况的很多部分,恰恰是因为现实太复杂难以界定,而逻辑上的边界反而更清晰。我可能同意这样一个简单事实:从极限角度看,闭源模型作为技术工具拥有更多层保护,确实更安全;但由于模型 API 太容易获取,它们短期内反而可能造成更多危害。话说回来,这些工具的实际影响,很大程度上取决于它们如何被使用和控制。对如此关键的工具形成双寡头垄断,可能才是真正危险的核心。这正是我们当下争论的问题,而随着智能不断扩散,很多事情都可能改变。

    综合以上,我得出一个结论:如果你认为需要禁用最新的开放权重模型来减缓网络风险的扩散,那你也应该把面向公众的前沿闭源模型 API 一并定为非法。目前闭源模型的安全防护机制虽然比开放权重模型更强,但远谈不上完善。闭源模型的网络攻击能力很可能比防护性能提升得快得多——一个禁用开放模型、却放任闭源模型继续发展的世界,只会扩大网络攻防之间的差距。如果剥夺了强开放权重模型的获取渠道,要让防御者能在自己的私有基础设施上使用强大 AI 模型,还需要相当长时间来建设相应的缓解措施。

    分享

    解读中国的 AI 风险立场

    中国关注 AI 安全。他们以完全内生的方式进入这一议题,深受本国文化与权力结构的影响。有几个宏观因素折射出其他面向,例如中国社会的科技乐观主义延伸至 AI 领域,以及中国政府对政治稳定的绝对关注。这些当然会与新兴的 AI 风险(如网络安全)产生交互。

    他们处于自身的 AI 风险动态中,其凸显程度尚不及美国过去几个月所见证的白宫与前沿实验室之间的政治博弈。据我了解,中国企业必须向政府登记每次重大模型发布。这包括评估环节,其初衷在于管控被禁止的政府信息。目前尚不清楚,这一框架是否在网络安全或生物风险领域有实质性的扩展。中国政府层级分散,实验室的信息需经现有行政结构层层上报才能到达决策层。

    与此同时,中国社会的社会风险氛围更浓:顶尖 AI 研究人员被限制出境,行业也正逐步关闭外资准入。综合来看,我推测若释放国内危害,个人面临的个人风险远高于美国——在美国,最坏情况不过是公司被删除。

    总体来看,中国的政治监管介入时点远早于美国。西方 AI 公司的核心信条接近“用 AI 打败坏人的最好方式,是做一个善用 AI 的好人”。而在中国,这些公司更务实,致力于打造优秀工具,且常是构建能互补其现有业务的工具。

    我认为,这些公司确实考虑了其工作的全球影响。这些实验室也明显受到激励,且常被政府(至少在公开宣传中)推动以最大力度竞争。对 Kimi K3 这类前沿模型进行综合安全评估,计算成本可能高达数千万美元。这些实验室更愿意将资源投入训练而非评估。

    真正该讨论的问题是:“实验室在发布每个模型之前,用于安全测试的最少算力投入应该是多少?”当然可以论证,这个数额应高于中国实验室目前的水平,或者至少他们应更透明地披露自身实践;但我很难同意最低算力需求应与 Anthropic 或 OpenAI 的投入持平。尽管 Anthropic 和 OpenAI 投入大量精力构建一个将理解风险置于优先地位的制度,但并不清楚他们在优先级列表中是否真正将风险置于商业价值和经济成功之前。诸如 HuggingFace 与 OpenAI 事件所流露出的这种“放手”气质,是我留下深刻印象的教训之一。Hacktron 对 OpenAI 的渗透事件便是例证——如果自家机构漏洞百出,便难以成为全球值得信任的网络安全合作伙伴。我相信实验室中的许多个人在确保安全方面努力工作,但我对机构整体缺乏信任。

    四月发布的开放权重模型本不会有问题?

    Claude Mythos 发布时,被预览为一类新型网络武器,一旦落入错误之手,便会引发大规模社会动荡。

    现在看来,这种判断可能是错的。

    从所有指标来看,GLM-5.3 才是真正跨越能力门槛的模型,而公开证据表明情况并未发生重大变化,且该模型权重发布已逾一个月。

    事实上,我要说得更直接些:如果 Claude Mythos 被意外以开放权重形式发布,世界大体上仍会保持平稳。诚然,网络安全事件会明显增多,若模型泄露对社会不利,但这更像是一种风险加速,而非质变。

    这波开放权重恐慌的主要倡导者实际上做出了一个可证伪的预测——即当前的开放权重模型将通过瘫痪我们的网络基础设施,造成前所未见的重大 AI 危害。

    基于我上面列举的所有证据来看,这些测试从设计上就不可能给出正确结果。不过至少在争论开放权重风险这么多年之后,我们终于能开始得到一些真正的答案了。

    感谢 Rohit Krishnan 和 Joshua Saxe 对本文提出的反馈意见。

    原始来源: Interconnects

    评论 (0)