开源权重AI模型能力逼近前沿水平,但安全鸿沟仍在扩大
当政策制定者们还在争论该如何监管日益强大的人工智能系统——比如 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Mythos 时,一款来自中国的开源权重模型已经缩小了与行业领先者之间的差距。
据 AI 安全非营利组织 SaferAI 发布的新报告,来自中国 Z.ai 的开源权重模型 GLM-5.2 在网络和生物能力方面,仅落后于 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 几个月。但前沿能力与安全实践之间的鸿沟正在拉大。
根据 SaferAI 通过 Z.ai 公开 API 进行的评估,GLM-5.2 对所收到的所有攻击性网络任务或双重用途生物学任务一概拒绝率为零。相比之下,Claude Opus 4.7"拒绝得如此彻底,以至于 SaferAI 根本无法在其上完成 CyberGym 测试"。(CyberGym 是一项评估网络安全能力的基准测试,OpenAI 在上月Hugging Face 数据泄露事件之前的评估中曾使用过它。)
这再次尖锐地提醒人们一些批评者多年来一直警告的事情:开源权重 AI 模型可能让潜在攻击者获得能力极强的人工智能,而一旦下载了模型权重,就无法管控他们如何使用这项技术。随着开源权重模型迅速逼近全球领先 AI 系统的能力水平,争论的焦点已从它们能否与之竞争,转向社会该如何应对它们发布后的风险。
SaferAI 执行董事 Henry Papadatos 告诉 TechCrunch:"能力的边界并不等于风险的边界,因此我们必须同时考虑缓解措施的现状,才能正确评估风险。"
虽然 Z.ai 可以对其托管的 API 施加安全措施,但一旦有人在自己的硬件上运行模型权重,这些保护措施就变得无法强制执行——用户可以移除或修改任何安全防护,对模型进行微调,或更改系统提示词。
OpenAI 和 Anthropic 等前沿开发商通常依赖分类器、拒绝训练以及 API 层级的控制等安全机制,来限制危险的网络和生物领域的协助能力。
这些措施远非万无一失:越狱攻击经常能绕过已部署模型的防护。AI 安全非营利组织 Far.ai 发现,包括 xAI 的 Grok 4.5 和 Google DeepMind 的 Gemini 3.1 Pro 在内的前沿模型,存在数百种通用越狱方法——即可复用的"钥匙",能攻破大多数有害请求的防线。报告指出,攻击者会将角色扮演、身份冒充、伪造对话记录、追问提示等多种操纵手段组合起来,放大模型防御中的薄弱环节,从而实现越狱。
然而,闭源模型上有效的安全措施,在开源权重模型上完全不起作用——这类模型本就被设计成可在任意基础设施上运行,搭载任何安全防护,或者干脆不设防护。
Papadatos 表示:"目标显然应该是让好的能力——也就是安全的能力——对所有人开放,同时我们再以开源的方式尝试剔除有害能力。"
Papadatos 提到的一种可行技术叫做"预训练数据过滤",即 AI 公司从训练数据中移除具有攻击性的网络安全信息,再用清洗后的数据集训练模型。
一些研究表明,这种方法可以在不影响模型整体性能的前提下,减少危险生物知识的输出。但在网络安全领域,数据过滤的实用性要低得多。
要训练一个精通编程但又不会成为黑客的通用模型非常困难。编程能力如今是 AI 最大的收入来源,开发者在持续提升这一能力的同时,又不得不设法遏制其滥用,承受着双重压力。
正因如此,前沿模型的开发者越来越多地转向其他缓解手段。一种做法是选择性地限制模型所能提供的网络安全协助类型。以 Anthropic 的 Opus 5 为例,根据该模型的系统卡,它可以在未编译的源代码中搜索漏洞,但不能用于编译后的软件。理由是这能增加将 Opus 5 用于攻击目的的难度。
其他措施还包括发布前进行严格的安全评估、公开风险报告,以及在系统被认为过于危险时扣留模型权重。
以 GLM-5.2 为例,SaferAI 表示 Z.ai 没有发布该模型的安全框架、发布前测试承诺或风险评估报告。TechCrunch 已询问 Z.ai 在发布前是否进行了内部或第三方前沿安全评估,但未收到回复。
中国高层已越来越多地承认先进 AI 的风险。在上月的世界人工智能大会上,中国国家主席习近平强调了开源模型的重要性,同时着重指出必须确保 AI 始终处于人类的严格控制之下。
斯坦福网络政策研究中心研究中国 AI 政策的 Graham Webster 告诉 TechCrunch,中国已建立了完善的 AI 监管体系,但这些规则历来聚焦于政治敏感内容、虚假信息和社会稳定,而非攻击性网络能力和生物滥用等灾难性 AI 风险。
Webster 表示:"美国的 AI 思想界总体上比中国学界更关注这种存在性灾难风险",并补充说,许多中国政策研究人员认为,如果真的会出现全新的前沿风险,大概率会先由美国公司碰上。
Webster 继续说道:"中国体制有信心能管控这些技术在国内的使用。在中国上网必须实名认证,企业和用户都可以被追责。"
Webster 思考指出,模型供应商用来拒绝回答某些政治话题的机制,经过调整后或许也能用于确保模型拒绝完成攻击性网络攻击,或避免给出有害的生物工程方案。他还补充说,由于中国企业倾向于在幕后与监管机构协调,外界很难了解它们在发布前进行了哪些内部测试。
开源权重 AI 的支持者认为,发布权重对网络安全至关重要,因为企业可以借此防御攻击——Hugging Face 就利用 GLM-5.2 抵御了 OpenAI 遭受的入侵——同时也因为了解即将出现的威胁能让企业更好地为未来做好准备。
Hugging Face 首席执行官 Clem Delangue 本周在一条社交媒体动态中表示:"能够阻止 AI 驱动的网络攻击的同一套系统,如今每天可以抵御数百万次网络攻击,同时帮助我们在攻击者利用漏洞之前发现并修复它们。"
Papadatos 认为这种好处往往被夸大了,并不意味着"我们应该把危险的能力开源"。
他说:"在我看来,核心问题在于我们不应该默认危险的能力可以轻易地被任何人、在任何地方获取。"他强调,他相信行业应该努力做到只让"有益的能力"变得容易获取。"因为攻击者天生就比防御者更快地采纳新工具。例如,一个勒索软件团伙可以在一周内改变其攻击方式,而一家医院却做不到。"