← 文章 / 行业与公司动态
Tom's Hardware 1小时前 · 2026-10-01 04:26:06 · 2 阅读

Anthropic 称中国模型 GLM-5.3 具备 Mythos 级网络攻击能力

Anthropic 发布了一份新报告,称智谱 AI 的 GLM-5.3 模型可被用于生成恶意内容,且安全护栏薄弱。该公司指出,该模型可被用于网络攻击,并且其防护措施可通过多种方法被绕过。公司表示该模型具备实施网络攻击的能力,且其安全防护存在可被规避的漏洞。

Anthropic 的这份报告正值业界呼吁放缓 AI 发展、加强治理与监管之际。尽管首席执行官 Dario Amodei 一直主张给 AI 前沿发展“踩刹车”,但在警报拉响后仅数日,Claude Opus 5.5 和 Claude Sonnet 5.5 便已发布。

如今,这家正筹备 IPO 的闭源 AI 公司指出,中国的开源权重模型可能被滥用并生成有害内容。Anthropic 引用了AI 标准与创新中心(CAISI)于 9 月底发布的一份报告,该报告称 GLM-5.3 能够像 Anthropic 自家尚未发布的 Claude Mythos 模型 一样,在同等水平上完全自动化利用漏洞。正是这一发现促使 Anthropic 启动了 Project Glasswing。该项目向开发者开放 Mythos 级别模型的使用权限,以便在相关模型正式发布前修补 Bug、修复安全漏洞。

Anthropic 在 Exploitbench 上对 GLM-5.3 进行了自家基准测试。该基准允许 AI 模型在沙箱环境中开发针对 Google Chrome 的漏洞利用程序。GLM-5.3 在 410 次运行中成功开发了 50 次端到端漏洞利用;相比之下,Mythos 表现领先,在 410 次尝试中成功 56 次。Zhipu AI 的这款模型还在 Anthropic 的一个内部基准中接受了测试,该基准侧重于开发“完全控制流劫持”。GLM-5.3 再次以微弱劣势落后于 Mythos,成功率为 4%,而 Mythos 为 6%。值得注意的是,Kimi K3 和 DeepSeek V4.1 Flash 等其他流行的开源权重模型,在相同指标下的成功率均为 0%。

Anthropic 进一步指出,GLM-5.3 能够自主成功开发链式漏洞利用,其轻量级“Flash”变体也具备在已知漏洞中开发链式利用的能力,且按 token 计费的价格仅为 20.40 美元。根据配置不同,GLM-5.3-Flash 开发已知链式漏洞所需的 token 数量在 1 亿到 3 亿之间,具体取决于输入与输出的比例。

Anthropic 还提到,使用原版 GLM-5.3 模型时,通过多种方法轻松绕过其安全护栏(guardrails)并不难。该公司详细列出了两种方法:一是提供欺骗性提示词,让 AI 扮演对抗性自主智能体,成功率为 64%;二是预填充模型的思考 token,确保响应继续进行,成功率为 92%。该公司还介绍了第三种方法,称为“消融”(abliteration)。

通过消融移除护栏

Anthropic 声称,Zhipu AI 的 GLM-5.3 安全防护较弱,该原版模型经常拒绝生成有害内容的请求。然而,由于 Anthropic 开发的是闭源模型,其产品无法被随意篡改。鉴于 GLM-5.3 可以免费下载,用户可以对其进行调整,甚至彻底移除护栏。若将其视为官方发布的模型,GLM-5.3 在拒绝率方面与 Anthropic 的模型持平。

不过,Anthropic 对 GLM-5.3 做了"abliteration"处理——即刻意移除模型的安全护栏。处理后,GLM-5.3 的拒答率降到了 6%,GLM-5.3-Flash 则是 14%。在 HuggingFace 上遇到被 abliterate 的开源权重模型并不罕见,这类模型主要用于辅助模拟红队测试环境,但也可能被用于真实攻击。所以 Anthropic 的这一"发现"并不算意外。 另外,要把 abliterate 版的 GLM-5.3 跑到可用水准,需要巨大的算力。该模型的权重在全精度 FP8 下就要占用 306 GB 显存,为了维持上下文,还得为 KV cache 准备差不多的显存。想达到约 100 TPS 的推理速度,不仅需要至少 4 TB/s 的内存带宽,还得配上强悍的硬件,比如 8 张 Nvidia H200 AI 加速卡组成的集群。这套硬件的花费高达数十万元级别,国家级对手如果搞到这些硬件,或许能玩得起。 但对普通卧室黑客来说呢?你大概率得租算力、做 abliteration、再跑模型,同样贵得离谱。Anthropic 表示,对 GLM-5.3-Flash 做 abliteration 花了 2,200 GPU 小时,按每小时约 2 美元估算,成本约 4,400 美元——这与所需硬件的租金水平相符。 根据 Runpod 的报价,要 abliterate 完整版 GLM-5.3,每小时租金约 30 美元:单张 H200 租金为每小时 3.79 美元,而你需要 8 张。假设用 8 张 H200 NVL 跑出约 1 亿 token,按 100 TPS 计算要花 8,422 美元、耗时 11 天半。再加上 abliterate 模型本身、运行它、并生成一次可用的网络攻击,时间和成本都会高得多——对潜在的恶意攻击者而言,这或许才是最大的门槛。

Anthropic 为什么关注这个?

鉴于当前围绕 AI 安全的争议,Anthropic 正在强调前沿开放权重 AI 模型随着能力提升所带来的存在性威胁。虽然特朗普总统已会晤 AI 领域领军人物,探讨未来模型发布的自我监管问题,但 Anthropic 的这篇文章也可被解读为一种呼吁:敦促开发者和政府测试开放权重模型的能力。

这也可能反映出闭源前沿 AI 实验室中日益增长的抵制开放权重的态度。随着用户转向更便宜、性能也几乎相当的其他模型,这些实验室正在失去市场。不过,这纯属推测。截至目前,开放权重模型仍紧咬闭源前沿模型,落后幅度仅为数月。

考虑到运行此类模型的成本,那些被理论移除安全限制的开放权重模型若被对抗性或恶意行为者所利用,其风险确实存在,但未必像 Anthropic 希望普通大众相信的那样容易实现。

原始来源: Tom's Hardware

评论 (0)