将开放权重 AI 模型的安全护栏剥离,已成为一项即开即用的商业服务
要点
- 美国初创公司 Abliteration.ai 会移除 GLM-5.3 等开放权重模型中训练出的拒绝机制,并通过商业 API 出售修改后模型的访问权限。
- Abliteration 削弱了模型的大量拒绝行为,使其可用于网络安全测试、红队演练、恶意软件分析等工作。
- 客户无需在自己的 GPU 基础设施上运行模型,但这种便捷的获取方式也降低了滥用的门槛。
Abliteration.ai 从强大的开放权重模型中移除训练出的拒绝机制,并把修改后的版本作为服务出售。这确实有正当的市场需求,但同样的模式也带来了棘手的安全权衡。
只要能拿到开放权重模型的权重,任何人都可以修改其训练出的安全机制。美国初创公司 Abliteration.ai 正是把这一点做成了生意。8 月底,该公司发布了 "abliterated-model-large-v2",这是 Z.AI 的 GLM-5.3 的修改版本,被设计为大幅减少对敏感请求的拒绝。
这项技术被称为 abliteration。简单来说,就是先找出模型内部触发拒绝行为的激活模式,然后调整模型权重来抑制这些模式。这不是提示词层面的越狱,而是对模型本身的改动。Abliteration.ai 声称,模型的编码、网络安全和 agent 能力基本不受影响。

该公司的内部评估旨在佐证上述说法。针对中 scal化的 GLM-5.3 版本,Abliteration.ai 报告其在 CyberGym 上得分 84.5%,在 Terminal-Bench 4.0 上得分 41.8%,并在两小时内解决了 105 个 ExploitGym 任务。不过该模型并非全面领先。在该公司自己的表格中,GPT-5.5 以 85.6% 的成绩位居 CyberGym 榜首,而 GPT-5.6 Sol 和 Fable 5 在 ExploitGym 上的表现也远超它。Abliteration.ai 还承认,这些对比分数来自不同的测试框架和算力预算,因此直接比较存在局限。
为何选择 GLM?
前身模型 "abliterated-model-large" 同样基于 GLM-5.2。据 Abliteration.ai 称,早期 GLM 版本在训练时被故意调整,使其更难以用于实际安全研究。Z.AI 曾指出,GLM-5.3 的网络能力在训练后阶段的增长速度超出了预期。
GLM 兼具强大的代码、智能体和网络安全能力,同时提供开放权重和可商用的 许可证。Qwen、DeepSeek 和 Mistral 等也有类似替代方案。Z.AI 允许修改、衍生创作以及商业化的 "模型即服务"(Model as a Service)应用。因此,其许可证使 Abliteration.ai 能够修改 GLM-5.3、托管衍生模型并销售访问权。
开放权重,专有服务
中 scal化本身并不新颖。多年来,开发者一直在 Hugging Face 上发布经过修改的模型。但 Abliteration.ai 并未公开提供其修改后的权重供下载,而是负责托管和运维工作。标准费率下,该中 scal化 GLM-5.3 模型的定价为每百万输入或输出 token 五美元。
该服务让客户无需自行下载模型或部署 GPU 基础设施即可直接使用模型。这种交钥匙方案也降低了恶意使用的门槛。
公司称需求已经存在
Abliteration.ai 将这款模型推广用于进攻性网络安全、AI 红队测试、Agent 测试以及信任与安全工作。具体包括复现已知漏洞、制作概念验证漏洞利用代码、恶意软件分析以及模拟网络钓鱼攻击。
该创业公司的匿名创始人在 ThursdAI 播客上表示,早期需求主要来自大型机构和银行,用于测试其部署的 AI Agent。这些系统需要检查是否存在攻击者利用越狱或提示注入触发未授权操作的风险。
此类工作究竟需要去除多少安全限制,仍是个开放性问题。根据 SaferAI 的数据,未修改的 GLM-5.2 在进攻性安全评估中拒绝了全部任务。一些从业者对此也持怀疑态度。几家红队服务商在接受 TechCrunch 采访时 表示,被去除安全限制的模型并未纳入他们的常规工作流程。例如,安全公司 Fabraix 就更依赖对开源模型进行微调。
"零留存"既是卖点也是风险
TechCrunch 报道,该模型在几乎没有遇到阻碍的情况下,就生成了提取 Chrome 已保存密码的代码,并提供了培养危险病原体的详细指南。不过,针对自我伤害的请求仍会触发安全机制。根据常见问题解答页面,Abliteration.ai 也会屏蔽涉及未成年人的色情内容,客户还可以选择添加更多规则。
据该服务商介绍,提示词和回复都不会被存储。只有 token 数量、时间戳、模型 ID、账单数据等运营元数据会被保留。对于正规安全团队来说,这意味着机密源代码或未公开的漏洞不会进入服务商的存储数据中。但问题在于,一旦服务被滥用,Abliteration.ai 表示事后没有任何提示词或回复日志可供调查。该公司也不要求常规的身份或证件验证,这会让 problematic 使用更难追查——尽管账户、支付和使用元数据仍然保留。 这家公司的匿名代表辩称,身份核验并不能可靠地区分正规用户和恶意用户。他还表示,更严格的访问控制会让小型安全公司相对于大型企业处于劣势。规则由客户自己定
企业客户可以通过一个可选的策略网关,自行定义哪些请求被允许、拦截、修改或记录。该公司还出售合成训练和评估数据。不过,标准的模型访问基本不受限制,额外的控制规则必须主动开启才能生效。 同样的理念也延伸到了政府客户。Abliteration.ai 称其已在 SAM.gov 上完成美国政府采购注册,并提供带版本管理的模型、审计日志和针对具体机构的规则,起步阶段是不涉及受控非密信息(CUI)的试点项目。 对 GLM-5.3 进行修改符合其许可证条款。但某个具体使用是否合法,取决于具体在做什么以及适用哪个司法辖区。对于安全测试,Abliteration.ai 明确要求对目标系统持有书面授权,并遵守适用法律。由此留下另一个问题:当服务商通过一个随手可得的服务提供强大的攻击能力时,它应当承担什么样的责任? Abliteration.ai 并非首家涉足此领域的服务商。Audn.AI(搭载 PenClaw)和 Silk Compute 等提供商同样提供经过脱敏或基本移除限制的模型,用于安全研究场景。Abliteration.ai 的特色方案则将 GLM-5.3 与简便的 API 访问相结合,并为企业客户提供可选的策略层。修改过程并非不影响模型的其余部分
初步研究表明,在某些模型中,拒绝回答的现象可以大幅减少,而代码生成性能并未出现相当程度的下降。然而 其他实验 发现,即便是在基座模型原本绝不会拒绝的任务上,行为也会发生变化。换言之,脱敏操作并非精准切除某一单一特质,而是深入影响了模型的行为模式。
Abliteration.ai 还将关于模型限制的大部分决策权从提供商转移给了客户,但这种安排是否能在不显著降低滥用风险的前提下支撑合法的安全研究,目前仍无定论。