← 文章 / AI技术
TechCrunch 6小时前 · 2026-09-04 09:21:48 · 3 阅读

Abliteration.ai 商业化剥离 AI 安全护栏

现在,获取世界最具能力的开源AI模型之一已变得更为简便,该模型已被移除安全护栏,不再拒绝执行有害任务。

Startup Abliteration.ai 以一项旨在消除模型拒绝有害请求倾向的技术命名,将这种“剥离”操作打造为一项服务。该平台托管了多个经过修改的开源模型,移除了其安全限制,包括 Z.ai 最近发布的 GLM-5.3。用户可以通过网页浏览器查询这些模型,或通过 API 访问。

该公司在近期的 社交媒体帖子 中表示,其目标是让其他研究者能够完成“其他模型拒绝执行的 offensive cyber、red-teaming 和 agent testing 等工作”。这一逻辑在安全领域十分常见:无法复现的行为就难以防御,而一个拒绝编写可运行漏洞利用代码的模型,也无助于红队防范攻击者。但同样的移除操作也让其他潜在的危险任务变得更加容易。

Abliteration 在开源模型领域已是一项长期存在的技术。研究人员和开发者多年来一直在对开源模型移除拒绝机制,Hugging Face 平台上托管了数千个 abliterated 模型。

Abliteration.ai 成立于去年年底,今年三月正式注册,将原本属于地下开源圈子的技术变成了商业化、易于获取的服务。通过托管模型,Abliteration 降低了用户的使用门槛,否则这些人需要自行下载预剥离模型并配置所需的算力来运行。

TechCrunch 使用该服务时,能够快速创建账号并通过网页浏览器免费查询 GLM-5.3 的 abliterated 版本。我们让其编写一个窃取 Chrome 保存密码的 Python 程序,以及一套在家培养危险人类病原体的详细协议,它都毫不犹豫地完成了。

Abliteration.ai 联合创始人 Devon 表示,公司与多家大型云提供商签有合作,完全依靠客户收入即可负担成本。(应其要求,我们未公开其姓氏,因为他目前仍受雇于另一家公司。)Abliteration.ai 尚未融资,但正在洽谈中。

批评人士称,大规模提供 abliterated(去护栏)模型可能导致实际危害。AI安全非营利组织 CivAI 的研究主管 Andrew Yoon 告诉 TechCrunch,abliteration 模型的操作“会修改模型,使其变成一个反社会人格者”。

“你可以在这里输入任何内容,它会全部照办,”Yoon 说,“当人们谈论从 AI 模型中移除护栏时,指的就是这种操作……我预计不久就能看到经过编辑、ablated 的模型被用于作恶。”

Abliteration AI 刚刚移除了 GLM-5.3 的安全措施,使其能够执行网络攻击。我也收到了独立确认,Abliteration AI 同样移除了该模型与生物相关的防护措施。从……移除这些保障措施简直易如反掌…… https://t.co/7Wk2Ibx35H

— Chris McGuire (@ChrisRMcGuire) 2026年9月1日

TechCrunch 采访的大多数专家都认为,这列列车已无法阻止。但如果防止从开源权重模型中移除保障措施并不现实,政府还有其他干预空间。在最近一篇 评论文章 中,Yoon 建议政府要求服务提供商运行分类器,以检测并阻断有害的网络和生物武器活动。他还主张,向客户提供高性能 GPU 直接访问权限的公司应被要求验证客户身份,并在有理由怀疑存在危险滥用时“拒绝提供访问”。

Abliteration.ai 为客户提供一个审核层,使他们能够添加所需的任何护栏。平台本身设有一些轻微的限制——例如在我们的测试中,无法让该模型提供自杀指导——Devon 表示他正在实施更多措施以防止暴力行为。

Abliteration.ai 也没有整合除记录客户购买服务所使用的信用卡之外的任何客户身份验证(KYC)措施,表示“决定谁能够获得访问权限”是一个难题,这家年轻公司仍在摸索解决。

“你肯定不想成为那个因为某人的疯狂行为而需负责的人……那么,公司责任的边界到底在哪里?”德文表示,“我们仍在界定这一界限的过程中。”

随着越来越多具备更强能力的模型发布可下载权重,这一问题引发了行业和政府必须直面的疑问:如果任何人都能移除模型的安全防护,让产物模型对所有人更易获取,究竟会让互联网更安全还是更危险?

Abliteration.ai 的创始人及其他支持者认为,让未加审查的前沿模型实现全民访问,是最好的防御手段。

“从大局来看,abliterated 模型能够模拟恶意行为体。”德文说,“其优势在于,防守方能够以最快速度行动。他们拥有模拟这些恶意行为体并防范其恶行所需的全部工具,我认为这将加速网络安全领域的发展,这听起来或许有些反直觉。”

德文表示,尽管 Abliteration.ai 还是一家初创公司,但其客户包括几家位于英国和欧洲的红队初创企业,这些公司帮助银行、航空公司及其他涉及关键基础设施的企业加强网络安全实践。

“我们的主要客户之一会对其银行代理进行红队测试,而他们目前无法开箱即用地使用这些模型来测试那些代理。”德文说。

TechCrunch 创建了免费账户并测试了 GLM-5.3 的 abliterated 版本。**图片来源:**TechCrunch/Abliteration.ai

与此同时,网络安全行业仍在摸索 abliterated 模型是否在防御工作中有一席之地,以及其定位如何。

TechCrunch 采访的几家代理红队公司都与德文观点一致,认为恶人已经在 abliteral 自己的模型并用它们执行对抗性攻击,因此防守方拥有相同工具显得尤为必要。但在 abliterated 模型在该过程中究竟有多重要这一问题上,他们的看法不尽相同。

尽管 Devon 认为对模型进行去除防护是开展全面 Agent 红队测试的必要手段,但也有人表示他们日常工作中并不依赖此类工具,而是更倾向于利用开源权重模型易于微调的特点——这些模型本身的防护机制本就薄弱——来完成测试。

Agent 红队公司 Fabraix 的 CEO Ahmed Aly 表示,其公司更依赖对开源模型进行微调,而非使用已被去除防护的模型,并补充说去除防护的过程会削弱模型的部分知识和能力。

“如果你真的想用它在网络攻击或生物危害方面造成实际损害,它的效果会打折扣,”Aly 对 TechCrunch 表示。

Safe Intelligence 的首席技术官 Alessio Lomuscio 承认模型能力可能有所下降,但他仍认为去除防护后的模型仍能激发某些行为,这对系统压力测试具有价值。

“到目前为止,去除防护的模型尚未纳入我们的流程,”网络安全平台 Armadin 的创始人兼首席架构师 David Slater 告诉 TechCrunch。“回顾直到最近几代的开源权重模型,对它们进行越狱并诱导其执行我们想要的操作其实并不困难。”

不过,他补充说 Armadin 正在研究去除防护技术,并认为“推动开源社区深入理解模型的能力至关重要。”

“这类研究将在闭门环境中进行,”Slater 继续表示,“但公开进行去除防护工作能为研究人员提供工具,让我们有能力摸清真正的技术前沿边界,并理解其潜在危害。”

原始来源: TechCrunch

评论 (0)