OpenAI 拦截窃取模型推理的蒸馏攻击,但该漏洞在 Azure 上仍可被利用
OpenAI 表示,已成功瓦解一场旨在窃取其 AI 模型内部推理过程的协调行动。研究人员发现,数月后这种手法在 Microsoft Azure 等云平台仍能生效。
在一篇博客中,OpenAI 披露它检测到并阻止了一起“对抗性蒸馏”攻击。攻击者瞄准的是模型受保护的推理部分,即 AI 在给出最终答案前进行内部处理的步骤。用户通常只能看到最终结果,而看不到这些中间过程。
蒸馏技术中,一个模型通过模仿另一个模型的完整输出进行训练,不仅学习最终答案,还学习更强大模型完整的思维链(Chain of Thought)。正是这些中间步骤让输出价值大增。OpenAI 指出,这些步骤可能包含被刻意排除在最终答案之外的信息,并可能被他人用来复现模型的能力。
据 OpenAI 称,相关活动于 7 月 1 日小量开始。到 7 月 24、25 日,请求量飙升至 16,000 次,来自 4,000 多个账户,均采用了典型的提取模式。进一步调查发现了一个由 15,000 多个关联账户组成的网络,OpenAI 称已在 7 月 28 日前将其全部封锁。文末脚注补充道,这些只是尝试提取的行为,不代表每次都能成功。
OpenAI 将幕后核心团伙与 Moonshot AI(Kimi 大语言模型的开发商)相关人士联系起来。该公司表示,目前无法确定观察到的所有行动者是否都源自同一背景。此前,Anthropic 也报告过中国 AI 公司类似的尝试。
廉价模型也能解锁昂贵模型隐藏的推理
据 OpenAI 描述,攻击者将某次会话中的加密推理内容复制出来,然后在另一个独立会话中让模型解密并完整写出。
研究者 Joachim Schaeffer 及其团队已在一篇论文中展示了这一机制。AI 服务商仅以加密数据包的形式向客户返回推理过程,客户需在后续请求中附带这些数据。研究者发现,由于这些数据包使用共享密钥加密,它们可以在不同会话、不同用户,甚至同一服务商的不同模型之间自由传递。这使得同一系列中较弱、更便宜的模型能够充当“解密预言机”,逐字输出更强模型隐藏的推理内容。
OpenAI 点名感谢了这些研究者。该公司表示,已确认研究人员报告的攻击路径属实,且他们的发现有助于公司更快地部署应对措施。
OpenAI 称,此后已封禁欺诈账户、收紧注册流程,并修复了允许用户复用和读取非己方加密推理数据的漏洞。现在,公司还会筛查流式输出,若发现可能泄露推理内容则予以拦截。OpenAI 表示,已通过前沿模型论坛和政府渠道分享相关经验,因为这一问题并非仅局限于其自家模型。
锁定 API 无用武之地,云端开放仍是隐患
故事并未就此结束。同一天,研究人员发布了研究更新。“我们再次窃取了推理内容,” Schaeffer 在 X 平台上写道。他认为,仅加固自家 API 无法保障整个生态系统安全,因为众多云服务提供商也在销售这些模型的访问权限。
9 月 13 日,团队再次测试发现,该攻击在 OpenAI 和 Anthropic 的自有 API 上已被拦截。但在 Microsoft Azure 上,该攻击对所有测试的 OpenAI 模型均有效(包括全新的 GPT-6 Astra),对 Anthropic 模型也有效直至 Sonnet 5 版本。只需一次尝试,即可逐字提取推理内容。“模型相同,但保护力度因服务平台而异,” Schaeffer 说道。
还有一种更简单的方法,开发者 Can Bölük 曾公开演示过:给模型一个虚拟记事本作为工具,让它把推理过程写在里面,用户就能直接读到它写下的内容。研究人员表示,这个方法对所有 OpenAI 模型以及 Opus 4.8 和 Sonnet 5 都有效,只有 Opus 5、Fable 5 和 Fable 5.1 没有暴露推理过程。输出结果与解密攻击得到的内容非常相似,研究人员认为它对蒸馏同样有用。
研究人员认为,目前的修复措施零散而表面,很多只是针对特定请求模式做脆弱的匹配,有些补丁过了好几天才落到云平台上。GPT-6 Astra 上线第三方平台时完全没有这些防护。根据研究人员的时间线,OpenAI 直到 9 月 27 日才给 Azure 端点加上防护,而针对 Anthropic 模型的提取方法,从 9 月 28 日起才无法在 Azure 上复现。
Schaeffer 认为,补丁必须覆盖所有攻击类型和所有托管模型的云平台,否则攻击者只需挑防御最薄弱的一条路即可。论文更进一步提出:不落实同等防护的云服务商根本不该提供推理模型的托管服务。研究人员写道,如果放任不管,这些敞开的后门实际上会让人绕过 API 层面的出口管制。OpenAI 承认合作伙伴托管的模型需要与其自有服务同等的保护,并表示这项工作尚未完成。
我们此前报道过该研究团队对这一漏洞的最初发现(链接)。我们最新的 AI Radar 中文语言模型专题通讯对蒸馏做了更深入的探讨。OpenAI 预计,随着领先模型不断进步、更多玩家寻找低成本复制其能力的方法,这类攻击会变得越来越复杂。