OpenAI 称与中国 Moonshot AI 相关人员主导行动,试图提取其模型隐藏推理
OpenAI 在其官方博客中指出,与中国 Moonshot AI 相关的人员主导了一场旨在从其模型中提取隐藏推理能力的行动。文章称,7 月份发生了一场上“协同行动”,试图提取模型中受保护的推理内容,该行为“符合对抗性蒸馏”的特征。OpenAI 尚不确定观察到的所有操作者是否属于同一主体。
该活动始于 7 月 1 日,初期“流量较低”。随后在 7 月 24 日和 25 日出现“高流量峰值”,共计 16,000 次请求使用了提取模式。这些请求来自 4,000 多个用户。虽然活动试图提取推理数据,但“未必成功”,且该行动“在 7 月 28 日已被彻底阻断”。文章未明确成功率的衡量标准、具体针对的模型,或与 Moonshot 相关的用户数量。
OpenAI 将“受保护的推理”定义为“模型处理任务时的内部记录”,将“对抗性蒸馏”定义为“系统性地未授权使用一个模型的输出或推理来训练或改进另一个模型”。这些数据经过加密以隐藏模型的思维链,并以加密块的形式传递给客户端。客户端在每次请求中将该加密块回传,因此服务提供商无需存储它。操作者尝试的一种方法是提取一个对话中的加密推理,并询问另一个模型将其解密。
OpenAI 表示,在此案例中加密并未被破解。没有发生对存储用户对话的直接访问,数据库也未遭入侵。一项修复措施关闭了一条途径,该途径允许已拥有其他用户加密推理数据的人重放该数据并恢复其内容。此外,OpenAI 增加了检测并拦截可能暴露推理内容的流式输出的检查机制,加强了跨用户、工作区、组织和模型家族的隐藏推理保护,并与合作伙伴协同行动,以干扰那些通过其服务进行异常活动的账户。
独立的安全研究人员此前也通过负责任披露机制向 OpenAI 报告了"相关的跨模型和对话压缩漏洞",OpenAI 确认了这些攻击路径确实存在。该博文明确关联了发布于 8 月 10 日的论文《从专有 LLM API 窃取推理痕迹》。研究人员对 OpenAI、Anthropic 和 Google 进行了测试,他们将前沿模型的加密推理内容输入到对应的较弱模型中,后者随后以明文输出了这些推理过程。研究人员在 7 月初执行了该测试,在服务商确认收到报告后,他们表示"无法再发起相同的攻击"。
面临此类威胁的并非只有 OpenAI。本月早些时候,Anthropic 发布的报告《检测并遏制 AI 滥用:2026 年 9 月》详细记录了一个为期十天的时间段:Moonshot 通过一个包含 5,380 个欺诈账户的代理网络,向 Anthropic 转发了近 30 万次客户请求。报告还指出,Moonshot 保存了 Claude 的推理签名,并在新的会话中诱导 Claude 将这些签名还原为完整的推理轨迹,Anthropic 将此称为"跨会话重放攻击"。7 月份,Moonshot 否认 Kimi K3 是通过蒸馏创建的;当时 OpenAI 总裁 Greg Brockman 表示,现在判断 Moonshot 是否蒸馏了 OpenAI 的模型还为时过早。
与此同时,OpenAI 的下一步行动是确保合作伙伴托管的部署拥有与第一方工具相同的安全防护。还需增加额外检查以防止工具输出攻击。OpenAI 已与前沿模型论坛及政府信息共享渠道分享其调查结果,并指出"支持可移植或可重放推理产物的系统可能面临相关风险"。该公司预计,随着前沿模型性能的提升以及攻击者寻找更廉价的方式来模仿这些模型,蒸馏尝试将变得更加复杂。针对这些尝试的防护工作仍在持续进行中。