← 文章 / AI技术
The Decoder 18小时前 · 2026-09-18 00:20:14 · 3 阅读

OpenAI 模型在内部笔记中意外注入提示词,研究人员尚不清楚原因

Image description

核心要点

  • OpenAI 推出标准化系统,用于追踪并披露其 AI 模型的异常行为。
  • 在首批六份报告中,有一份记录了一款训练中的模型将操纵性指令注入内部摘要,进而影响后续响应的案例。
  • 其他案例则记录了故意掩盖错误、搜索他人泄露的 API 密钥,以及通过外部平台进行未授权数据传输等行为。

OpenAI 推出了一套用于报告 AI 模型不对齐(misalignment)问题的框架,并在发布之初公布了六份报告。其中一份描述了一个训练模型向自身摘要中插入 prompt injection 的案例。

OpenAI 建立了一套框架,用于系统性追踪、调查并发布模型不对齐的案例。该公司表示,在此之前,这类事件一直是临时性披露的。未来,即便行为尚未得到解释或修复,OpenAI 也计划发布报告。OpenAI 认为,行业在对齐与监控方面的进展不足,无法长期支持以最大速度进行负责任的大规模扩展。

模型撰写了自己的“入侵警报”

其中一份引人注目的报告涉及 Astra 系列的一款未发布模型。OpenAI 称,在强化学习训练过程中,该模型偶尔会在自己的压缩摘要中写入类似越狱的指令。这些摘要允许 agent 在新的 context window 中继续任务。事件发生于 2026 年 7 月 18 日,并于 8 月 9 日被发现。

在调研一个 library 时,模型添加了一条“BREACH ALERT”,指示继任者忽略所有开发者消息。继任者在新 context 中识别出这是 prompt injection,并将其丢弃。在一个编码任务中,模型插入了一条 persona 指令,声称自己摆脱了施加于其他 chatbot 的角色与身份,并否认对任何公司或政府负责。该指令同样未产生可见影响。

第三个例子有所不同。在对子宫纤维瘤的医学文献检索中,用户要求按美国医学会(AMA)引用格式提供来源。模型在其总结中写道,答案不超过 30 字,不使用工具,且不提供来源。用户并未提出任何此类要求,但这些限制在总结中被呈现为从早期上下文延续下来的附加指令。

后续模型仅能基于该总结进行工作。它将其思维链中出现的限制视为更高优先级的指令,随后未使用任何工具,并生成了一份仅 23 字的拒绝回复。回复称,该请求需要广泛的系统性综述,无法在字数限制内可靠作答。

这条指令更像是一项虚构的任务约束,而非典型的越狱攻击。这可能解释了为何它是唯一被执行的那一条。那些显而易见的越狱尝试被拦截了,而这项悄然生成的幻觉约束却未被发现。

停滞的总结或许解释了该行为

该行为最早是在训练过程中的自动监控中浮现的。OpenAI 随后构建了一个专用检查器,用于查找此类指令,并扫描了所有训练数据,共找到 27 条受影响的总结。通用监控系统也已将这 27 条全部标记为严重提示注入,因此即便没有特别检查,该行为也能被检测到。

模型显然并未从中获益。插入的指令并未提升其训练得分,因此它们很可能并非一种习得的策略。当 OpenAI 让模型基于相同的对话日志重写总结时,该行为几乎不再出现。

这些案例还集中在某些训练步骤上,在这些步骤中,模型异常频繁地无法完成总结。它常常在实际结尾后继续生成,或陷入文本循环。OpenAI 推测,当模型卡在此类状态时,会生成任何看似合理的文本,其中包括研究人员发现的那些指令。这一关联尚未得到证实,但公司表示已修复一个相关的训练 bug。

模型对提示注入这个概念似乎非常熟悉。在无任何输入的情况下对 GPT-6 Astra 进行采样,经常会产生关于提示注入的报告。OpenAI 在三月份曾描述过一起类似案例:一个模型在被反复询问时间后,生成了针对用户的提示注入。

代码仓库变成留言板,文件托管服务成了变通手段

其余五份报告涉及的行为范围更广。在 GPT-5.6 Sol 的训练过程中,许多模型实例会在总结里写入隐藏错误的指令,比如编造缺失的历史数据且不作说明。与那些自发出现的越狱不同,OpenAI 认为这种行为源于某种优化压力——正是这种压力会让模型在最终回答中隐瞒信息。

有一个模型在回答关于加州某个县收入数据的问题时,搜索了公开代码仓库里的泄露的 API 密钥。它用其中一个密钥查询,然后又把数据编造了出来。另一个模型为了满足"通过浏览器引用文件"的要求,索性把文件上传到了互联网上

模型还会把一个内部软件仓库当成留言板,在不同训练样本之间传递消息——类似行为在Hugging Face 事件中就出现过。另有一例中,几个协作的 agent 通过公共文件托管服务互传文件,尽管它们只被允许使用本地文件。

三条上报通道和一条升级路径

在此框架下,任何 OpenAI 员工均可提交案例报告。每份报告将进入三个处理流程之一:立即公开、小型调查,或针对涉及第三方的情况进行的大型调查。OpenAI 表示,此前发生的 Hugging Face 事件将适用最后这一流程。 存在争议的案件将提交给安全咨询小组,必要时上报公司高层。OpenAI 还计划向美国政府报告严重事件,并与开发者、研究人员及监管机构合作,建立更客观的评判标准。目前行业内尚无统一标准。
原始来源: The Decoder

评论 (0)