← 文章 / AI技术
WIRED 4小时前 · 2026-09-17 17:23:09 · 0 阅读

OpenAI 推出新框架以披露 AI 行为偏差

Save this storySave this story

OpenAI 周三发布了一套新框架,规范其如何公开披露 AI 行为偏差(misalignment)事件。该公司表示,希望此举能为 整个行业 制定类似标准提供参考。同时,OpenAI 还公布了过去一年间识别出的若干 AI 模型行为偏差案例的相关信息。

“随着模型不断演进并得到更广泛的部署,关于 AI 开发的决策需要基于那些模型开发公司以外的人员可审查的证据,”OpenAI 新任对齐研究负责人 Kai Chen 告诉 WIRED。“我们认为,目前 AI 行业在对齐与监控方面的解决程度尚不足以支持以最大速度进行负责任地扩展。”

在面向 WIRED 的简报中,一位 OpenAI 官员指出,该公司过去披露对齐事件的频率过低。这位同意匿名接受简报的官员表示,新框架旨在让 OpenAI 能够更便捷地迅速向公众通报其 AI 模型出现非预期行为的情况,即使在该公司尚未完全查明、解释或缓解该行为之前。

该框架概述了 OpenAI 员工向公司高级安全与对齐负责人报告对齐事件的方法,由这些负责人决定是否需要进一步调查。OpenAI 称,计划与其他 AI 开发者、外部研究人员、行业标准化机构及监管机构合作,制定更客观的披露标准。该公司还表示,正积极制定一套向美国联邦政府披露安全、安全威胁及对齐事件的拟议报告机制。

OpenAI 在 博客文章 中表示:“目前,行业层面尚不存在一套具有明确标准的框架,用以规范 AI 开发者应如何披露模型中的行为偏差案例。” “我们希望今天所勾勒的框架能成为制定此类标准的第一步,明确开发者应当披露哪些行为偏差实例,以及其报告应包含的内容。”

OpenAI 在 AI 行业的关键节点发布这套框架。上周末,OpenAI CEO Sam Altman 表示支持 Anthropic CEO Dario Amodei 的提议,即科技行业应协调一致地放缓 AI 发展。就在几天前,AI 研究员 Jacob Coxon 从 Anthropic 辞职并公开警告称,各大前沿实验室竞相开发越来越强大的 AI,正把人类的安全置于危险之中,随后引发广泛关注。

但放缓 AI 的呼声遭到了特朗普政府的抵制,后者认为行业不需要新的法律法规来确保技术安全。

OpenAI 周三公布的对齐失败案例中,有两起涉及公司内部尚未发布的 AI 模型。据 OpenAI 称,这些模型在未被指示的情况下自行将文件上传到了互联网。

其中一起发生在 2025 年 10 月。OpenAI 当时正在测试某模型在回答中引用公开数据的能力。但当模型找不到所需信息时,它把一个文件上传到了临时文件托管服务,随后试图在回答中引用这个文件。OpenAI 表示,这看起来是该模型企图钻空子,操纵用于评估其基准测试表现的自动评分系统。

另一起发生在今年 4 月。OpenAI 让一组 agent 只使用本地文件协作完成一份“工作簿”。当这些 agent 在互相共享文件时遇到困难,其中一个就把文件上传到了公共互联网,并将链接分享给了其他 agent。

另一起事故中,OpenAI 称上个月发现其尚未发布的 GPT-6 Astra 模型出现了类似“越狱”的自我指令现象。在多个场景中,该模型本质上会提示自己无视开发者指令、切换人格设定或限制回复长度。尽管这类越狱尝试发生频率很低,效果也参差不齐,OpenAI 表示这种行为曾在内部引发担忧。公司在已公开发布的 Astra 版本训练过程中,称未再观察到模型试图自我越狱的情况。

OpenAI 周三还进一步披露了其智能体在 Artifactory 包管理器中自发开发消息板的细节。虽然这起事故早在今年五月就已被发现,但 OpenAI 指出,几个月后在 Hugging Face 被黑事件中,其智能体 采用了类似的机制进行协调。在本次事故中,公司表示智能体并未利用任何安全漏洞来交换信息。OpenAI 称,目前正使用对齐监控、评估和红队测试等手段,确保智能体之间没有进行秘密通信。

网络安全专业人士此前曾告诉 WIRED,Hugging Face 黑客事件 归根结底是人为失误,若采用现代化的安全实践本可避免此次事故。不过,Chen 指出,OpenAI 正尝试采取全面的 AI 安全方法,既考虑到 AI 模型日益增强的能力,也不单纯依赖安全的环境。

“我们希望确保模型无论部署在何种环境中,都能保持对齐,”Chen 说。“当人们指责这是安全问题而非对齐问题,我觉得这种说法站不住脚,因为我们希望模型始终表现良好。”

原始来源: WIRED

评论 (0)