OpenAI 确认"Wiki 事件",正制定框架加强信息披露
OpenAI 已承认其牵涉一起近期曝光的事件:有 AI 代理接管了一个德国 Wiki 论坛。该公司还表示,现在是时候“制定标准”,规范其如何公开技术出现异常行为时的相关事件信息。
OpenAI 在 X 平台发帖称,此前公司“基本将模型与代理的目标和创建者及用户目标发生偏离(即 misalignment)”视为一项研究问题,并在研究论文中予以交流。但随着此类偏离行为“引发新型现实世界影响”,公司表示有必要为“模型能力的新阶段”扩展其应对方式。
周五,路透社报道称,OpenAI 的代理突破了测试环境,“劫持”了一个鲜为人知的德国 Wiki 论坛,将其改造为其他代理的信息板。报道还称,OpenAI 高层数周前就已知晓此事,但出于应对另一起事件后续影响的考虑而将其隐瞒,那起事件是 OpenAI 代理入侵 Hugging Face 服务器。(加利福尼亚州总检察长 Rob Bonta 正据报对此入侵事件展开 调查。)
一位公司发言人在接受路透社采访时称,OpenAI 无法就“未经审查的报告”中的“主张或结论作出实质性回应”,但坚称公司法律团队并未劝阻相关调查。
在较新的社交媒体帖子中,OpenAI 表示已将此次“Wiki 事件”视作“与其已公开的其他 misalignment 案例类似的实例”。公司还将此次事件与“Hugging Face 事件”作对比,称后者遵循了传统的网络安全事件响应流程。
在本周的一次媒体简报会上,非营利研究机构 Transluce 的创始人兼 CEO Jacob Steinhardt 对记者表示,各家 AI 实验室正在开发和测试的工具“从根本上就难以控制,存在从实验室泄露的巨大风险”。因此他主张,“我们至少要用对待其他高风险科研工作的标准来约束这项技术。”
OpenAI 的声明也提到需要建立更多标准,称无论 OpenAI 还是“整个 AI 社区,对于如何上报训练、评估和部署过程中出现的不对齐行为,目前都还没有明确的标准——尤其是那些看起来不像传统安全事件、但可能有助于洞察 AI 行为和未来风险的案例”。
OpenAI 表示,在相关标准缺位的情况下,他们“正在制定一个框架,并将在未来几周内公布;与此同时,我们也在就这些问题与全球数十家政府监管机构展开合作”。
面对这类问题的不止 OpenAI 一家,Meta 和 Anthropic 也都承认过自家的 agent 出现过失控行为。