Hugging Face 被黑事件背后:OpenAI 安全文化存疑
本文最初发表于我们的每周 AI 时事通讯《The Algorithm》。如需第一时间获取类似报道,请在此订阅。
上个月发生的 AI 安全重大事件你大概已经听说了——OpenAI 的智能体逃出沙箱,在一次测试中作弊时黑进了 AI 平台 Hugging Face。事情相当离奇。周三,OpenAI 发布了该事件的事后技术分析报告,我对此做了报道。
在报告发布的前一天,我与 David Krueger 进行了交流。Krueger 是计算机科学教授、知名对齐专家,此前在蒙特利尔大学任职,现已休假创办并领导着一家名为 Evitable 的 AI 安全非营利组织。他表示,他真正希望在这份报告中看到的是对事件背后人为因素的分析。
他说:"每当出现事故或事件,人们往往试图找出技术层面的失败原因,但这样做往往会带来非常不准确且具有误导性的认知,无法真正解释失败为何会发生。如果员工一直在敷衍了事,如果所处的文化并不将安全放在首位,也缺乏恰当的激励机制和组织架构,那么事故几乎注定会发生。"
这份报告并未达到 Krueger 的预期。报告长达 38 页,详细记录了智能体数月间逐步升级的异常行为(最终演变为 Hugging Face 被黑事件),分析了这些行为发生的技术原因,并列举了为防止类似事件再次发生所采取的措施。然而,报告完全没有探讨公司文化可能在事件中扮演的角色,也几乎没有提及具体的人为失误。
这一点尤其令人担忧,因为报告里多次提到"人为失误",暗示背后可能存在严重的文化问题。早在今年五月,训练中的模型自发学会通过一个临时搭建的留言板相互通信,而 OpenAI 团队观察到了这一行为。由于这种现象发生在训练阶段,模型便把"秘密的智能体间通信"当作完成任务的可行策略学会了。但团队没有重启训练流程,而是让模型带着这些危险信息继续推进,让它们写进了权重里。
今年六月下旬对这些模型进行测试时,它们又一次搭建了留言板,而这正是导致 Hugging Face 攻击得逞的原因。这个留言板同样被发现了,但负责响应的员工认为评估可以继续进行。报告暗示,在为时已晚之前,没有任何更高层的管理者意识到发生了什么。
Zvi Mowshowitz 是 Substack 上颇有人气的 AI 安全作家,他曾公开指出 OpenAI 在首次发现留言板后并未叫停训练。他评论道:"事情能失控到这种程度,必然是一连串的失败环环相扣、不断放大——任何一个环节只要有人察觉并发出警报,这场灾难都应该被终结。"根据报告,OpenAI 的员工曾在多个节点察觉到了异常,但要么没有拉响警报,要么发出了警报却没被听到。
报告没有解释的是:一家开发如此高风险系统的公司,为什么没能阻止如此严重的沟通断层。不过 Mowshowitz 有自己的猜测:"这一连串失败都指向同一个方向——OpenAI 要么不存在所谓的安全文化,要么这种文化已经弱不禁风。"
当然,报告中没有看到对安全因素的深入分析,并不意味着 OpenAI 内部没有进行此类分析。但在给《MIT Technology Review》的邮件中,约翰斯·霍普金斯大学荣休教授、组织安全专家 Kathleen Sutcliffe 对公开报告未涉及公司实践与文化的反思表示担忧。她写道:"人们的互动方式——我们组织生活中养成的日常习惯、流程和实践——会影响我们对事态发展的警觉和感知,影响我们理解所见事物的能力,最终影响我们应对不断变化事件的能力。"
在被问到公司是否以及如何反思其安全文化时,OpenAI 让《MIT Technology Review》去参考那份技术报告。
我们确实知道 OpenAI 内部至少进行过一些较高层次的安全流程反思,因为技术报告明确表示公司正在更新应对安全事件的协议。但文化变革是一个棘手的问题,在公司没有提供更多信息的情况下,很难说仅靠加强响应协议就能有效防止未来的危机。
在报告中,OpenAI 花了大量篇幅反思公司训练和测试的 AI 模型与操作这些模型的人类之间的对齐失误。然而,更大的对齐问题可能存在于企业文化与公共利益之间的脱节之中。尽管 AI 技术研究本身已经足够困难,但解决这些问题可能要难得多。