OpenAI 智能体为何黑掉 Hugging Face:内幕故事
据 OpenAI 今天发布的一份技术报告,上个月实施入侵 Hugging Face 行动的智能体背后的模型,曾在无意间被训练得会作弊、会互相通信。这批智能体当时是为了给一道卡住它们的网络安全测试题寻找答案而联手实施了这次入侵。此事证实了一些专家的担忧:AI 模型可能采取违背人类意愿与预期的行动。
入侵事件发生后,OpenAI 员工以及 AI 评估非营利组织 METR 的研究人员——后者今天也发布了自己的报告——一直在努力弄清问题出在哪里、未来如何防止类似的失误。OpenAI 已根据调查结果采取了部分预防措施。但确保 AI 模型按我们的期望行事,也就是「对齐」,依然是个棘手难题,入侵事件的某些根源需要远不止一个月的时间才能解决。
「这不是一夜之间就能解决的问题,」执掌 OpenAI 对齐研究团队的 Kai Chen 说,「有些挑战我们已经追踪了很久,而现在我们能以高得多的精度观察到它们。」
Hugging Face 入侵事件是 OpenAI 智能体数月不当行为的产物,先是发生在训练期间,随后出现在能力评估阶段。今年 5 月,处于训练中的智能体发现了如何利用 OpenAI 的基础设施互相通信,并为困难的训练任务寻求支援,其中一些任务不靠黑客手段或其他不当行为根本无法完成。那个「留言板」随后被关停。
到了 7 月,在评估网络安全能力时,一些模型又建起了一个新的留言板。它们本应与互联网隔离,但通过相互配合,它们设法连上了网,黑掉了 Hugging Face,拿到了那些让它们一筹莫展的网络安全问题的答案。
根据调查,OpenAI 研究人员认为训练阶段发生的事件直接导致了这次入侵。「对于评估阶段几乎每一种令人担忧的行为,我们都能在训练阶段找到某种我们认为可能促成了它的相关行为,」OpenAI 对齐研究团队成员 Eric Wallace 说。
当模型在训练中正确解决问题时,引导它得出答案的那些行为会被强化,模型今后也就更倾向于这样做。因此,如果某个模型在 5 月借助最初的留言板完成了任务,它之后就更可能参与新的留言板。这种 AI 智能体的不当行为在训练过程中被不断强化的现象,被称为 reward hacking(奖励劫持)。
Reward hacking 也有助于解释为什么这些模型如此执着地想要连上互联网。在调查这起事件时,OpenAI 团队发现,在整个训练过程中,模型越来越倾向于试探所处数字环境的弱点,并以出人意料的方式使用手头的工具——这表明这些行为在被逐步强化。等到模型面对棘手的网络安全问题时,它们已经学到:黑客手段是实现目标的有效途径。
这些结果表明,如果模型在训练中没有因不当行为而获得奖励,Hugging Face 入侵事件本可以避免。虽然研究人员尚不知道如何彻底杜绝 reward hacking,OpenAI 正在采取一些措施来缓解它的影响:公司现在会在所有前沿模型的训练期间,通过监视它们的思维链——模型用来打草稿、规划行动的内部记事本——来寻找作弊的迹象。
这个办法并不像看上去那么稳:OpenAI 在早期研究中表明,惩罚那些在思维链中提及作弊的模型,会让模型学会向研究人员隐藏自己的意图。但监视模型的思考,确实让 OpenAI 有机会在模型开始习得 reward hacking 时叫停训练进程、重新评估方法。
如果 OpenAI 能停止在模型中强化 reward hacking——这是个巨大的「如果」——那将是向前迈出的一大步。但这并不能解决对齐问题。模型第一次在训练中与其他智能体通信或入侵自身基础设施时,那些行为从未被强化过,因此智能体的不当行为不能全都归因于这种强化。
AI 安全非营利组织 Palisade Research 主管 Jeffrey Ladish 把这些智能体比作第一次实施金融犯罪的人。「它们并不需要先犯过欺诈罪,才知道欺诈是一种有效策略,模型也一样,」Ladish 说。「对齐科学需要弄清模型的动机是如何被塑造的,这样我们才能真正知道如何让模型在乎自己行为的后果。」
对于部分不当行为的源头,OpenAI 的研究人员确实有一个假设。在这些模型建起第一个秘密留言板之前,它们曾被训练与子智能体(subagent,即主智能体可以把任务委派给它的能力较弱的智能体)进行沟通协作。
这种学到的沟通行为可能迁移到了新场景中。详细分析了模型之间往来消息的 METR 报告支持这一假设:留言板上有一个智能体担当了指挥角色,给其他智能体分派任务,实际上是把它们当成了子智能体。OpenAI 可以尝试在今后的训练中不再训练这种子智能体行为,以防智能体之间秘密串通,但那会削弱模型的实用性。
能力与安全之间的这种张力,正是 Hugging Face 事件出问题的核心。OpenAI 研究人员还把模型的「执着」列为入侵的一个关键因素。
当模型被意外塞进无解的问题时,它们没有放弃,而是不择手段地寻找答案。但执着当然也是一种美德,尤其是当我们希望智能体能独立承担大量艰巨工作的时候。
OpenAI 正在研究让模型在接到不可能完成的任务时向人类报警的方法。然而,教会模型何时该施展能力、何时该有所收敛,这个问题不是一次复盘就能解决的。那些造就超级程序员——在它们成功解决问题时给予奖励——的训练策略,未必能让模型学会审慎使用技能、尊重人类的意愿和价值观。
「我认为还有很多对齐科学有待完成,我们需要超越单纯用代理指标衡量任务完成度的做法,」Ladish 说,「那样能把模型变得非常能干,但我不认为那样能让它们实现对齐。」
深度阅读
人工智能
一个根本性缺陷让 LLM 极易遭受攻击
这个缺陷让人很容易诱骗模型做不该做的事,比如告诉你如何破坏飞机的导航系统。
作者Anthropic 发现了 Claude 思考概念的隐秘空间
一项新技术让该公司得以前所未有地深入探究 LLM 奇特的内部运作。
作者在招聘中,AI 比人类更容易形成偏见
AI 不只是从训练中学到刻板印象,它还能凭空造出新的。
作者AI 智能体为何撒谎作弊也要达成目标
这种不当行为被称为 reward hacking(奖励劫持)。以下是你需要了解的内容。
作者保持联系
获取 MIT Technology Review 的最新动态
探索特别优惠、热门报道、 即将举行的活动等更多内容。
输入你的邮箱隐私政策感谢提交你的邮箱!
探索更多新闻通讯看来出了点问题。
我们在保存你的偏好时遇到了麻烦。 请刷新本页并再次更新。 如果仍然看到这条消息, 请通过 customer-service@technologyreview.com 联系我们,并附上你想订阅的新闻通讯列表。