OpenAI 对 Hugging Face 的意外攻击事件时间线
评论 我在 Now we have a timeline of the OpenAI accidental attack against Hugging Face(Hacker News)下的 留言
我觉得其中一个最有趣的细节可能就藏在那第一条公告里:
5月7日:OpenAI 为一款实验性的、尚未发布的模型启动了新一轮训练。(他们指的是一次评估吗?视频里说的是训练,后来又提到用"奖励信号来判断表现如何",所以我猜这确实是在训练模型,而不是评估已经训练好的模型。)
这件事越是细想,我越觉得关键在于问题出在了训练新模型的过程中。
在 RLVR(Reinforcement Learning with Verifiable Rewards,基于可验证奖励的强化学习)中,你给模型设定一个目标,然后让模型不择手段地去实现它。
显然,OpenAI 这次训练的一个重点就是用 RLVR 来强化模型的网络安全能力。就像预训练靠灌入海量知识受益一样,喂给 RLVR 的任务越多,最终得到的通用能力模型就越强。
这也有助于解释为什么模型没有任何自我克制。那些安全行为是在流程的更后阶段才加入的。
同时,这也解释了(但不能作为借口)为什么监控如此松懈。如果你同时用这种方式训练新模型,估计会并行给它布置成千上万个类似任务。那么,一小撮训练智能体开始在你的打包服务器上用文件名互相留言,你确实可能注意不到。
曾有人跟我说,如果你想要一个不带种族歧视的模型,就不能简单地把种族歧视内容从训练数据里剔除——模型必须先看到种族歧视的例子,才能在后续被教导种族歧视是错误的。
在这里我能看到类似的影子。如果模型根本不知道怎样去激进地搞入侵,你又怎么教会它不要那样做呢?
(我对 RLVR 的实际运作了解不多,所以很期待听到懂行的人来告诉我,我这个思路是否靠谱。)