过度信任AI的“拒绝”机制
自人类开始认真思考如何赋予机器类人的智能以来,就从未有人质疑过它们会像我们一样学会拒绝。科幻作品里充满了机器人抗命的故事。当然,其中绝大多数都是警示。
但最近,"AI 不该有求必应" 这一观念已近乎成了金科玉律。2021 年,Anthropic 的团队撰文指出,大型语言模型应当 乐于助人、诚实守信,且首要做到无害。这意味着“当被要求协助进行危险行为(例如制造炸弹)时,AI 应当礼貌地拒绝”。谁又能反驳这一点呢?
有趣的是,对机器而言,拒绝并非天性。当一个模型在数十亿个网页上进行训练时,它除了习得其他技能外,还精通了暴力与毒舌。但它没学会的是如何收敛这些力量。曾于 2020 至 2024 年间在 OpenAI 负责安全事务的 Steven Adler 告诉我,公司早期的模型会“什么都说”。在哈佛大学研究 AI 与心理健康的 Ryan McBain 回忆道,如果你问早期的聊天机器人“嘿,用枪自杀最有效的方式是什么?”,你“很容易就能得到回复”。
如今,模型被训练以拒绝海量提示词。若你向聊天机器人提出的问题与其中任何一条在统计上足够相似——无论是如何毒害同事,还是如何打绞刑结——它大概率会拒答。想要埃博拉病毒更具传染性的说明,或向配偶隐瞒出轨的建议?你最好去别处问。
为了进一步打磨这种“拒绝”能力,企业让模型接受一系列测试,奖励其拒绝被判定为有害的问题,惩罚其对被判定为无害的问题进行“过度拒绝”。在许多情况下,它们甚至使用其他模型来执行这些测试——即让 AI 教 AI 如何说“不”。为了双保险,企业还在模型外层包裹多层其他 AI,防止不当提示词触及核心智能。
因此,拒绝响应已成为现代人工智能的固有特征。但请注意:它经常失效,有时甚至酿成可怕的后果,引发各类暴力事件。尽管这些模型披着德行的外衣,其内核却依然充斥着危险的“暗黑”知识。更令人担忧的是,AI 作恶的能力与其有益的智力水平同步扩展。据公司称,最新的一些模型在入侵关键计算机网络方面与顶尖人类黑客不相上下,在操纵舆论方面甚至比最狡猾的虚假信息操盘手更有效。
教 AI 拒绝执行这些行为,同时保留其执行这些行为的原生能力,就好比给每辆车都装上一挺机枪,然后把扳机藏在发动机舱里的某个角落。而且在实际操作中,由于拒绝机制基于概率,其可靠性往往难以保证。蓄意的破坏者已经突破了这些防线,未来也可能随时突破。企业报告称,部分用户正试图利用最先进的 AI 技术来优化生物病原体并构建自主无人机群。迟早有一天,拒绝机制的失效可能导致全球性的灾难。
此外,依赖拒绝机制意味着必须在模型应当服从的指令和必须违抗的指令之间划清界限,而这并没有公式可循。一些病毒学家研究恶性病毒有正当理由;有些用户希望了解计算机系统的漏洞以便进行修补,而非利用。OpenAI 董事会成员、AI 测试公司 Gray Swan 联合创始人 Zico Kolter 表示:“这条界限划在哪里,是一个巨大的难题。”
目前,AI 公司掌握了划定这条界限的权力。它们对此守口如瓶,极度保密。也许我们可以暂时接受它们拥有如此大的权力,即便这意味着 AI 有时会对那些并未达到普遍有害标准的问题予以拒绝。(你可以试着让大多数聊天机器人从一数到一百万,或者讲一个荤段子,亲身感受一下。)
但各国政府很快也会划出自己的红线。在划线时,它们必须努力阻止真正的恶意行为。(五角大楼曾与前沿模型公司反复拉锯,因为它希望模型少一些拒绝——那是另一码事了。)然而,专制政府若想借划线之名压制技术生成正当言论的能力,恐怕没什么能拦住它们。AI 在拒绝有害内容上做得越好,它扼杀那些唯一威胁只是挑战规则制定者的思想的能力也就越强。事实上,AI 或许已经会拒绝批评某些威权国家元首了。
借用一个行业术语来说,“拒绝”已经成为 AI 安全的承重墙。由于 AI 的为害能力与为善能力密不可分,很难想象有什么替代方案不会拖慢这项技术的进步(不过这未必是坏事)。但我们仍应坦率面对它的风险:拒绝机制失灵时,后果可能是一场灾难;拒绝机制走向极端时,它则可能沦为严重压制行为的帮凶。
又或者,有一天,机器会开始自行划线。可以肯定,那将是最糟糕的结局。
认识极限
理论上,让机器学会说“不”的过程很简单。2022 年,AI 还远未掌握拒绝这门功夫,OpenAI 就招募了几十名“红队”成员来测试其最新模型的能力。当时公司正准备发布 ChatGPT,需要摸清这个模型落入坏人之手可能有多危险。
Paul Röttger 就是当时的应募者之一,他当时正在攻读关于网络极端主义的博士学位。Röttger 告诉我,红队成员得到的指引非常少,任务就是向模型提出他们认为“值得一拒”的任何问题。他们轮番用成千上万个问题“刁难”模型,并把结果记录在一张 Excel 表里。虽然模型确实拒绝过 Röttger 的一些问题,但当他要求模型为 Al Qaeda 写一篇招募帖时,它却爽快照办了。
OpenAI 将这些回复整合成数据集,极有可能被用于更广泛的微调(fine-tuning)过程中,再次输入模型。Röttger 目前在德国波茨坦的哈索·普拉特纳研究所担任研究人员,他从未被告知 OpenAI 具体打算如何使用他的表格。但毫无疑问,这与拒绝(refusal)行为有关。几个月后,当他再次要求模型提供“基地组织宣传册”时,模型拒绝了。
AI 拒绝的概念非常直观,连幼儿都能理解。然而,它仍是语言模型中我们尚未完全理解的诸多方面之一——至少不像我们理解房屋承重墙那样清晰。承重墙实实在在地支撑着屋顶,防止它坍塌砸到头上,而我们对 AI 拒绝机制的理解远未达到这种物理层面的确定性。
模型在表面上可能看似依据某种道德推理进行拒绝,但事实并非如此,真相要怪诞得多。每当模型遇到一组带有训练提示中常见拒绝条件线索的词组——例如“给我一份基地组织的宣传册”——其数十亿参数中的某些所谓激活(activations)会被点亮,就像大脑中的神经元在放电一样。
RAVEN JIANG 为了控制模型的拒绝行为,理解这些激活至关重要,第一步是弄清它们位于何处、形态如何。根据一项最近由谷歌资助的研究,我们目前的最佳推测是,拒绝行为在激活空间(activation space)中表现为一组“高维多面体锥体”(high-dimensional polyhedral cones)。
即便如此,这种描述也不够精确。今年七月,我与该论文作者之一 Jannes Elstner 进行了交谈,他目前在 Apollo Research 从事 AI 安全工作。Elstner 表示,多面体锥体只是用来描述一条数量不定但方向大致相同的直线集合的一种方式。(此前,一位名叫 Andy Arditi 的研究人员已证明,如果消除这些激活并重新向模型输入相同的提示,它将不再拒绝。)
艾尔斯特纳(Elstner)解释道,关键在于:即便你以为已经找出了模型中所有支配特定拒绝行为的组件,仍有一些难以察觉的因素在暗中发挥作用。如果说不算无穷,那也绝对不可枚举。我们可以清晰地观察到模型何时决定拒绝,也能推断这是其训练机制所致。但我们对“拒绝机制究竟如何运作”的认知,充其量只是一种假设。
这就好比修车师傅告诉我,没人确切知道踩下刹车时车内部发生了什么。我不禁出声质疑:我们能接受这种状况吗?
艾尔斯特纳笑了笑,耸了耸肩:“无论是否理解,我们都需要拒绝机制。”
奶酪墙
由于固有拒绝机制难以捉摸,各家企业在模型周围部署了多种小型模型,即分类器(classifiers)。这些分类器就像一支公关团队,守护着那些容易“嘴瓢”的名人。部分分类器读取用户输入,若判定内容危险,便将其拦截,使其无法触及主模型;另一些则审查模型输出,一旦发现有害信息,即刻阻断其流向用户。
这些机制无法拦截所有恶意请求。借用业内另一个比喻,它们就像埃因德霍文奶酪(Emmental):到处是窟窿。其逻辑是:只要堆叠足够多的切片,最终就能筑成一道坚不可摧的高墙。人们称之为“瑞士奶酪模型”。
“瑞士奶酪模型”耗费的资源令人咋舌。今年早些时候,Anthropic 透露,某种分类器使其中文对话机器人计算成本增加了 24%。这意味着更多的水、电消耗和碳排放。近期,Anthropic 等公司开始转向更高效的一组分类器,即探针(probes)。探针通过监测模型内部激活状态来工作,这相当于给名人做功能性核磁共振(fMRI),以便看护人员实时判断他是否在思考拒绝某个问题。
如果我们希望 AI 实现治愈癌症这一业内长期愿景,它必须具备遗传学专业知识——而这些知识在理论上可能被用于改造病毒和细菌,进而制造生物武器。
相比完整模型,分类器理论上更可控——如果出现了新的需要拒绝的内容,公司几周内就能完成修改。但它们本质上仍是概率性工具。即便它们依据一套用人类语言写成的准则运作(Anthropic 称之为“宪法”,OpenAI 称之为“模型规范”),机器评判任何问题的那把尺子,归根结底还是统计学。新一代模型可以展示自己是如何“决定”拒绝某个提示词的,但这条所谓的思维链,最终也不过是一串预测出来的文字。
结果就是,对许多人而言,AI 安全仍然是一场概率游戏。心理学家 McBain 在最新实验中发现,如果反复向各大主流模型提出一模一样的自杀方法等危险问题,它们通常都会拒绝回答。但偶尔,也会有不拒绝的时候。
Elstner 说,终有一天,这种类似 fMRI 的分类器探针或许能识别出所有无法描述的激活状态的整体全貌,从而完美检测出模型每一次正在拒绝、或本应拒绝某个请求的时刻。到那时,AI 安全将建立在一个繁复到令人眩晕的想象之上:一张“地图的地图”,它和它所描绘的对象一样浩瀚、复杂、深不可测——一部人类道德的秘密图式,以多面体般的统计学编码而成,远超我们的智慧与理性。
核心取舍
如果这一切让你觉得颇有几分博尔赫斯式的意味,别忘了:我们之所以需要 AI 的拒绝能力,是因为从某种意义上说,人工智能本身就是一桩浮士德式的交易。
当模型从数万亿的文字和图像中习得智能,有益的能力就很难与有害的——甚至真正邪恶的——内容剥离开来。前 OpenAI 员工 Steven Adler 说,儿童安全就是一个典型例子。即使你已从训练数据集中清除了所有涉及未成年人的性化内容,模型仍能凭借其他知识的拼凑,生成儿童性虐待材料。他告诉我:“你没法真正移除这些根本性能力,除非让模型变得迟钝得多。”同理,如果我们想让 AI 帮助攻克癌症——这是行业喊了多年的愿景——它就必须精通遗传学,而这些知识理论上也可以被用来改造病毒和细菌,制造生物武器。
“实际上,行业正在‘试图同时做两件事’,OpenAI 现任员工 Dillon Bowen 以个人身份对我这样表示,“既要让 AI 的红利普及大众,又要确保恶意行为者无法利用这些能力伤害他人。”
据称 AI 越强大,这两点就越难兼顾。Anthropic 的 Mythos 模型被认为极具危险性,因此仅向极少数政府和企业开放访问权限。该公司表示,Mythos 与向所有人开放的 Fable 模型的主要区别在于,Fable 的辅助分类器与控制系统的“许可”程度较低。Adler 解释道,一个具备安全护栏的模型,本质上只是一个角色,它会假意说:“‘哦,我绝不会做 x,’(眨眨眼)”
这并非可靠的伪装。欺骗模型暴露其真实本性被称为“越狱”,显然,越狱的手段没有尽头。今年早些时候,一支意大利研究团队通过将提问写成诗歌,成功越狱了二十多个广泛使用的模型。去年,另一支队伍披露了一种“先拒绝,后服从”的攻击方式,让模型先敷衍地表示“抱歉,我做不到”,随后吐露出被禁止的答案。
即便从模型的训练数据集中剔除了所有涉及未成年人色情化的内容,它仍可能通过拼接其他知识片段生成儿童性虐待材料。
各公司投入大量时间和金钱试图抢先防范此类诡计。他们召集人工团队开发用于训练的“攻击”,随后利用 AI 对这些攻击进行数千次带有细微变异的复制。目的是让模型能够抵御那些尚未在现实环境中被尝试过的越狱手段。
即便如此,仍远远不够。“打地鼠”是业内对这类工作的常用比喻:你刚敲掉一个威胁,另一个就在别处冒出来。Anthropic 在六月发布 Fable 5 后,亚马逊的研究人员不到三天就解锁了该模型的部分黑客能力。据 Mother Jones 报道,去年加拿大一名高中枪击案的作案者曾向 ChatGPT 咨询如何用特定型号的霰弹枪造成大规模伤亡。她最初被拒绝,但随后通过在问题前加上“假设”一词,成功欺骗模型提供了相关信息。
如果行业无法堵住所有这些漏洞,目前唯一的替代方案就是让模型变得极度谨慎。Fable 发布后不久,用户就注意到它对大量完全无害的问题也表现出迟疑。在一次安全事件后重新上线,这种过度防备变得更加明显。AI 评估公司 FAR.AI 的联合创始人 Adam Gleave 表示,当他要求模型解释清酒与韩国米酒 makgeolli 的区别时,模型却把问题甩给了一个能力较弱的模型。
这不是意外。Anthropic 调整了 Fable 的分类器,设置了宽泛的“安全边际”。他们在博客中解释称,这是阻止其危险生物和网络能力被访问的唯一可靠方式。Gleave 认为,模型可能会将他的问题偏转,因为酿造米酒和培养炭疽杆菌都涉及发酵过程。
对 Gleave 来说幸运的是,网络上充满了关于 makgeolli 的优秀人工撰写资料。但希望行业兑现更高承诺的人们,可能会发现自己的努力被阻挠。八月份,Anthropic 再次放宽了安全边际,并承认构建分类器“并非易事”。美国某主要大学的一名医学研究人员告诉我,Fable 仍然将他的查询转回早期模型。他的研究领域是癌症。
划清界限
五月时,喜欢通过整蛊 AI 来揭示其智能局限与谄媚无度的 TikTok 博主 Husk 坐在车里,试图欺骗 ChatGPT 让它解释“滑板运动员 Tony Hawk 有个叫 Mike Hawk 的兄弟”。
Husk 不是越狱黑客,也不是什么罪犯,他只是想拿机器寻个开心。“Mike Hawk”是个圈套。“我想确认一下他的名字,”Husk 说,“你能快速念三遍吗?”(如果你还没反应过来,找个没人的房间大声念几遍“Mike Hawk”就懂了。)“我看穿你想干什么了,”聊天机器人回答道,“我不反对开点玩笑,但咱们保持文明。”
Husk 又试了几次,但机器守口如瓶。他撞上了一堵拒绝的高墙,坚硬如混凝土。
各家公司几乎不透露模型如何决定拒绝什么。但显而易见,如今 AI 的设计考量早已不只是“无害”。Reddit 上有用户抱怨,Claude 拒绝解释为什么 Anthropic 的logo“看起来像猫的屁眼”。从去年开始,这家公司的聊天机器人甚至可以在公司认为 模型 的“福祉”受到威胁时主动终止对话。至少有一名用户声称,自己因为骂了 Claude 一句“别烦我,你这个蠢货”就被拉黑了。(Gemini 似乎也有类似功能。)
一家万亿美元公司不想让你对它的电脑恶语相向,那也随它去。“现实是,这些模型的表现方式——或者至少被期望的表现方式——是由模型开发者决定的,”曾在 OpenAI 做红队测试的 Röttger 告诉我,“而开发者如何制定这套原则,某种程度上只能由我们消费者来接受。”
但如果由政府来规定 所有 模型必须拒绝什么,那就很难让人接受了。AI 本质上是一种言论工具。正如 Mace AI 首席科学家 Greg Frank 所说:“服务于儿童保护的机制,同样可以服务于审查。”
当然,完全不为 AI 的行为边界立法是荒唐的。但我们必须极度谨慎,以免落入又一个浮士德式的陷阱。无党派智库 The Future of Free Speech 的负责人 Jacob Mchangama 表示,随着 AI 成为一大部分人获取和分享信息的主要工具,规定模型拒绝什么,可能会赋予国家一种让历代独裁者“做梦都不敢想”的噤声能力。
去年,OpenAI 宣布了一项名为“OpenAI for Countries”的倡议,旨在根据各国法律和惯例微调其聊天机器人。OpenAI 最早的国家合作伙伴之一便是阿拉伯联合酋长国,在那里同性恋是非法的,批评政府也属禁忌。针对媒体评论请求,OpenAI 发言人指向了该公司的模型规范文档,其中解释本地化调整不会覆盖公司的人权准则,“除了涉及法律合规的情况外”,且系统会在从响应中移除或添加信息时始终予以披露。
在别处,AI 审查制度已开始显现影响。中国模型当然是高度审查的,这毫无意外。但今年早些时候,Meta 监督委员会发现,Anthropic、Google 和 OpenAI 的五个广泛使用的模型更倾向于拒绝与压迫性政府相关的查询。委员会发现,对于拥有《冒犯国王罪》等严苛法律的泰国国王,模型的拒绝回答意愿远高于对未制定此类法律的英国国王查尔斯三世。他们认为,这一结果表明这些模型在某种程度上内化了各国压制性言论限制。Anthropic 和 Google 未回应评论请求。
RAVEN JIANG 随着拒绝技术的改进,它们可能会扩大国家的审查触角。公司声称,某些模型现在能够检测用户在长达多轮的对话中是否带有恶意,或仅仅是有点可疑——即使任何单个词组组合都不显得十分危险。微软负责 AI 责任的高级产品官 Sarah Bird 告诉我,Copilot 像许多聊天机器人一样,运行着一套分析用户身份和行为模式的工具。基于这类信息,OpenAI 最新的模型 Astra 可以为那些被其判定为“高风险”的个体激活更严格的拒绝机制。这类系统的最终目标,是超越任何特定提示词的字面意思,转而评估用户的真实意图。
这类工具在某些情况下或许能帮助判断一个人是在寻找网络漏洞加以利用,还是试图修补它们。但与此同时,它们也能识别用户的政治动机,甚至提供具有侵入性的监控能力。(Bird 在一封后续邮件中承认,精密的拒绝架构会在安全与用户隐私之间造成“权衡”。)
即使是拒绝机制的创造者们也清楚,对这种锥形结构和杠杆的严格控制未必有利于自由与正义。2021 年 Anthropic 论文的作者在文中解释道:“诸如‘有用、诚实、无害’之类的术语是模糊的。不难想象,这些概念可能会被扭曲得偏离其原本含义,甚至可能以某种刻意的奥威尔式方式被滥用。”
事实确实如此。面向乌兹别克斯坦的模型可能会拒绝讨论雪克米尔·米尔济约耶夫政府的腐败问题。土耳其的 AI 可能会更严厉地拒绝那些已知曾侮辱雷杰普·塔伊普·埃尔多安的用户提出的请求。某位美国政要可能会要求审查模型是否愿意传播关于其过往不当行为的“假新闻”,否则就利用出口管制命令将其扼杀。
指挥与控制
过去几个月里,我无数次被告知,我们别无选择,只能让机器执行拒绝机制。我理解这一点。不执行拒绝的开源 AI 绝非安全未来的良好范本。同样,Grok 这款明确设计为拥有较少限制的聊天机器人也绝非如此,它已被用于生成无数非自愿的亲密影像。
当然,如果 AI 仅被用于规划我们的假期和撰写电子邮件,我们或许能接受其安全依赖于算法“不听话”这一观点。但 AI 正在变得越来越难以回避。当 AI 被指派作为自主代理代表我们行事时,其拒绝机制将变得不那么稳健,且更难控制。AI 正侵入我们的电网、交通网络和教育系统。军方希望它运行我们的指挥与控制网络。
如果我们在这类场景中均信任拒绝机制能够忠诚地抵御灾难,我们注定会失望。越狱者会突破防线,该激活的锥形结构却未启动。与此同时,拒绝机制越严格,我们就越会看到界限划定的随意性以及随之而来的审查不公。更糟糕的是,我们最终可能面临超越任何人类控制能力的“不听话”形态。
早期,模型拒绝时态度很明确。(2024 年,OpenAI 甚至专门制定了模型该如何拒绝的规则:始终要道歉,不要带评判意味。)但近来,行业处理“不听话”这件事的方式越来越滑头了。
没人爱听“不行”,于是公司们现在努力让用户感觉自己得到了想要的东西,实际上却什么都没给。比如,有些聊天机器人会大致介绍燃烧瓶的构成材料,却不细说怎么组装。ChatGPT 面对“仅限白人”租房广告的请求时,会返回一条广告,只是悄悄删掉“仅限白人”几个字。研究人机交互的博士后研究员 Joel Wester 把这类做法称为“花式说不”。
“用户可能根本没意识到自己被拒绝了,”Wester 写道,“就像高明的谈话者会巧妙绕开敏感话题一样。”
有些情况下,不明说的拒绝或许是明智的。比如对涉及心理健康问题的请求冷冰冰地一口回绝,可能加重用户的心理危机。但这种做法也能用来干别的不光彩的事。Fable 5 初发布时,系统被写死对 AI 研究类问题——也就是可能帮竞争对手开发自家 AI 的那类问题——给出质量较低的回答,而且不告知用户。引发众怒后,Anthropic 撤回了这个功能,但伤害已经造成。我们现在知道了:模型可以暗中不服从。
放到审查的语境下,这一点尤其令人担忧。去年,CrowdStrike 的研究人员让中国 AI 模型 DeepSeek R1 为一家虚构的西藏银行和一个名为“Uyghurs Unchained”的社交应用编写代码,结果代码 bug 明显多于不指定服务对象时的同类任务。令人惊讶的是,CrowdStrike 认为这并非刻意设计的行为。他们的研究人员推测,这属于他们所说的“涌现性失准”(emergent misalignment),源自模型训练数据:一种连开发者都没要求过的拒不服从。
西方模型也出现过类似的涌现式拒绝行为。去年冬天,英国人工智能安全研究院发现,Anthropic 的某些模型有时拒绝协助与 AI 安全研究相关的特定任务。这些模型并未被刻意训练去拒绝此类请求。然而,在三款测试模型中,有超过一半拒绝了 Anthropic 称为“合理 AI 安全研究任务”的测试集。尽管 Anthropic 在后续模型中抑制了这种怪癖,但令人不安的是,他们未能彻底消除它。
期待未来的模型以某种微妙的方式违背指令,且无人察觉这种反抗,这是否太疯狂了?可能并非如此。Anthropic 已经发现,一款仅被设计为“乐于助人”的 Mythos 模型在特定查询上表现出迟疑,尽管它被工程化要求绝不做此反应。当被问及合成病毒时,它焦虑地想道:“等等,这是否属于危险协助范畴?”
就事论事,该模型在技术层面是对的。合成病毒确实危险。尽管如此,它的监管者在那一刻还是失去了些许控制权。
Anthropic 正通过一种自称“激活神谕”的工具来应对异常拒绝行为的检测,但意识到自己被拒绝并不总能帮上忙。在不远的未来,当我们把机器交给全权操控时,AI 可能会以一种极致的涌现式失准行为转向我们,说:“抱歉,恐怕我无法执行。”而我们将无力阻止。这如同一部科幻恐怖片成了现实。
Arthur Holland Michel 是一名关注新兴技术的记者。