实验显示:与聊天机器人对话7分钟比事实清单更能削弱阴谋论信念
研究表明,即使在危机刚发生后、硬证据尚显不足时,与语言模型简短对话也能即时削弱阴谋论信念,且这种效果会在数周后持续影响人们对新事件的看法。
2024年7月,在针对唐纳德·特朗普的刺杀未遂事件发生不到一周内,美国代表性样本中约有半数人认为该事件是人为策划的,11%的人真正相信这一点。2025年9月摩萨德参与、“ false flag(假旗行动)”以及政府掩盖真相等关于右翼活动家查理·柯克遇害案的阴谋论也在数日内迅速蔓延。
来自卡内基梅隆大学、麻省理工学院和康奈尔大学的研究人员开展了一项新研究,测试在与大型语言模型进行简短对话后,是否能在这个关键时间窗口内削弱上述叙事。针对这两起事件,答案都是肯定的,且效果超越了事件本身。
两次在线实验分别在袭击发生后的几天内进行
研究人员通过调查平台招募美国成年人,并使用已上市两年多的GPT-4o筛选出对事件持有阴谋论信念的参与者。特朗普实验保留了472名参与者,柯克实验保留了1,035名。
在测量了参与者的基础信念后,研究人员将其随机分配到三个组别。其中一组与 Google Gemini 进行了至少五轮对话(2024 年 2 月的 1.5 版用于第一个实验,2025 年 6 月的 2.5 版用于第二个实验),模型被指示通过基于证据的对话来降低阴谋论信念。第二组阅读了带有来源引用的静态事实清单。第三组则进行无关的闲聊,讨论猫和狗哪个更适合做伴侣。
由于这些事件均发生在所用模型训练截止日期之后,因此两者都无法依赖内部知识。研究团队直接将精心策划的事实库嵌入系统提示词中,分为已确认的事实、已被揭穿的言论以及明确标记为未解的问题。在 Kirk 实验中,还允许使用网络搜索,但仅用于核实事实性声明。
对话效果优于静态事实清单
两次实验中,平均约七分钟的对话均降低了参与者对自己所持阴谋论的信念,其效果既优于控制组,也优于事实清单。关于“掩盖或阴谋”以及“隐藏或未公开因素”的认同度也相应下降。

在特朗普实验中,参与者对官方解释的信任度并未提升。作者认为这是因为当时并不存在清晰的官方解释。人们所知的仅是安保失效,而在研究报告撰写时,枪手的动机仍然不明。
在 Kirk 案实验中,由于官方早已公布了凶手的详细信息,参与者对官方说法的信任度比对照组聊天略有上升。与事实清单相比,差异并不显著。此外,Kirk 对话对政治暴力支持度也没有可测量的影响。
模型会根据已知信息灵活调整策略
为了弄清模型是如何说服人的,研究人员把它的回答拆分成单个句子进行分析。结果发现,模型会根据现有证据的不同而明显调整话术。

在特朗普遇刺未遂事件中,由于枪手的动机和背景几乎一无所知,模型使用理性说服的频率低于经典阴谋论场景。它转而承认自身认知的局限,提醒用户不要急于下结论,通过苏格拉底式提问引导用户反思自己掌握的证据,并引导他们参考可信来源。
而在信息更充分的 Kirk 遇刺案中,模型的做法更接近处理经典阴谋论时的方式,更强调阴谋论思维对社会的危害。
一次辟谣,对下次事件也有"免疫"效果
辟谣对话的影响延续到了后续事件中。第一次特朗普遇刺未遂两个月后,又有一名持枪男子在特朗普的房产处被捕。经历过辟谣对话的参与者,更不容易相信"真相只有少数权贵知晓"或"真相会被隐瞒"这类说法。

柯克遇害两周半后,密歇根州格兰德布兰克镇一座耶稣基督后期圣徒教会遭遇枪击和纵火袭击。研究团队在十一天后再次对受访者进行调研。主要分析结果显示,针对该事件未发现显著的直接影响。
一项补充分析表明,原文言中部分效应仍体现在关于教堂袭击的阴谋叙事中。这种迁移效应在一般性阴谋信念上表现得更为清晰:与模型交流过的受访者更不倾向于认同常见阴谋论。
换言之,辟谣干预起到了类似“预辟谣”的作用,使人们在面对未来虚假说法时更具免疫力。与传统预辟谣方法不同——传统方法会提前告知公众并让其接触弱化版的错误信息——这一效应是在没有任何预先准备的情况下产生的。
让人愿意与语言模型交谈仍是最大难点
作者强调,他们的研究是一项案例研究。在某些危机中该方法可能失效,也可能存在真实阴谋、辟谣反而错误的情况。他们还援引自己此前的工作,表明类似对话可能产生反向效果,反而让人更坚信阴谋叙事。对于新兴阴谋论,作者警示这可能构成滥用风险。
当然,关键在于人们首先得愿意就自己的信念与语言模型展开对话。但一旦他们愿意开口,即便只是简短交谈,也能产生可衡量的改变,即便可供反驳的证据寥寥无几。
两年前,同一团队已借助与 GPT-4 的对话,将对既有阴谋论的信念降低了约 20 个百分点,且这种效果在两个月后仍可测得,甚至对对话中从未提及的叙事也产生了影响。此次的新颖之处在于针对信息匮乏的新鲜事件进行了测试。
为何对话比事实清单更有效,此前一项涉及近 77,000 名参与者的研究已给出答案。对话中的语言模型比简短文本信息更具说服力,高出了 41% 至 52%;而决定性因素是来源可靠的断言数量,而非花哨的对话技巧。正如苏黎世大学未经授权使用 Reddit 用户开展的一项实验所示,同样的机制也可能被用来操纵人心。