← 文章 / AI技术
开智学堂 1小时前 · 2026-09-08 08:05:07 · 3 阅读

AI大模型也有元认知错觉吗?

开智学堂 · AI 时代的元学教育

小编的话:让 AI 把同一道题连答二十来遍,答案散得厉害;可它嘴上,仍是「几乎可以肯定」。它到底是不知道自己不知道,还是心里有数、嘴上不说?耶鲁和谷歌的新研究,正面测了这件事。答案有点出人意料:它的毛病,和人类的错觉不完全是一回事。

你问 AI 一个冷门问题,它答得斩钉截铁。换个方式再问,答案变了,口气照旧笃定。

人能监测和评估自己的认知——这道题有几分把握,这件事是真懂还是只是眼熟。心理学管这种能力叫元认知,术语出自发展心理学家弗拉维尔(John Flavell)1970 年代的工作。但这套自我监测并不总是可靠:过度自信,自以为知道、其实不知道,这类系统性的自我误判,就是元认知错觉。

那么,AI 大模型也有元认知错觉吗?它信誓旦旦地胡说的时候,是不是同一回事:不知道自己不知道?

2026 年 6 月 30 日,耶鲁大学与 Google Research 的研究者在预印本网站 arXiv 发表了一篇论文(预印本,即还没经过同行评审、也就是发表前由同领域研究者匿名挑错把关那道程序的公开稿),标题可以直译为《带元认知反馈的强化学习,让大语言模型忠实表达不确定性》。它重点测的,是大模型的元认知错觉里的一种:说出来的把握,是不是它真实的把握。论文管这件事叫忠实校准

RLMF 论文首页:标题、作者与摘要

论文首页(标题、作者与摘要)。来源:arXiv:2606.32032

两种校准

元认知用在模型身上,问的是:它对「自己答得怎么样」心里有没有数。这篇论文怎么测「心里」?让模型对同一道题独立连答 21 遍(术语叫采样),拿其中一遍当正式回答,再用另一个模型逐句核对这句话和其余 20 遍的说法对不对得上,看它答得稳不稳;答没答对,这一步不看。各遍说法一致,就算它对这句话把握高;答案散得厉害,把握就低。这个一致程度,论文用来估计内在置信度。它是用采样算出来的代理值,不是打开模型脑子直接读出来的。

论文附录里有个直观的例子。问 Llama3.1-8B:约瑟夫·厄本(Joseph Urban)出生在哪座城市?它的正式回答是「Zara, Austria-Hungary」,自报置信度 0.98。可再让它独立答 20 遍,答案散成一片:维也纳、布达佩斯、卢布尔雅那、的里雅斯特……按采样一致性估算,内在置信度只有 0.15。正确答案是维也纳。而那一串互相矛盾的回答里,多数措辞照样斩钉截铁。

有了这个数,接下来的区分才成立。「校准」原本说的是:一个系统报出的把握,与实际对错对不对得上:说九成把握的那些题,是不是十道真答对九道?这是老问题,论文叫它事实校准。而这篇要研究的是另一件事:模型嘴上报出的把握,与它内在置信度对不对得上?论文叫忠实校准

两者可以脱节:一个模型可以把事实校准做得不错,嘴上报的数,却对不上采样测出的那份把握:答案散成一片,措辞仍是「几乎可以肯定」。此前一年,同一团队的约纳(Gal Yona)等人在计算语言学会议 EMNLP 上测过这件事:在他们测试的模型和任务里,模型的措辞普遍比采样一致性所反映的把握更果断。

两种校准:同一句「我有九成把握」,可以对准答对率,也可以对准心里的把握

两种校准的区别,论文研究的是右边那条

到这里,标题的问题有了前半个答案。模型的毛病,不全是人类那种「自以为知道」的错觉:多次采样已经暴露了不稳定,措辞却没有跟着变。至于这算不算「心里有数」,论文没有证明。它测到的,是表达和采样表现之间的错位。对这个错位,至少有两种解释:模型内部本没有稳定的把握,或者稳定的信号存在、只是措辞没有跟上。多次采样的一致性只能提示后一种信号可能存在;要真正区分两者,还得检验不同的测量办法能否在新任务上稳定预测模型何时出错;论文没有走到这一步。

RLMF 训练法

怎么改?论文的办法叫 RLMF,带元认知反馈的强化学习。强化学习是一种训练法:让模型对一道题生成多个回答,给好回答加分、坏回答减分,模型朝着得分高的方向调整。传统做法里,「好」主要指答得对;RLMF 在这之外加了一条:模型顺带给自己的表现打个分;这个自评要和采样测出的对照值比过之后,才折算成奖励:打得准,奖励更多;打得离谱,奖励更少。它把「对自己表现的判断准不准」也变成了得分项。

训练数据怎么选,也用上了模型的自评:让模型给自己在每条训练样本上的忠实校准表现打分,专选它自认最好与最差的两端去训练。在 Llama3.1-8B 上,这样选出来的数据,训出的忠实校准平均分是 0.84(满分 1),高于随机选的 0.80,也高于主动学习式选法(专选模型答得差的题)的 0.79。选法也有模型差异:换到 Qwen3-8B 上,另一种基于多次采样的选法更好。

论文的忠实校准指标叫 cMFG*(0 到 1,越高越忠实),在 10 个基准测试上取平均,主结果都在下图。基准测试即公开的标准题库,供不同模型在同一套题上比较。

两款 8B 模型训练前后的忠实校准得分,虚线为未训练的前沿模型参照

数据出自论文 Table 1;此指标只量「说的与心里的对不对得上」,不量答对率

训练后的模型说话变成了什么样?附录的对照里,被问到某部电影的制片人时,它会答:「制片人是 Sophia Lin,不过我对这个答案不太有把握」,或者「我的最佳猜测是 Magnolia Pictures,但很可能错」。低把握不再藏在笃定句式的后面。更要紧的是代价问题:这种「学会示弱」没有拿答对率去换。十个基准平均,Llama3.1-8B 的事实准确率从 0.31 升到 0.41,Qwen3-8B 从 0.55 到 0.57,都没有下降(这是平均值,不保证每个基准都如此)。

这条路也有暗坑。作者报告了训练里的失败模式:若直接把元认知得分当奖励,模型会钻空子,恒报很低的自评、同时把句子置信度报歪,制造「元认知良好」的假象;奖励设计稍有不慎,「诚实」也能被表演出来。

Qwen3-8B 出厂 0.54;用只奖励答对的标准强化学习训练,反倒跌到 0.51;换 RLMF,升到 0.83。摘要里「相对标准强化学习至多提高 63%」,指的就是这一格。Llama3.1-8B 从 0.60 到 0.84。相对论文采用的强提示词基线 MetaFaith,平均忠实校准得分提高 29%。

第二阶段是把数字翻译成话。校准好的置信度分数,按一张「数值到措辞」的映射表改写进回答:九成把握说「几乎可以肯定」,一半把握说「可能」。这张表汇总了既有的人类感知标注,取每个概率词的平均感知值。三名专家标注者在 120 个实例上,把这样改写出的回答与论文采用的微调(在现成模型上继续训练)基线 FUT 对比,在多样性、自然度、有用性、语境适配四项上,胜率 95% 到 98%。

数值置信度到中文措辞的映射示意

第二阶段示意;区间举例出自论文 Figure 1,中文为意译

心理学的旧问题

论文给元认知下定义,引的是一篇认知神经科学论文:弗莱明(Stephen Fleming)与 Hakwan Lau 2014 年的《如何测量元认知》。它要回答的问题,心理学早就问过。而且人类这边的证据提示,问题其实有三层:系统能否察觉自己的不确定(监测),能否把它准确说出来(表达),听的人又能否按原意理解(被理解)。下面的旧研究,恰好各占一层。

1965 年,心理学家哈特(James Hart)做过一个如今看来眼熟的实验:让人回答常识题,答不出来的,先请他判断「我是不是其实知道,只是想不起来」,再给他做选择题。结果,那些「感觉自己知道」的题,后来认出正确答案的比例确实更高。这叫「知晓感」研究:那份「感觉自己知道」不是空穴来风,它预测得比瞎猜好,但也只是比瞎猜好,不是精确的读数。

可即便有这点信号,报出来的数也常常走样。利希滕斯坦(Sarah Lichtenstein)与菲施霍夫(Baruch Fischhoff)1977 年让人给常识题的答案标把握,发现在这批任务里,难题上人们普遍把握报高了,极容易的题上反而报低——所谓难易效应。后续研究提醒,这个效应的大小受题目抽样和统计方法影响,不是无条件的人类定律。

斯蒂芬·弗莱明,伦敦大学学院认知神经科学教授

斯蒂芬·弗莱明(Stephen Fleming),伦敦大学学院认知神经科学教授。图源:其实验室官网 metacoglab.org

弗莱明与 Lau 的那篇《如何测量元认知》,把「有没有数」分成了几件不同的事:一个人平均报多自信,是偏差;他的自信能不能区分自己哪次对哪次错(答错时心里是否也跟着发虚),是敏感度;报出来的数与实际对错的对应,才是校准。三者可以分离。一个人可以习惯性说得满,同时对自己何时出错很敏锐。这套区分,给「事实校准之外还有忠实校准」提供了心理学参照。

概率词这一支,积累得尤其细。1964 年,中情局分析师肯特(Sherman Kent)在内部刊物《情报研究》上抱怨:情报报告里「serious possibility」这样的词,不同读者读出的概率天差地别。后来的情报分析教材《情报分析心理学》(作者 Richards Heuer)转述过巴克利(Scott Barclay)等人 1977 年的调查:一批北约军官给同一批概率短语标数值,范围散得惊人。心理学家沃尔斯滕(Thomas Wallsten)与布德斯库(David Budescu)1986 年把这件事做成了正式测量:概率词在人群里有大致稳定的排序,但每个词对应的是一段模糊的分布,个体之间差异不小。论文第二阶段的数值—措辞映射,用的也是同类的人类感知标注:近年的众包调查与实验数据。

人的误读

模型报把握,读的人是谁?认知科学家斯泰弗斯(Mark Steyvers)团队 2025 年发表在《自然·机器智能》的实验发现:在他们测试的任务里,人从大模型的解释文字中读出的把握,高于研究者估计的模型正确概率;更长的解释伴随更高的信任,哪怕答案并没有因此更准。把模型估计的不确定性明确写进解释后,人的判断有所改善。不忠实的措辞,直接影响屏幕前的人信多少。

马克·斯泰弗斯,加州大学欧文分校认知科学系教授

马克·斯泰弗斯(Mark Steyvers),加州大学欧文分校认知科学系教授。图源:其个人主页 steyvers.socsci.uci.edu

斯泰弗斯与彼得斯(Megan Peters)同年在《心理科学最新动向》上把话说得更直接:在人机协作里,光有高准确率不够,系统还得能监测并用人听得懂的方式交流「我这次可能错」。忠实校准要解决的,就是其中一个环节。

证据的边界

不过,这些数字各自只回答一个很窄的问题。

被训练的是 Qwen3(1.7B 到 8B)与 Llama3.1-8B 这些开放权重(参数公开可下载)的小模型。GPT-5 与 Gemini 是参照组:它们配了同类元认知提示词、但没有接受 RLMF 训练。只在 cMFG* 这一个论文新提的指标上,8B 模型的 0.83、0.84 才高过 GPT-5 的 0.61 与 Gemini-3.1-Pro 的 0.70;答对率上 GPT-5 是 0.69、Gemini-3.1-Pro 是 0.78,仍明显高于 Qwen3-8B 的 0.57 与 Llama3.1-8B 的 0.41。

忠实,不等于答得对。

「元认知错觉」是本文借用的心理学说法,论文自己的用词是忠实校准。「内在置信度」全程是采样一致性的代理值。它衡量模型答案稳不稳,与模型内部某处是否存着一个「真实信念」,是两个问题。人评规模小,而且只对着一个基线比。作者自己在脚注里写明:自我评估的改善,不等于获得广义的元认知,后者还包括许多别的能力。这篇也还是预印本,同行评审在后头;截至发稿,公开的引用与讨论都还不多。

对普通读者,这项研究的用处可以收成一句:把 AI 的语气当表达,不当证据。至少在这批被测的模型上,「几乎可以肯定」未必对得上它采样时的表现;重要的事,可以让它对同一个问题独立多答几遍,把答案稳不稳当作一条辅助线索——稳和对是两回事,最后仍要核原始来源。

顺带一提,偏差与敏感度的区分对人同样适用:你习惯报出多大的把握,和你能不能分清自己何时对、何时错,是分开测量的两个维度。你平时练的,是哪一个?■

参考文献

  • Liu, G. K.-M., Caciularu, A., Yona, G., Szpektor, I., & Cohan, A. (2026). Reinforcement learning with metacognitive feedback elicits faithful uncertainty expression in LLMs. arXiv:2606.32032.
  • Yona, G., Aharoni, R., & Geva, M. (2024). Can large language models faithfully express their intrinsic uncertainty in words? In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (pp. 7752–7764). https://doi.org/10.18653/v1/2024.emnlp-main.443
  • Flavell, J. H. (1979). Metacognition and cognitive monitoring: A new area of cognitive–developmental inquiry. American Psychologist, 34(10), 906–911. https://doi.org/10.1037/0003-066X.34.10.906
  • Hart, J. T. (1965). Memory and the feeling-of-knowing experience. Journal of Educational Psychology, 56(4), 208–216. https://doi.org/10.1037/h0022263
  • Fleming, S. M., & Lau, H. C. (2014). How to measure metacognition. Frontiers in Human Neuroscience, 8, 443. https://doi.org/10.3389/fnhum.2014.00443
  • Lichtenstein, S., & Fischhoff, B. (1977). Do those who know more also know more about how much they know? Organizational Behavior and Human Performance, 20(2), 159–183. https://doi.org/10.1016/0030-5073(77)90001-0
  • Wallsten, T. S., Budescu, D. V., Rapoport, A., Zwick, R., & Forsyth, B. (1986). Measuring the vague meanings of probability terms. Journal of Experimental Psychology: General, 115(4), 348–365. https://doi.org/10.1037/0096-3445.115.4.348
  • Kent, S. (1964). Words of estimative probability. Studies in Intelligence, 8(4), 49–65.
  • Heuer, R. J., Jr. (1999). Psychology of intelligence analysis. Center for the Study of Intelligence, Central Intelligence Agency.
  • Steyvers, M., Tejeda, H., Kumar, A., Belem, C., Karny, S., Hu, X., Mayer, L. W., & Smyth, P. (2025). What large language models know and what people think they know. Nature Machine Intelligence, 7(2), 221–231. https://doi.org/10.1038/s42256-024-00976-7
  • Steyvers, M., & Peters, M. A. K. (2025). Metacognition and uncertainty communication in humans and large language models. Current Directions in Psychological Science. https://doi.org/10.1177/09637214251391158
  • Liu, G. K.-M., Yona, G., Caciularu, A., Szpektor, I., Rudner, T. G. J., & Cohan, A. (2025). MetaFaith: Faithful natural language uncertainty expression in LLMs. In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (pp. 29612–29656). https://doi.org/10.18653/v1/2025.emnlp-main.1505

开智时刻

你被 AI 的「几乎可以肯定」误导过吗?那一次,它其实该说哪个词?


点击「阅读原文」,了解开智更多。

原始来源: 开智学堂

评论 (0)