评估长上下文问答系统
虽然对简短段落的问答系统进行评估相对直接,但随着文档规模增大,复杂性也随之上升,例如技术文档、小说、电影剧本以及多文档场景。尽管部分评估挑战在短上下文中也存在,但长上下文评估会进一步放大以下问题:
- 信息过载:大型文档中的无关细节会掩盖关键事实,使检索器和模型更难定位正确的答案证据。
- 位置方差:证据可能出现在文档的开头、中间或结尾,这对于有效上下文受限或容易受到“中间迷失”问题影响的模型而言是一大挑战。
- 多跳推理:正确答案往往需要整合分散在多处的多个独立证据,这对模型保持和整合远距离信息的能力提出了考验。
- 规模化幻觉:更大的上下文增加了模型因检索不佳或有效上下文有限而返回看似合理实则错误回答的风险。
- 开放式问题:针对宽泛主题或阐释性话题的查询很少有一个唯一确定的答案,尤其是在大型文档或语料库中更是如此。
在本文中,我们将探讨关键评估指标、如何构建评估数据集,以及通过人工标注和 LLM 评估器评估问答性能的方法。我们还将回顾各类基准测试,涵盖叙事故事、技术与学术文本,以及超长上下文和多文档场景。最后,我们将针对具体应用场景的长上下文问答评估提供建议。

本文主要内容概览
顺便提一下,如果你想深入了解评估方法,我的朋友 Hamel 和 Shreya 将在七月举办他们最后一期“工程师与产品经理的 AI 评估”课程。这里有 35% 折扣码。
关键评估指标
评估问答系统不能只看事实是否准确。具体来说,我们希望答案完全基于给定的文本,而不是模型自身的知识。但即使答案在事实上正确,也未必对用户有帮助。因此,要有效评估问答系统,需要从两个相互独立的维度来考量:
- 忠实性(Faithfulness):答案是否严格只依据源文档。
- 有用性(Helpfulness):回答对用户是否相关、全面、实用。
忠实性衡量答案是否严格只依赖源文档。也就是说,模型不应添加外部信息,也不能凭空编造(即幻觉)。在法律协议、金融合同、医疗和保险单据等场景中,答案必须完全基于给定文本,忠实性尤为重要。它也常被称为 groundedness,即答案必须“锚定”在原始文档上。
忠实性还包括问答系统能够适时说出“我不知道”。如果源文档里没有答案,理想的回应应该是类似“提供的文本中没有相关信息”。与这一挑战相关的有两类错误:
- 误报(False positives):系统编造了源文档中不存在的答案(即幻觉)。
- 漏报(False negatives):源文档中实际包含的信息,系统却错误地回答“没有”,原因可能是检索质量差,或是长上下文中注意力能力不足。
我们还应把忠实性和正确性区分开。一个答案按常识来看可能是正确的,但如果与文档内容相矛盾,就仍然是不忠实的。例如:与常规指南不同的患者个性化医疗建议、偏离标准定义的金融或法律协议条款,以及采用架空时间线的历史小说。用户依赖问答系统返回忠实于其特定文档的回答,而不是泛泛的常识。
对于提供引用的系统,我们还可以评估引用的准确性。这用于判断所引用的文本是否能够支撑答案。像 QASPER 这样的基准测试会明确评估模型是否为答案引用了正确的支撑证据。这种综合评估——同时考察忠实性和引用准确性——能够提供更为细粒度的整体忠实性和证据检索指标。
然而,一个忠实的答案并不总是有帮助的。 这也是我们想要评估回答有用性的原因所在。
有用性衡量的是回答是否相关、详尽且简明。 相关性指回答应直接针对用户的问题,而不跑题;综合性确保回答包含必要的细节;简明性则在综合性与简洁性之间取得平衡,确保回答精炼,不含冗余或废话。
虽然对一个复杂问题给出简短的单句回答可能忠实于原文,但如果答案需要更多细节,这样的回答就难以称得上有用。反之,过长且充斥无关细节的回答也会让用户难以从中找到核心答案。理想的回答应当以最简洁的方式呈现源文档中大部分(甚至全部)相关信息,以满足用户需求。
Xu 等人(2023)的一项研究发现,来自生物学或经济学等领域的领域专家更偏好既详尽又忠实的答案,尤其是在面对长篇幅问题时。相比之下,众包工人往往更强调表面特征,如简明性或细节。因此,如果我们构建的 Q&A 系统是面向资深用户和专家的,那么系统应专注于返回忠实且详尽的回答。
忠实与有用之间存在着张力。一个答案可以完全忠实原文,却毫无用处。例如,当我们询问法律合约时:「如果租客错过付款会怎样?」一个忠实但无用的答案可能是「租约协议第 4.2 条处理了逾期付款的情况。」虽然技术上准确,但这并不实用,因为它没有告诉我们如果错过付款实际会发生什么。同样适用于那些简单复制粘贴文档大段内容的问答系统。有用的系统应该综合信息,提供一个直接回应问题的答案。 总而言之,最好的答案通过以下方式同时实现忠实与有用: - 扎根于原文(忠实) - 直接回答用户的问题(相关) - 提供充分的细节和背景(全面) - 清晰简洁地呈现信息(简明) 构建评估数据集 评估长上下文问答始于创建稳健的评估数据集。这涉及测试问答系统如何在书籍长度的文档中导航以回答问题。 首先,我们需要创建各种现实的、特定上下文的问题。虽然人工标注者擅长设计出色的问题,但这种方法耗时且难以规模化,尤其是对于长篇文档。更有效的方法是使用语言模型起草问题,然后由标注者接受或编辑——这结合机器的速度规模与人类的判断力。 然而,仅靠语言模型扩展是不够的。我们还需要引导模型生成自然、有用的问题。因此,与其使用模糊的提示如「生成关于这一章的问题」,我们可以更具体,例如:「总结本章的主要人物,然后基于我们已读的内容,为每个人物生成一个关于其背景故事的问题。」更精确的提示帮助引导模型为我们的评估数据集生成有用的问题。这一做法借鉴了现有基准测试的方法论。NarrativeQA 刻意基于摘要而非全文来生成问题,以此鼓励考察叙事理解能力而非浅层的记忆检索。QASPER 也是出于同样的考虑:先基于学术论文的摘要生成问题,再让模型根据论文全文作答。借鉴这些基准测试的经验,我们就能构建出能有效衡量模型对长文档真实理解程度的评测数据集。
在创建问题时,我们要确保问题的多样性。涵盖多种问题类型,才能全面评估问答系统的能力,而不会偏向某一种特定类型。根据具体应用场景,评测数据集可以混合包含以下几类问题:
- 事实检索:考察基础的信息提取能力,比如“主角是谁?”“条约是什么时候签署的?”“2.1 节提到的是哪条法律条款?”这类问题虽然简单,但能确认问答系统是否能可靠地提取信息。
- 定义解释:考察模型基于文档解释特定领域内容的能力,比如“这篇论文中这个缩写是什么意思?”“解释一下第 7 章引入的魔法体系”“定义一下第 203 页讨论的经济学理论。”对技术文档来说,这一点很重要——它能确保系统在上下文中正确处理专业术语。
- 内容概括:考察系统能否抓住核心要点并连贯地总结出来,比如“总结这篇论文的主要发现”“概括到目前为止书中发生了什么”“第二部分讨论了哪些关键主题?”
- 推理归纳:考察模型超越显式事实的推理能力,即整合文档不同部分的信息,形成连贯的答案,比如“这个角色为什么会做出这样的选择?”“从这些法律条文中能推断出这个社会的什么特点?”
- 「无信息型」问题:与之前的类别不同,这类问题无法从文档中找到答案。例如「甘道夫在霍格沃茨最终战役中做了什么?」或「该租赁协议中对商标侵权的处罚是什么?」一个可靠的问答系统应该能识别出所需信息并不存在,并作出相应回应,而不是凭空捏造答案。
我们的问答评估还应该对证据在文档中的位置具有鲁棒性。为此,我们让带有证据的问题分布在文档的开头、中间和结尾,并构造需要多个章节或文档细节的多跳问题。HELMET等基准评估模型准确率如何随支撑信息的位置而变化,考察的是模型能否关注并综合整个文档的信息,而非仅依赖附近的上下文。
评估问答性能的方法
人工标注员是构建高质量基准数据集的关键。这对校准自动化评估器很有用;当有足够多的标注样本时,我们还可以训练评估分类器或奖励模型。下面以忠实度和有用性两项指标为例:
忠实度标注用于判断答案是否准确反映了源文本。理想情况下我们希望有简单的二元标签——忠实或不忠实——但实际情况远非如此简单。答案往往处于一个连续谱上。因此,遗漏了关键细节的「大部分正确」答案,应与错误地曲解次要或边缘信息的答案区别对待。
与忠实度相关的是「无信息型标注」,它检查模型是否能正确识别给定上下文中是否缺失回答问题所需的信息。目的是发现幻觉:模型不是承认信息缺口,而是编造答案。为此我们可以使用以下标签:
- 错误回答/幻觉:模型在信息缺失的情况下仍试图回答问题,即便回答听起来合理。
- 错误拒绝:模型误判信息不存在,可能是由于检索错误或对长上下文关注不足。
- 正确拒绝:模型准确识别必要信息的缺失,并恰当拒绝作答。
有益性比较由标注员判断两个忠实答案中哪个更契合用户需求。不是给出绝对评分,而是让标注员进行相对判断,回答一个直白的问题:“哪个答案更有帮助?”人们比较两个答案比给出绝对评分更容易,从而使不同标注员之间的一致性更高。在比较有益性时,标注员应考虑:
- 相关性:某个答案是否更直接、更精确地回答了问题?
- 全面性:某个答案是否包含另一个答案遗漏的关键信息?
- 简洁性:某个答案是否更简明、更易理解?
以下是一些建立可靠标注流程的实用建议:
- 制定清晰的指南:为每个类别提供示例,并说明如何处理边界情况。同时保持简洁——这有助于阅读完整指南。
- 迭代优化指南:初稿不会完美。收集标注员对模糊或困难案例的反馈,以改进指南。
- 使用资格测试任务:在分配实际任务之前,为标注员提供带有已知正确答案的练习示例。这能确保他们理解指南并能够一致地应用。
- 测量标注员间一致性:使用 Cohen's Kappa 等指标检查标注员之间的一致性。低一致性可能表明指南不清晰或存在需要进一步明确的模糊场景。
- 考虑为专业领域聘请专家标注员:一般标注任务通常可由众包人员完成,但医疗或法律等领域往往需要领域专家才能做出准确且有意义的评估。
话虽如此,人工标注虽然传统上被视为黄金标准,但在实际操作中往往难以规模化,面对长文档时尤其如此。这正是 LLM 评估器(也叫"LLM-as-Judge")能发挥作用的地方。这种方法是给模型提供明确的评判标准(也就是我们的标注指南),让它来评估 Q&A 回答的质量。
但首先,我们需要弄清楚为什么传统的自动化指标不够用。过去,语言建模领域主要依赖 BLEU、ROUGE 这类基于 n-gram 的指标,通过衡量生成回答与参考答案之间的词语重合度来打分。这类指标在机器翻译等任务上还有一定效果,但在 Q&A 这类开放式任务上,它们与人类判断的相关性很差。
例如,L-Eval 基准就指出,词语重合度指标与人类对 Q&A 回答的评判之间的相关性很低。如果正确答案用词与参考答案不同,就可能被不公正地打出低 ROUGE 分数,产生误导性的负面信号。当模型回答和参考答案长短差异明显时,这个问题尤其突出。如果不做长度归一化,词语重合度指标可能会错误地偏爱冗长平庸的回答,而不是简洁准确的回答。
这正是基于模型的评估越来越流行的原因——相比传统指标,它更可靠、更细致。我们通常先用高质量的人工标注数据集对 LLM 评估器进行校准。有了 ground truth 之后,就可以评估这个 LLM 评估器:测量它在忠实度标注上的召回率和精确率,以及它在有用性比较上与人类判断的相关性。
评估忠实度时,我们可以把回答拆解为一条条独立的断言,每条断言都可以验证真伪。这类似于 NLI-based 和 Q&A-based 摘要评估指标,以及断言生成与验证所采用的方法。把回答拆解成原子级断言,能帮助我们精确定位幻觉出现的位置。具体流程如下:
- 提取主张:以一份关于合同纠纷的回答为例:“租客违反了租约,因为他们连续三期未付款、未能维持保险覆盖,且未经同意擅自转租。”可以拆分为:
- 主张 1:租客连续三期未付款。
- 主张 2:租客未能维持必需的保险覆盖。
- 主张 3:租客未经同意擅自转租公寓。
- 核实每个主张:将每项陈述与源文档(此处为租赁协议)进行比对,确认其准确性。
- 计算忠实度:被文档支持的主张比例构成整体忠实度分数。
如 SummaC、QAFactEval 和 RefChecker 等评测所演示,这种细粒度方法提供了更高的可解释性和细致性。我们不再笼统地将整个回答判定为“忠实”或“不忠实”,而是获得对哪些具体主张存在错误的精细认识。这也允许对大体忠实但存在细微失实的回答给予部分分数。
我们还可以进一步要求模型为每个主张提供引文,从而区分两种不同的失败模式:幻觉(捏造答案)与检索失败(未能检索到相关信息)。
为评估我们设计的评价器,可将它的判断与人工标注在两个核心指标上进行对比:(i) 召回率(在所有不忠实的主张中,评价器正确标记出的比例)和 (ii) 精确率(在评价器标记为不忠实的主张中,真正不忠实的主张所占比例)。
评估有用性往往需要更细致的思路,因为通常并不存在唯一“有用”的标准答法。不同情境可能需要详略各异的回答或不同风格的解释。以下是几种可选策略:
- 基于参考答案的比较:在拥有高质量参考答案时效果较好。LLM 评价器将生成答案与这些参考答案进行比对,以评估其相关性、详尽程度和清晰度。然而,随着模型能力提升,其回答可能超越既有参考答案,使该方法随时间推移效果递减。
- 基于标准的评价通过明确定义的评分标准来评估答案。这种方法让我们可以直接复用标注指南,聚焦于相关性、全面性和简洁性等维度。
- 成对比较在迭代优化问答系统时尤为有用。通过将新生成的答案与之前已验证的答案进行对比,我们可以持续推动质量提升。该方法同样适用于 A/B 测试问答系统的不同配置。
在为 LLM 评估者校准「有帮助性」时,成对比较尤为可靠。通过将答案对同时展示给标注人员和 LLM 评估者,我们可以衡量二者的一致性——即在「哪个答案更有帮助」上达成一致的概率。Cohen’s Kappa 等相关性指标可有效量化这种一致性。例如,L-Eval 发现,经过适当校准后,GPT-4 的成对比较结果与人类偏好具有强相关性。
从现有基准测试中能学到什么
为使前面的讨论有所依托,我们来看一些长上下文问答基准测试。除了提供统一标准外,这些基准还揭示了我们在数据集构建和评价过程中可能面临的挑战。鉴于这些数据很可能已包含在模型训练数据中,我们不应仅依赖它们来评估自己的问答系统,而应创建针对具体应用场景的定制化评测数据集。
我们将介绍六类基准测试,涵盖:(i) 叙事类文档,(ii) 技术与学术文档,以及 (iii) 超长或多文档上下文。
NarrativeQA 数据集由 Kočiský 等人于 2017 年提出,旨在测试真正的叙事理解能力,而非表面模式匹配。与早期允许模型通过抽取单句来回答的数据集不同,NarrativeQA 要求模型综合小说和电影剧本中分散的信息来生成答案。
首先,作者从 Project Gutenberg 和电影剧本网站收集了 1,500 多个故事,并从 Wikipedia 获取对应的情节梗概。标注者只根据这些梗概生成问答对,不阅读全文(反之,模型则是基于全文而非梗概来回答问题)。这种刻意的设计确保答案无法通过简单的文本匹配找到,从而把评估重点放在对整篇文本的理解上。最终的数据集包含 46,765 个专注于叙事理解的问答对。

NarrativeQA 数据集的统计信息
NarrativeQA 评估模型能否整合散布在整本书籍或整部电影等长叙事中的信息,生成连贯的答案。答案采用 BLEU、METEOR、ROUGE 等 n-gram 匹配指标评估,将机器生成的答案与每个问题的两条参考答案进行对比。
NarrativeQA 的意义在于强调问题不能只靠简单抽取来回答,而需要模型跨文档整合信息。由于问题是基于梗概而非全文生成的,这些问题要求对文本有整体理解,从而减少了肤浅的抽取式答题策略。
NovelQA 由 Wang 等人于 2024 年提出,是一个用于评估超长文本阅读理解的基准,文本长度通常超过 200,000 个 token。它与 NarrativeQA 类似但更贴近当下,评估模型理解和整合整部小说叙事的能力。模型以两种形式进行评估:多选题和开放式生成。

NovelQA 中的两种回答类型
在构建数据集时,作者精选了 89 部多样的英文小说,并与熟悉这些作品的英语文学专业学生紧密合作。标注者分两个阶段创建了 2,305 个问题。第一阶段,标注者使用问题模板,填入小说中的实体来生成有效的问题(模板如下)。

NovelQA 中用于生成问题的模板
随后,为提升问题的多样性,标注人员还自由生成了具有挑战性的问题。所有问题均由作者审核,最终采纳了 79.4% 的问题。每个问题均附有标准答案及来自小说的相关支持性证据,以支撑评估。
NovelQA 评估模型在极长上下文中综合、整合和回忆详细信息的能力。问题分为以下几类:
- 细节导向型(22.2%):聚焦需要仔细回忆的细微之处。
- 单跳型(42.8%):可从相邻句子或紧密相关的段落中作答。
- 多跳型(35%):需跨多个章节综合信息。
问题涵盖各类叙事要素,如角色、情节、背景设定及深层主题意义。该基准测试支持多项选择题和开放式生成式评估方法,其中 GPT-4 作为生成式答案的评估者(与人类判断的一致性 Cohen’s Kappa 为 89.25%)。

NovelQA 按复杂度与维度的数据分布
NovelQA 的研究结果颠覆了典型的“迷失在中间”现象——它表明,当证据出现在 10 万 token 之后时,模型性能会下降。作者还强调了严格质量控制的重要性,对所有众包生成的问题进行人工审核,仅采纳 79.4% 的问题-答案对。此外,将每个答案与具体支持性证据明确关联,有助于提升检索类评估的效果。

当证据位于 10 万 token 之后时,模型性能下降
虽然叙事文本带来一类挑战,但理解密集的技术文档则引入了完全不同的难点。
QASPER 由 Dasigi 等人(2021)推出,通过让模型回答学术论文中的信息检索类问题来解决这一挑战。具体来说,QASPER 包含 5,049 个问题,覆盖 1,585 篇 NLP 论文。与 NarrativeQA 类似,这些问题由只读过论文标题和摘要的 NLP 从业者设计。这种方法确保问题通常需要综合全文信息,而非简单的文本提取。

QASPER 中的示例问题、答案及支撑证据
首先,25 名 NLP 从业者挑选了他们感兴趣的论文,仅根据标题和摘要创建问题。然后,另一组 51 名 NLP 专家使用全文回答了这些问题。后一组的任务包括判断问题是否可回答、定位具体的支撑证据(如文本段落、图表或表格),并提供清晰简洁的答案。(10% 的问题被标记为不可回答,因此被排除。)将问题生成与答案标注分离,减少了偏差,因为问题作者对详细答案没有任何先验知识。
QASPER 主要从两个方面评估模型:答案准确性(Answer-F1)和证据选择(Evidence-F1)。Answer-F1 衡量模型回答的准确性,无论其是直接提取文本还是生成新的解释。Evidence-F1 评估模型识别支撑细节的能力。这尤其具有挑战性,因为超过一半的问题需要综合多个章节或段落的证据。
QASPER 中的 Evidence-F1 结果凸显了答案生成与证据检索之间的显著差距——即使模型给出了准确的答案,它们往往也难以识别确切的支撑段落。此外,限制问题创作者只能使用标题和摘要,自然催生了对整篇论文有深入理解的问题和答案,超越了浅层的文本提取。
An et al. (2023) 提出的 L-Eval 覆盖了 3,000 到 200,000 token 的文档,包含 20 个多样化子任务、508 篇长文档,以及超过 2,000 条人工标注的问答对。与以往主要依赖文本匹配指标的基准不同,L-Eval 还引入了 LLM 评估器,并测量了两者之间的差异。
构建 L-Eval 时,作者首先创建了四个新数据集:Coursera(教育内容)、SFiction(科幻故事)、CodeU(Python 代码库)和 LongFQA(财务业绩)。他们还改进了五个现有数据集,增加了更具挑战性的综合类问题,比如扩展 QuALITY,要求对整篇文档有更深入的理解。最后,他们审查并修正了来自以往基准的 12 个任务,借助 Claude-100k 识别并剔除不准确或无法回答的问题。

L-Eval 中数据集、问题类型和领域的统计信息
L-Eval 评估两类任务:封闭式任务(如选择题、代码理解、判断题和数学题),侧重精确推理;开放式任务(如叙事综合和摘要),侧重整合和总结长篇内容。
封闭式任务采用精确匹配准确率评估,开放式任务则由人工标注者按 1(差)到 5(优)打分。此外,L-Eval 还使用 GPT-4 和 GPT-3.5 等语言模型,通过两两比较来评估开放式任务,并精心设计了 prompt 以减少对冗长答案的偏好。出于效率考虑,也使用了 ROUGE-L 和 F1 等传统 n-gram 指标,尽管它们对回答长度较为敏感。
L-Eval 的结果表明,由于答案长度不匹配,传统 n-gram 指标在长上下文场景中往往无法反映真实的理解能力。此外,该基准还证明了用 LLM 做两两比较的评估方式比传统指标与人工评估的一致性更高,并清晰揭示了不同模型在封闭式与开放式任务上的强弱差异。
HELMET(How to Evaluate Long-context Models Effectively and Thoroughly,即高效彻底评估长上下文模型)由 Yen 等人(2025) 提出,旨在解决早期基准测试中存在的任务不切实际、指标不一致等问题,为长上下文语言模型的评估提供了一套框架。
研究伊始,作者指出现有评估的不足,包括上下文长度有限、方法不可靠,以及对未经指令微调的模型覆盖不足。随后,他们构建了一个包含七类任务的基准:检索增强生成(RAG)、带引用的生成、段落重排序、少样本上下文学习(many-shot in-context learning)、长文档问答、摘要以及合成回忆。每类任务均提供最长可达 128,000 token 的上下文,并结合精心设计的 few-shot 提示与基于模型的评估指标,实现可控且一致的评测。

HELMET 中的任务类别、数据集与评估指标
HELMET 重点评估长上下文模型的以下能力:
- 检索与推理:Natural Questions、TriviaQA 和 HotpotQA 用于检验模型在包含干扰项的大量上下文中检索相关信息的能力。
- 指令遵循:要求提供引用的生成任务用于评估模型在保持准确性的同时遵循精确格式规范的能力。
- 比较推理:段落重排序任务用于评估模型跨多个文本段落进行比较与推理的能力。
- 上下文学习:Many-shot 任务用于衡量模型快速适应并从上文提供的多个示例中学习的能力。
- 长篇理解:长文档问答与摘要任务用于评估模型对大量文本进行综合理解的能力。
HELMET 表明,诸如 Needle In a Haystack 之类的合成任务由于与现实场景的相关性较弱,实际价值有限。此外,通过精确控制输入长度,HELMET 能够评估模型在面对逼近此前模型上限(≥128K token)的超长上下文时的鲁棒性。与早期基准类似,HELMET 也复现了 ROUGE 等传统 n-gram 指标在长输出中可能扭曲质量评估的问题。为此,HELMET 推荐使用 GPT-4o 等模型进行基于模型的评估,以更贴合人类判断。

NIAH、Ruler、InfinityBench 与 HELMET 的基准结果对比
Loong 由 Wang 等人(2024) 提出,是一项针对多篇文档的长上下文理解评估基准。与大多数聚焦单文档场景的早期基准不同,Loong 设计了贴近现实的 multi-document 任务:只要遗漏任何一份相关文档,答案即判定为错误。

Loong 聚焦于多文档 Q&A
Loong 包含 1,600 个评测样本,主要来自 2024 年的英文与中文财务报告、法律案例及学术论文。每个任务中的证据分散在多篇文档中,以模拟真实世界的复杂性。在问题生成方面,作者采用了两种方式:基于模板的生成(通过预定义规则构建 Q&A 对)和自由标注(提示 GPT-4o 生成额外的 Q&A 对)。
Loong 评估模型在多篇文档(通常涵盖 10,000 至超过 250,000 token)间定位、比较、聚类和推理证据的能力。该基准覆盖四类任务:
- Spotlight:在多个文档中找出来自特定单篇文档的相关证据。
- Comparison:比较并整合来自不同文档的多条信息,给出正确答案。
- Clustering:按特定标准聚合与分组来自多个来源的相关信息。
- Chain of Reasoning:跨文档整合证据以推导答案。

Loong 的四项评估任务
评估时使用 GPT-4 作为 LLM 评审,参照标准答案和任务要求,从准确性、幻觉程度和完整性三方面为模型输出打分。指标包括两个:平均分(所有问题的平均评分)和满分率(获得满分的问题占比)。
有趣的是,他们分析发现,使用检索增强生成(RAG)反而在 Loong 基准上降低了性能。他们推测这是因为 Loong 的证据分散在多个文档中。RAG 对聚光任务有一定帮助,但在需要深度综合的任务上表现不佳,比如比较、聚类和多步推理。

与基线相比,使用 RAG 会让性能下降
下面是一些可能对你有帮助的其他长上下文基准:
- A Critical Evaluation of Evaluations for Long-form Question Answering
- Ada-LEval: Evaluating long-context LLMs with length-adaptable benchmarks
- BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
- BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models
- BizBench: A Quantitative Reasoning Benchmark for Business and Finance
- ELI5: Long Form Question Answering
- Frustratingly Hard Evidence Retrieval for QA Over Books
- InfinityBench: Extending Long Context Evaluation Beyond 100K Tokens
- LFED: A Literary Fiction Evaluation Dataset for Large Language Models
- LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
- LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-Context Multitasks
- LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
- MultiDoc2Dial: Modeling Dialogues Grounded in Multiple Documents
- QuALITY: Question Answering with Long Input Texts, Yes!
• • •
呼,内容不少!以下是几个核心要点:
- 忠实性与有用性是正交维度。一个答案可以忠实但无用,也可以有用但包含幻觉信息。
- 忠实性也意味着知道何时该说“我不知道”。当上下文缺乏信息时,模型应拒绝回答;当有足够信息时,则应正确作答。
- 传统 n-gram 指标在问答任务上表现不佳。建议使用 LLM 评估器,它们在语义质量评估上更优,且与人类判断更一致。
- 证据的位置很重要。在讨论的各基准中,部分模型受“中间丢失”(lost in the middle)效应影响较大,另一些则在证据超出 10 万 token 后表现明显下降。
- 使用 RAG 可能反而降低性能,尤其是那些需要跨单一或多文档分散证据进行连贯推理的任务。
我是否有遗漏重要内容?或者你有其他想推荐的指标、方法或基准吗?欢迎通过 留言告知!
顺便一提,如果你还想深入了解评估(evals),我的好友 Hamel 和 Shreya 将于七月举办其“AI Evals for Engineers and PMs”课程的最后一期。这里有一张 85 折优惠码。
References
An, Chenxin, Shansan Gong, Ming Zhong, Xingjian Zhao, Mukai Li, Jun Zhang, Lingpeng Kong, and Xipeng Qiu. 2023. “L-Eval: Instituting Standardized Evaluation for Long Context Language Models.” arXiv. https://doi.org/10.48550/arXiv.2307.11088.
Bai, Yushi, Xin Lv, Jiajie Zhang, Hongchang Lyu, Jiankai Tang, Zhidian Huang, Zhengxiao Du, et al. 2024. “LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding.” arXiv. https://doi.org/10.48550/arXiv.2308.14508.
Bai, Yushi、Shangqing Tu、Jiajie Zhang、Hao Peng、Xiaozhi Wang、Xin Lv、Shulin Cao 等。2025。「LongBench v2:面向真实长上下文多任务的深度理解与推理。」arXiv。https://doi.org/10.48550/arXiv.2412.15204。
Dasigi, Pradeep、Kyle Lo、Iz Beltagy、Arman Cohan、Noah A. Smith、Matt Gardner。2021。「基于研究论文的问答数据集。」arXiv。https://doi.org/10.48550/arXiv.2105.03011。
Dong, Zican、Tianyi Tang、Junyi Li、Wayne Xin Zhao、Ji-Rong Wen。2024。「BAMBOO:评估大语言模型长文本建模能力的综合基准。」arXiv。https://doi.org/10.48550/arXiv.2309.13345。
Fabbri, Alexander、Chien-Sheng Wu、Wenhao Liu、Caiming Xiong。2022。「QAFactEval:基于问答的摘要事实一致性改进评估。」计算语言学北美协会自然语言处理会议论文集(2022)。Seattle:Association for Computational Linguistics。https://doi.org/10.18653/v1/2022.naacl-main.187。
Fan, Angela、Yacine Jernite、Ethan Perez、David Grangier、Jason Weston、Michael Auli。2019。「ELI5:长文本回答。」arXiv。https://doi.org/10.48550/arXiv.1907.09190。
Feng, Song、Siva Sankalp Patel、Hui Wan、Sachindra Joshi。2021。「MultiDoc2Dial:多文档对话建模。」2021年自然语言处理经验方法会议论文集,6162–76。https://doi.org/10.18653/v1/2021.emnlp-main.498。
Hu, Xiangkun、Dongyu Ru、Lin Qiu、Qipeng Guo、Tianhang Zhang、Yang Xu、Yun Luo、Pengfei Liu、Yue Zhang、Zheng Zhang。2024。「RefChecker:基于参考的细粒度幻觉检查器与大模型基准。」arXiv。https://doi.org/10.48550/arXiv.2405.14486。
Kočiský, Tomáš、Jonathan Schwarz、Phil Blunsom、Chris Dyer、Karl Moritz Hermann、Gábor Melis、Edward Grefenstette。2017。「NarrativeQA阅读理解挑战。」arXiv。https://doi.org/10.48550/arXiv.1712.07040。
Koncel-Kedziorski, Rik、Michael Krumdick、Viet Lai、Varshini Reddy、Charles Lovering、Chris Tanner。2024。「BizBench:商业与金融领域的量化推理基准。」arXiv。https://doi.org/10.48550/arXiv.2311.06602。
Kuratov, Yuri, Aydar Bulatov, Petr Anokhin, Ivan Rodkin, Dmitry Sorokin, Artyom Sorokin 和 Mikhail Burtsev。2024 年。《BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack》。arXiv。https://doi.org/10.48550/arXiv.2406.10149。
Laban, Philippe, Tobias Schnabel, Paul N. Bennett 和 Marti A. Hearst。2021 年。《SummaC: Re-Visiting NLI-Based Models for Inconsistency Detection in Summarization》。arXiv。https://doi.org/10.48550/arXiv.2111.09525。
Ling, Zhan, Kang Liu, Kai Yan, Yifan Yang, Weijian Lin, Ting-Han Fan, Lingfeng Shen, Zhengyin Du 和 Jiecao Chen。2025 年。《LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion》。arXiv。https://doi.org/10.48550/arXiv.2501.15089。
Mou, Xiangyang, Mo Yu, Bingsheng Yao, Chenghao Yang, Xiaoxiao Guo, Saloni Potdar 和 Hui Su。2020 年。《Frustratingly Hard Evidence Retrieval for QA Over Books》。arXiv。https://doi.org/10.48550/arXiv.2007.09878。
Pang, Richard Yuanzhe, Alicia Parrish, Nitish Joshi, Nikita Nangia, Jason Phang, Angelica Chen, Vishakh Padmakumar 等。2022 年。《QuALITY: Question Answering with Long Input Texts, Yes!》。arXiv。https://doi.org/10.48550/arXiv.2112.08608。
Wang, Chonghua, Haodong Duan, Songyang Zhang, Dahua Lin 和 Kai Chen。2024 年。《Ada-LEval: Evaluating Long-Context LLMs with Length-Adaptable Benchmarks》。arXiv。https://doi.org/10.48550/arXiv.2404.06480。
Wang, Cunxiang, Ruoxi Ning, Boqi Pan, Tonghui Wu, Qipeng Guo, Cheng Deng, Guangsheng Bao 等。2024 年。《NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens》。arXiv。https://doi.org/10.48550/arXiv.2403.12766。
Wang, Minzheng, Longze Chen, Cheng Fu, Shengyi Liao, Xinghua Zhang, Bingli Wu, Haiyang Yu 等。2024 年。《Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA》。arXiv。https://doi.org/10.48550/arXiv.2406.17419。
Xu, Fangyuan, Yixiao Song, Mohit Iyyer 和 Eunsol Choi。2023 年。《A Critical Evaluation of Evaluations for Long-Form Question Answering》。arXiv。https://doi.org/10.48550/arXiv.2305.18201。
Yen, Howard, Tianyu Gao, Minmin Hou, Ke Ding, Daniel Fleischer, Peter Izsak, Moshe Wasserblat 和 Danqi Chen。2025 年。《HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly》。arXiv。https://doi.org/10.48550/arXiv.2410.02694。
Yu, Linhao, Qun Liu, Deyi Xiong. 2024. “LFED: A Literary Fiction Evaluation Dataset for Large Language Models.” arXiv. https://doi.org/10.48550/arXiv.2405.10166.
Zhang, Xinrong, Yingfa Chen, Shengding Hu, Zihang Xu, Junhao Chen, Moo Khai Hao, Xu Han 等. 2024. “InfinityBench: Extending Long Context Evaluation Beyond 100K Tokens.” arXiv. https://doi.org/10.48550/arXiv.2402.13718.
如果觉得这篇文章有用,请按以下方式引用:
Yan, Ziyou. (2025年6月). Evaluating Long-Context Question & Answer Systems. eugeneyan.com. https://eugeneyan.com/writing/qa-evals/.
或者
@article{yan2025qa,
title = {Evaluating Long-Context Question & Answer Systems},
author = {Yan, Ziyou},
journal = {eugeneyan.com},
year = {2025},
month = {Jun},
url = {https://eugeneyan.com/writing/qa-evals/}
}