Allen AI 开源 AstaBrief:科研报告快速生成模型
语言模型已经能帮研究人员检索文献、综合证据、分析复杂问题。但科研工作对这些模型有特殊的要求:答案必须有证据支撑,模型要忠实呈现证据实际支持的内容,而不是悄悄扩大研究的结论范围,而且研究人员要能验证最终的输出结果。
从科学家使用 Asta(我们面向科研工作的 agentic 平台)的方式就能看出这一点。用户往往不是简单地输入关键词,而是带着大量上下文和诸多限制条件前来——比如让 Asta 对比一批文献中的方法,同时兼顾特定的方法、人群或研究场景。很多用户之后还会回头查看生成的报告,把它们当作持续使用的研究材料,而不是一次性的答案。
我们希望帮助科学家更快地生成带引用的报告,而且用的是可以自行下载、自行部署的模型。为此,我们验证了一个问题:一个专为科学报告生成训练的小型开源模型,能否在缩短生成时间、降低服务成本的同时,达到我们目前在用的专有模型的报告质量。
于是我们构建了 AstaBrief 8B,它能将研究问题和检索到的文献片段转化为一篇带引用的报告。AstaBrief 已上线 Asta 的“Generate a report”功能,作为 Fast mode 与基于 Claude 的 Thinking mode 并列提供。我们同时也开源了模型和训练数据,方便其他人研究、复现我们的方法,并在此基础上继续开发。
开发 AstaBrief 耗费了数万个真实研究查询、以引用为核心的过滤数据、偏好数据,以及一次重新设计的报告生成流程——它将完整报告一次性写出,而非逐段生成。结果是,与我们所追踪的专有模型相比,报告生成时间缩短了将近一个数量级。在完整的 Asta 流程中,Fast 模式每份报告平均耗时 51.1 秒,而 Thinking 模式为 178.5 秒,前者速度约为后者的 3.5 倍。 这些效率上的提升也让 AstaBrief 成为一个很好的试点案例,用于探索更宏观的目标:构建可适配科学研究特定需求的开放语言模型。 开放权重还将让各机构能够在自己的基础设施上运行 AstaBrief,这在研究涉及敏感或未发表工作时十分必要。除了模型权重,我们还发布了一套示例工作流,研究人员可据此调整并基于自己的 PDF 生成报告,为本地化报告生成提供了起点。 本文介绍了我们如何训练 AstaBrief,我们在基于科学证据进行锚定时学到了什么,以及我们认为哪些方法论可以延续到未来的科学模型中。文中所述的大多数训练和评估工作已在 2025 年完成,因此用于生成训练数据和作为对比基准的专有模型反映的是当时的前沿水平。我们并未用如今的前沿模型重新运行完整评估;下方的结果应理解为对我们所测试的特定训练和系统设计选择的证据。模型训练
我们的目标是打造一个开放权重模型,使其具备长篇科学综述最关键的几项特质:回答质量、相关性、结构以及引用支撑。我们从 Qwen3-8B 出发,将大部分精力集中在后期训练数据、评估以及围绕报告生成的辅助框架上。将通用模型适配于科学研究,以及从头训练新的科学模型,是我们在 Ai2 广泛探索的方向。通过 NSF OMAI——一项由 Ai2 领导、旨在为科学发现构建全开放 AI 基础设施和模型的美式国家计划——我们的研究人员正直接对接科学界,了解未来开放模型的需求,以及当前通用模型存在的不足。这包括研究不同科学领域和工作流中的差异化需求,未来我们将分享更多关于这项研究的成果。
近期的工作,包括我们的 DR Tulu,已表明基于强化学习(RL)的方法能够提升开放权重模型的长文本报告生成能力,尤其是当评审模型参与训练循环时。我们曾考虑为 AstaBrief 采用这一路径,但最终专注于一种更简单的方案,该方案围绕监督微调(SFT)和直接偏好优化(DPO)构建。
基于 RL 的训练往往不稳定且成本高昂。我们希望看看能否通过一种更便宜、运维上更易管理的设置来推动报告生成质量的提升——这种设置还更容易调试和迭代。
这使得训练数据的质量变得尤为重要。与其依赖复杂的优化方法来弥补噪声样本的不足,我们将项目的大部分精力用于探索如何生成、筛选和过滤那些真正展现了我们期望的报告写作行为的样本。
我们还希望 AstaBrief 运行得更快,以便用户能快速获得初步报告,并在后续轮次中进行迭代。为了实现速度提升,我们决定训练 AstaBrief,使其在给定用户查询和相关检索片段时,一次性直接生成最终报告,从而绕过我们基于 Claude 的 Thinking 模式所使用的昂贵片段摘要和聚类阶段,也不再按章节撰写答案。有趣的是,我们发现这样做并不会牺牲性能。
收集 SFT 训练数据
训练数据的起点,是用户通过我们论文“Synthesizing scientific literature with retrieval-augmented LMs”所描述的系统,以及 ScholarQA(如今支撑 Asta“生成报告”功能的框架)提交的真实查询。我们希望 AstaBrief 能从真实科学家的真实问题中学习,而不是只靠合成提示或基准测试类的任务来训练。 我们的研究表明,科学家向语言模型提出的需求,往往和普通用户向通用聊天机器人或传统搜索工具提出的不太一样。在对数十万条 Asta 查询的分析中,我们发现专家级研究人员通常会提供大量背景信息、多重约束以及概念之间的关系,而不是依赖简短的关键词式提示。 近期针对 Asta 用户的调研还揭示了另一层差异:研究人员希望 AI 参与工作的方式各不相同——有人愿意用模型做构思或实验,也有人希望模型只在综合分析、文献监测或模式发现等较窄的环节发挥作用。但无论哪种偏好,参与者都希望来源可追溯性更清晰、模型在做什么更透明,以及对模型所用上下文有更强的掌控力。 我们对收集到的用户日志做了质量、相关性和隐私方面的过滤:剔除内测用户和机器人的流量,丢弃过短、无实际意义的查询,再通过一轮基于 LLM 的过滤,筛除非英文查询、非科研请求以及含个人信息的提示。最终留下了 9 万条聚焦科研的查询。 在 SFT 阶段,我们使用 Asta 报告生成背后的多步骤 ScholarQA 流水线,基于过滤后的查询生成完整报告作为目标输出。该流水线会检索相关文献,把素材组织成章节,再由一个后端报告生成模型把证据整合成带引用的报告。我们混合使用了多个专有模型:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。经过质量过滤后,得到了 4.7 万条可用的训练样本。构建 DPO 数据对
DPO 需要的训练数据是另一种形态:每条查询对应的目标不是一份报告,而是一对报告,其中一份要优于另一份。
这些比较对来自一个独立查询子集,该子集未参与 SFT 数据生成。每个查询对应一份由现有 ScholarQA 管道生成的报告,通常基于 Claude 3.5 Sonnet 或 3.7 Sonnet。竞争报告则通过将 ScholarQA 检索到的文献摘要输入另一个模型生成,具体模型视情况而定,包括 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1。
两个评判模型——GPT-4.1 和 DeepSeek-R1——对每对报告进行比较并选出优胜者。我们确保 LLM 评判与人类偏好一致(95% 一致率),且仅保留两个评判者结论一致的样本对。这为我们提供了更干净的偏好数据集,去除了大规模生成偏好数据中常见的大量噪声。
经过质量过滤,最终的 DPO 数据集包含约 6,000 个样本。
使用多个生成器并要求两个评判者达成一致,让我们找到了一种构建偏好数据的相对简单方式,而无需将任何单一模型的输出或判断视为标准答案。
过滤数据以改进归属
我们的主要评估目标是 SQABench-CS2,这是一组由用户撰写的 200 个计算机科学研究问题。在 AstaBrief 开发过程中,我们追踪了四项指标:
- Rubric 评分,衡量报告覆盖必要内容的程度。
- 回答精确度,衡量每个段落与问题的相关性。
- 引用精确度,衡量每个引用是否支持其关联的声明。
- 引用召回率,衡量报告中的声明是否得到所提供引用的充分支持。
对于最终模型,我们还进行了次要评估:DeepScholarBench,这是一个基于近期 ArXiv 论文构建的包含 63 个查询的长文研究综合基准;以及针对由 Claude 驱动管道生成的报告,进行了两项独立的成对评估——基于 SQABench-CS2 的 LLM 评判比较和一项小规模人工研究。
一份报告可能措辞精致、结构完整,却在内容上偏离核心问题,或者将引用标注在证据无法支撑的结论上。在科学综述领域,我们需要将这些行为分开评估。但引用支撑只是科学可信度的一个方面——模型虽然引用了正确的研究,但其结论可能超出了该研究实际支持的强度。这种过度泛化往往很隐蔽,例如:将针对特定样本的发现夸大为对整个总体的普遍结论;将过去时态的研究结果改写为听起来更具普适性的现在时陈述;或者将描述性发现转化为对临床医生、政策制定者或研究者的行动建议。
这类过度概括对科学报告生成尤为关键,因为每一步泛化都会扩大证据的表面适用范围,而不会引入显而易见的错误陈述。因此,报告中的引用句子虽然在技术层面上与来源相关,但仍可能夸大研究者实际确立的发现范围。我们当前的开发指标主要关注相关性、覆盖率和引用依据;对科学报告生成模型更全面的评估还应检验其是否忠实保留了来源中结论的适用范围和强度。
最初的 SFT 训练提升了内容的整体质量,但在回答精确度和引用质量上仍落后于基于 Claude 的报告生成流水线。换句话说,模型写报告的能力有所提升,但其基于证据的一致性仍未达到科学综述的要求。
这促使我们花更多精力提升数据质量。我们测试了四种基于统计数据的过滤方法,以识别质量较差的合成训练样本:
- 输出-输入 Token 比。比值过高的回答往往噪声较大,因为模型在用过少的证据生成过长的文本。
- 引用相关性。对于训练集中的每一份合成报告,我们计算其引用文献检索相关分数的平均值。平均分较低表明报告过度依赖排名较低的证据。
- 引用密度。我们统计了至少带有一条引用的陈述占比。引用密度低的报告往往有大段大段缺乏依据的文字。
- 引用多样性:在 Claude 驱动的报告检索管线返回的论文范围内,我们统计了答案中实际引用到的论文占比。得分低说明报告过度依赖少数几篇论文。
最显著的提升来自过滤掉引用密度低的合成报告;更激进的过滤、多种过滤组合以及学习率扫描都没有带来实质性增益。
这是整个项目中最清晰的教训之一:过滤越精细不一定效果越好。一个相对简单的信号——合成报告是否持续为论断提供引用——比我们尝试过的多种复杂组合更有用。换句话说,科研领域的专业化并不一定靠在预训练中堆更多科学文本;后训练数据的构成与质量,以及数据能否示范 grounding、归因这类行为,会切实改变最终模型的表现。
这种对有据可依、切实有用输出的关注,也与我们从 Asta 用户调研中听到的反馈一致。参与者表示,生成更多文字未必更有帮助;他们想要简洁的综合,以及足够的来源可追溯性,从而无需翻阅冗余输出就能核查和验证结果。
得到更强的 SFT checkpoint 后,我们在其基础上进行了 DPO 训练。这一阶段进一步提升了性能,使 AstaBrief 在报告生成上逼近 Asta 中 Claude 驱动的报告管线和 DR Tulu 的水平。
验证方法的有效性
由于这个模型定位是我们 agentic Asta 报告生成框架的一部分(而非独立运行的模型),我们的核心问题是:AstaBrief 能否在显著加快报告生成、降低成本的同时,保住我们看重的报告质量。换句话说,我们不只是想看它在单项 benchmark 上能否匹敌更强的专有模型,而是想知道用一个简化得多的系统能保留多少这样的质量。
每行按得分从高到低排序,所有指标均为越高越好。Qwen3-8B 仅在 SQABench-CS2 测试集上进行了评估。SQABench-CS2 是一组由用户编写的计算机科学研究问题;DeepScholarBench 使用其独有指标对长篇研究综述进行评分,这些指标与 SQABench-CS2 的指标不可比。
在开发阶段的评估中,AstaBrief 在回答和引用质量的多个维度上,表现与基于 Claude 的流程以及 DR Tulu 不相上下。下图展示了基于 LLM 评判的对比结果。在一项独立的 14 题人工研究中,三位科研研究人员各自贡献了 4-5 个问题,并对三个系统生成的报告在整体偏好、完整性、相关性、组织结构和引用准确性(允许平局)方面进行了排名。在整体偏好上,DR-Tulu 胜出;但在引用准确性指标上,三位研究人员中有两位认为 AstaBrief 优于其他系统,这证明了我们 SFT 数据质量过滤工具的有效性。
柱状图显示了在同一组问题上,各系统相较于 Thinking 模式在 LLM 评判的报告对比中获胜的比例。人工评判结果单独评估,未包含在内。Thinking 模式作为对比基准,因此没有对应的柱状图。与 DR-Tulu 不同,Asta Brief 在 DPO 阶段针对这种成对报告排名进行了优化。
应当将这些数据视为对其开发时期工程方法的验证,而非断言该特定基础模型在当前前沿技术中的相对地位。模型生态迭代迅速,我们认为数据构建、归属过滤以及服务部署方面的经验才是具有普遍适用性的部分。
在 Asta 平台验证 AstaBrief 的实际价值时,Fast 模式早期的使用数据表现令人鼓舞。在 374 名试用过该功能的用户中,29.1% 的用户连续使用两天以上,人均生成 3.67 个报告线程。23% 尝试过 Fast 模式的用户之后继续使用该模式,并在后续线程中从未切回 Thinking 模式。另有 18% 的用户根据具体目标在 Fast 和 Thinking 模式间切换,其中 Fast 模式约占其线程使用量的 40%。
尽管目前反馈样本较少,难以得出强结论,但我们观察到 Fast 模式收到正面反馈的比例与 Thinking 模式相当(分别为 84.2% 和 85.2%)。
后续展望
Asta 的报告生成功能标志着 AstaBrief 首次应用于生产环境,为研究人员提供了开源权重的 Fast 模式,与现有的 Thinking 模式并存。由于模型权重开放,机构可将其部署在自有硬件上,甚至置于防火墙之后,无需依赖专有模型 API 即可实现报告生成。
在 Asta 中,这也意味着我们能在保留 Thinking 模式以应对更重计算任务的同时,直接对报告生成流程的这一环节进行研究并持续优化。
仍有许多工作要做。我们正在探索更细粒度的偏好学习、更强的 RAG 加 RL 方法、多轮交互和多工具能力、更多科学数据源以及查询分解。我们还关注超越“论点是否有引用支持”的评估维度,去考察模型是否忠实保留了证据性——这既有助于更好地捕捉报告作为研究产物的质量,也能判断模型是否保持了其来源的证据范围。这包括简洁性、组织性等特质,以及模型是将样本特定的发现泛化为普遍结论,还是将描述性结果转化为建议。
AstaBrief 是一项实验,属于针对科学领域语言模型的长期工作序列的一环,始于 ScholarQA 和 DR Tulu,并正在向 Olmo 的后续版本演进。这里的经验——尤其是围绕训练数据、过滤和评估的教训——将有助于指导我们下一步的构建。



