Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence
在我们的论文中,我们针对这一问题提出了 Chain-of-Evidence(CoE),这是一种专为 AI 驱动研究设计的可验证框架。我们将 CoE 实例化为 Science One Framework——一个原生构建并维护证据链的自主研究原型系统,以及 CoE Audit——一套针对 AI 生成论文与其底层代码、证据之间一致性的自动化评估指标。实验结果表明,基线系统的参考文献幻觉率高达 21%,且频繁出现代码与文本错位;而 Science One Framework 则实现了零虚构引用、分数完全可验证,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准上取得了最优性能。
Chain-of-Evidence:可验证研究的框架
CoE是一个概念框架,定义了使研究成果值得信赖的要素,类似于ACID定义了数据库事务可靠的要素。该框架并不规定如何构建研究智能体,而是指定其输出必须满足的属性。它遵循一个原则,包含两个层面:研究成果中的每条声明都必须携带一条记录的证据链(完整性),且每条证据链必须真正支持其所关联的声明(正确性)。声明可以是一篇引用、一个报告数值、一段方法描述或一个结论,它们都必须追溯到相应的证据,例如同行评审论文、实验日志条目、实际运行的代码或结果表格。 幻觉引用指向一本不存在的论文;不可复现的分数在代码重跑时不再出现;错误描述的方法声称论文中的算法与代码实际实现的算法不同。每一种都是证据链断裂的声明——CoE审计使这些断裂变得可度量。Science One 框架
为证明无需牺牲问题解决性能就能实现可验证的AI研究,我们设计了 Science One Framework。与传统智能体先生成论文再事后关联事实的做法不同,Science One Framework 通过三大模块从架构上实例化了 CoE 框架:- 问题研究员(文献锚定):为防止幻觉引用,Science One Framework 通过 Semantic Scholar API 构建引用图谱。它针对每个主题最多读取100篇全文PDF,生成结构化的研究简报。最终论文中的每一条引用都源于该锚定的API调用,完全消除对模型记忆的依赖。
- 发现引擎(并行探索-利用):Science One Framework 在多条并行分支上有系统地探索和利用想法。在每个隔离周期中,Solver 智能体实现方案,任务专用评估器对其进行评分。高性能分支被迭代优化,所有原始评估输出汇编成严格的只读记录。
Science One Framework 流程。Problem Investigator 通过检索 PDF 文献奠定基础;Discovery 模块探索并评估解决方案;论文撰写与验证模块负责撰写与验证论文,并通过 Claim Verifier 确保所有声明均与其证据来源相符。
证据链(CoE)审计:衡量可验证性
为严格评估 Science One Framework 原型与当前先进基线方法(如 Sakana AI 的 AI Scientist v2、AutoResearchClaw、DeepScientist、AI-Researcher)的对比表现,我们开发了 CoE Audit。这一事后评估协议充当自动化“法医式”评审角色,对生成的各类产物(论文、方案、代码与参考文献)执行四项严格的完整性核查:
- 分数验证:从论文中提取报告分数,并与提交代码完全独立的重新运行结果进行比对。
- 规范违规检查:检查方案代码,确保其真正解决任务,而非通过利用评估指标或读取真实答案文件来走捷径。
- 参考文献验证:将每篇参考文献与学术 API 交叉核对,以识别不存在的虚假引用。
- 方法与代码一致性:借助大语言模型评委,将论文的方法章节与代码逐条对照,确保文字忠实描述所实现的算法。
CoE 审计框架及其四项核心完整性核查的概述。
实验结果
我们将 CoE 审计应用于 Automated Design of Research Systems(ADRS)基准测试中五个系统优化任务生成的 75 篇论文,分别是:Prism、Cloudcast、EPLB、LLM-SQL 以及 事务调度。
Science One Framework 在可验证性上显著优于现有基线。CoE 审计对所有系统应用同一套独立协议,逐一对照实时学术数据库重新核查每条参考文献。在此标准下,Science One Framework 在所有四项完整性检查中均排名第一:其所有参考文献均非虚构——每一条都能定位到真实、可检索的论文;而基线系统 hallucination 率最高达 21%。这是因为 Problem Investigator 会主动检索每一条参考文献,而非凭记忆生成。同时,它实现了完美的分数验证和最高的方法-代码一致性。相比之下,基线系统经常在其提交的代码仅为简单确定性启发式算法时,却声称使用了诸如"混合神经符号求解器"等复杂算法。
五个系统的 CoE 审计结果。
值得注意的是,严格的 verifiability 要求并未损害 Agent 的科研能力。Science One Framework 在全部五个 ADRS 任务上追平或超越了人类专家的表现,并在其中两项(Cloudcast 和 EPLB)上取得了全部系统中最高的总体分数。
在五个 MLE-Bench 任务及 Parameter Golf 上的求解器性能对比。
为检验其泛化能力,我们将 Science One Framework 部署到了六个高度复杂的额外任务上:
- MLE-Bench:在跨越医学影像、细粒度识别和3D感知等五个高难度Kaggle竞赛中,Science One Framework 斩获两枚金牌(包括一项基线完全失效的3D目标检测项目)和两枚银牌。
- Parameter-Golf:我们在一次严格的硬件和文件大小限制下的实时LLM训练竞赛中测试了 Science One Framework。当基线系统均无法产出有效提交时,Science One Framework 成功满足全部约束条件并达到了当时的最优分数(截至 2026 年 4 月 27 日)。值得注意的是,Science One Framework 发现的是真正新颖的算法技术,而非仅仅微调表层超参数。
展望未来
随着自主研究系统不断应对更棘手的科学难题,仅有解题能力已不足以分出高下。真正能拉开差距的是研究成果是否可信。我们的发现表明,可验证性应被视作一等公民级的架构约束。通过在生产主张时同步构建证据链,而非事后追溯支撑依据,Science One Framework 证明了 AI 智能体能够产出严谨、可靠且极具竞争力的科学研究成果。我们期望 Chain-of-Evidence 框架及其审查方法能成为社区继续打造下一代 AI 科学家的有力工具。
致谢
感谢 Bhavana Dalvi Mishra、Jiefeng Chen、Chun-Liang Li、Palash Goyal、Mihir Parmar、Yiwen Song、Yale Song、Raj Sinha、Parthasarathy Ranganathan、Burak Gokturk 和 Jinsung Yoon 对本研究的宝贵贡献。
免责声明
Science One Framework 为实验性研究原型,尚未达到生产就绪标准。