← 文章 / AI技术
HuggingFace博客 2小时前 · 2026-09-23 02:05:05 · 1 阅读

英国 AISI 携手 EvalEval:让 AI 基准测试结果具备可复现性

EvalEval Coalition 很高兴宣布,英国 AI 安全研究所 (AISI) 正在使用 EvalEval 的基础设施公开共享评估结果,以支持更具可复现性和可验证性的评估科学。

AISI 和 EvalEval 曾通过参与 2025 年 NeurIPS 联合研讨会 展开前期研究合作,研究所的反馈也帮助塑造了 Every Eval Ever (EEE) 架构。此次合作的新阶段将共同的基础设施付诸实践。

可复现评估报告的重要性

随着 AI 部署加速,评估已成为衡量模型与系统性能的关键证据来源。然而,结果往往散布于各种格式、平台和渠道中,且常因信息不足而无法复现。重新运行评估本身可能成本高昂。

EvalEval 的使命是通过共享报告架构 Every Eval Ever 和开放平台 Evaluation Cards 改善这一生态系统,将评估结果及解读所需信息整合到统一结构中。

这建立在 AISI 现有工作之上,其通过 OptStop 提升评估效率,通过 HiBayES 增强统计严谨性,并规范转录分析和能力测试等流程。双方正致力于诊断评估报告中的不足,并构建共享基础设施予以弥补。

AISI 公开的内容

转录级别的透明度不仅关乎复现,更对分析与诊断至关重要。在本次合作的新阶段,AISI 将通过 Evaluation Cards 公开适当的评估方法与发现。该发布包含论文主要实验中五个基准的验证结果、上下文及配置信息:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

这些结果涵盖六款前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。本次发布还包含两项相关网络安全评估——Cyber CTFs 和 The Last Ones——的结果,所用模型有一组不同但部分重叠的名单。这些数据来自 AISI 的论文 How Inference Compute Shapes Frontier LLM Evaluation,该论文研究基准测试的表现如何依赖于推理时算力和评估协议。

Humanity's Last Exam 的成绩会随评估协议和推理算力而变化。每条曲线表示在给定 token 数量内累计解决的任务比例(按每个任务的最早成功记录计算)。当模型在每次尝试后能从 oracle 获得正确性反馈时,随着 token 用量的增加,它们会继续解出更多任务。

当结果连同配置信息公开发布时,研究者和从业者就能更深入地审查单项研究,并在整个生态系统中对比不同发现。对于缺乏这些细节的报告,AISI 这样的发布提供了经过验证的参考点,帮助人们结合具体情境解读评估结果——例如,让研究者理解配置选择可能如何影响报告的性能。随着更多评估方采用 EEE,这类开放对比将推动更广泛、更可靠的元研究。

AISI 的 Terminal-Bench 2.0 结果,与其他报告中相同模型在不同评估配置下的成绩对比。

我们对这一进展感到兴奋,期待与 AISI 及其他 AI 评估组织一起进一步推动评估的标准化与共享。

参与这一共同事业

关于 EvalEval Coalition

EvalEval 联盟是一个研究社区,致力于开发基于科学基础的研究与稳健的部署基础设施,以完善评估生态系统。其目标是改进评估科学,解决评估适用性与效用缺乏共识的问题,并拓宽对科研和政策分析具有重要影响的覆盖范围。

该联盟的重点项目包括 Every Eval Ever,这是一个共享评估结果的模式库与代码库;以及 Evaluation Cards,它将基准测试元数据、评估运行数据和模型元数据整合为可解读的记录。二者结合,使人们更容易理解表面相似的分数是如何在实质上不同的条件下产生的。

英国人工智能安全研究所

英国人工智能安全研究所(UK AI Security Institute)是英国政府科研、创新与技术部旗下的研究组织。其使命是为政府提供关于先进人工智能风险的科学认知。AISI 通过开展研究并构建基础设施,以理解先进人工智能的能力与影响、开发并测试缓解措施,以及为政策制定提供依据。

延伸阅读

原始来源: HuggingFace博客

评论 (0)