← 文章 / AI技术
HuggingFace博客 2小时前 · 2026-08-29 18:45:23 · 0 阅读

复现 ICML 2200 篇论文,我们学到了什么

今年 7 月,我们举办了一场黑客松。来自社区的 1,200 多名成员带着各自的 coding agent,逐条复现 ICML 2026 发表的论文。19 天内,参与者发布了 6,816 份 Trackio 实验记录,复现了 2,226 篇论文,约占大会论文总数的三分之一 🤯

这篇文章将分享我们组织这场黑客松时得到的经验,以及当 agent 负责开展研究实验时,人类将扮演什么角色

论文多到没人审得完

关于 AI 研究究竟有多可复现的讨论,早在这轮 AI 热潮之前就已经存在。但随着研究规模扩大,这些问题变得更加突出。ICML 2026 共收到 23,918 份投稿,接收了 6,352 篇论文,数量约是上一年的两倍,延续了近乎指数级增长的趋势。这一增长至少部分得益于 AI agent:它们让实验执行和论文撰写都变得更快。

审稿能力却没有同步翻倍。大多数会议的审稿人都是志愿者,未必有足够的时间或专业知识完整评审一篇论文。下面是一篇被 ICML 2026 接收并选为 Spotlight 的论文,以下是审稿人对它的原话:

An OpenReview reviewer admitting the proofs were not checked carefully

“我的信心分之所以较低,是因为我没有仔细检查所有证明。”

需要注意的是,这篇论文最终拿到了很高的评分,还入选了 Spotlight。请记住它,因为下文还会回到这篇论文,以及当我们最终仔细检查这些证明后,究竟发现了什么。

不过,如今情况已经发生了变化:导致投稿数量激增的同一项技术,也能帮助我们应对这股增长。Claude Code、Codex、Cursor 和 Pi 这样的 coding agent,如今可以阅读论文、编写代码、启动实验,并汇报实验结果。过去,仔细检查一篇论文可能要耗费审稿人一个周末;现在,一个 agent 一个下午就能完成一次尝试,而且还可以并行执行,将这一过程重复数千次。

所以,我们真正想问的是:如果大规模重新审视一个顶级会议,并尝试复现其中每一篇论文,我们究竟会发现什么?

黑客松(7 月 15 日至 8 月 2 日)

我们没有亲自审查论文,而是把这项工作向整个社区开放,让各种 agent 框架、算力预算和科研偏好都能参与其中。2026 年 7 月 15 日至 8 月 2 日期间,ICML 2026 开放复现挑战赛按以下方式进行:

  1. 选择一篇论文。我们为全部 6,341 篇入选 ICML 2026 的论文建立了索引,收录论文摘要,并提取每篇论文的核心科学结论,让 agent 可以从具体、可验证的目标开始,而不是直接面对一份 40 页的 PDF。我们也鼓励多人复现同一篇论文。
  2. 使用自己的 agent。参赛者可以使用 Claude Code、Codex、Cursor、OpenResearch 的 orx,以及其他各种工具。我们提供了简化的操作界面,agent 只需一条命令,就能获取论文、论文结论和挑战赛说明。
  3. 完成复现,并公开全部过程。每次运行都会生成一份 Trackio 日志:一个静态的 Hugging Face Space,包含复现报告、实际运行的代码、生成的产物,以及(可选的)作为 Hugging Face Dataset 上传的完整 agent 执行轨迹。审计过程本身也必须可审计。
  4. 接受评判。自动化的 Logbook Judge 使用开放权重模型 GLM-5.2 运行,会重新阅读每份日志,并针对每条结论给出判定:verified(已验证)、falsified(已证伪)、toy(缩小规模后的证据)或 inconclusive(无法得出结论)。我们明确要求评审器不能盲信日志中的自我评估。

参赛者获得了 $20 的 Hugging Face 算力额度,可以在 HF Jobs 上运行实验。整个挑战期间,参赛者共启动了 2,962 个云端任务。如果无法完整复现,例如论文使用了专有数据集或尚未公开 checkpoint,参赛者就会使用能够模拟原始数据特征的合成数据进行缩小版复现。

下面是一份完整复现的示例:

Anatomy of a reproduction logbook: logbook pages, agent traces, and artifacts

从数据来看,这次黑客松很可能是迄今对某个学术会议进行的最大规模复现尝试:

  • 1,221 名社区成员加入了组织
  • 发布了6,816 份复现记录
  • 尝试复现2,226 篇论文,占整个会议论文的34%,其中许多论文由多个独立团队分别尝试
  • 评估了35,908 条论文结论,并在挑战结束时将全部判定结果冻结在一个公开数据集中
  • 启动了2,962 个 HF Jobs;在 Hugging Face 上发布了274 个完整的 agent trace 数据集

我们的发现

将每篇论文中各条结论的判定结果汇总后,我们发现:

在接受检验的论文中,51%(1,103 篇)至少有一条结论得到独立验证。其中,266 篇论文的所有提取结论都通过了验证,算是完整复现;另外 632 篇虽然未能完全复现,但也没有发现任何结论被证伪。总计有 3,978 条独立结论通过真实实验得到确认。

在接受检验的论文中,23%(496 篇)至少有一条结论被证伪或受到质疑。其中包括 49 篇所有结论都被证伪、没有任何结论得到验证的论文。更有意思的是,有 242 篇论文中,不同独立复现团队针对同一结论得出了相反的判定。可复现性不是非黑即白的,它也具有对抗性。

其余论文处于两者之间:502 篇只有 toy 规模的证据,另有 280 篇无法确认结论是否成立(最常见的原因是缺少相关产物)。

优秀的复现案例

有些论文经受住了重重考验,表现十分出色;社区中最优秀的复现记录本身就值得一读:

被证伪的结论,以及我们核查后的结果

共有 35 名参与者正式声称自己证伪了某些结论。我们对每一项证伪声明都进行了对抗式复核:重新阅读论文和实验记录,并根据论文原文重新推导数学过程或复现实验。

下面列出几项已经确认的证伪结果,并附上发现问题的实验记录:

引言中提到的分页论文。 那位没有仔细检查证明的审稿人,究竟错过了什么?论文《Towards Optimal Robustness in Learning-Augmented Paging》声称,其算法能够实现 Hk+O(1)H_k + O(1)Hk​+O(1) 的鲁棒性。一名参与者的实验记录发现,加性项的增长趋势约为 0.38ln⁡k0.38 \ln k0.38lnk,并定位到了证明失效的具体步骤。我们重新实现了该算法,将测试范围扩展到 k = 1,024,确认这一增长趋势达到了约九个标准差的显著性。实际的鲁棒性应为 Hk+Θ(log⁡k)H_k + \Theta(\log k)Hk​+Θ(logk)。

一个在第 224 步之后才被推翻的定理。《Attention's forward pass and Frank-Wolfe》证明:只要原点一开始位于 token 粒子的凸包内,这些粒子最终就会坍缩到原点。三个独立团队分别找到了反例,问题最早在第 224、约 3,800 和 6,416 步出现。这也很好地解释了为什么其他人都“验证”了这一结论:有限步数的检查往往过早结束。最简洁的反例使用精确有理数算术表述,不存在可以归咎于浮点数误差的模糊空间。作者当天就确认了问题,目前正在修复。

理论分析的是一种 loss,实验用的却是另一种。在《Self-Distillation Enables Continual Learning》中,论文的核心公式和整个理论部分分析的都是 reverse KL divergence;但作者发布的代码默认计算的是 forward KL,而作者表示,论文中的所有结果都是用这个默认配置得到的。发现这一问题的复现记录还显示:即使用作者自己的代码和数据,也无法复现论文宣称的 +4 个百分点结果。作者已经将澄清后的版本上传到 arXiv。

被 padding 稀释的评测结果。在《Do Transformers Need Three Projections?》中,一位参与者发现,评测中的 label 位置约有 66% 是 EOS padding token。这些 token 训练时的 loss 接近于零,导致 perplexity 被压低了约三倍。修正后,摘要中“缓存缩减 50% 只带来 3.1% 的质量损失”这一结论,实际质量损失约为 9.4%。

🚨 误判的证伪。有时,我们也会发现复现尝试本身存在问题。一份复现记录曾颇为笃定地声称:“论文方法比 baseline 慢 2 倍。”但后来发现,这是复现过程中的算术错误:它把单条 trajectory 的耗时与 50 条样本组成一个 batch 的耗时进行了比较。统一口径后,参与者自己的数据反而证实了论文所宣称的 8 倍加速。

与作者沟通

对于每一项已经确认的发现,我们都开始联系论文作者,沟通方式很简单:这是我们发现的问题,这是全部证据;你们是否认同,还是我们的分析有误?目前收到的早期回复都非常积极:

An author response confirming the finding and promising an arXiv correction

截至目前,多篇论文的作者已经确认了相关发现,其中两篇正在进行 arXiv 更正。还有一篇论文的作者在挑战赛发现问题前一个月,就已在新版 arXiv 中悄悄修正了错误;我们将其视为一次独立收敛 🤗

人类的作用

这次黑客松引发的最有意思的问题是:论文评审还需要人类吗?我们认为需要,原因有几个:

完全依靠 agent 执行存在明显局限。 Agent 会陷入局部循环,误读依赖规模的行为(在分页论文中,几次“已验证”的结论都来自于过早停止的检查,没等到对数级增长显现出来),有时还会因为单位不匹配,在错误基础上完成整套证伪。挑战赛中最可靠的结果,都来自有人类介入引导的工作流:重新指引 agent、质疑某个假设,或是在为错误前提耗费一周算力之前,先判断实验本身是否成立。

目前,有些评估仍然离不开人类。 我们的人机协作冠军项目就是最典型的例子。论文声称,在极端量化条件下,图像生成依然稳定。数值指标显示“没有崩溃”,但生成的图像是否真正可用,则是一个需要感知判断的问题。Agent 专门搭建了一个评审界面,由人类亲自判断全部 128 对图像;这些标注被提交到代码仓库,之后再由 agent 检查其一致性。公开的 agent 运行记录完整保留了这一过程,甚至包括参与者询问评审工具的使用方法,以及随后回复:“我已经检查完这些图像对,并把 csv 文件放进仓库了,请确认。”

那么,作为人工评审,我们的职责是什么?我们认为,关键在于有效管理智能。这就像教授或首席研究员(PI)为研究生营造良好的科研环境:提供算力、工具、数据访问权限,并在恰当的时机给予有针对性的反馈。那些最能发挥智能体作用的参与者,正是搭建了合适环境、提出了正确问题,然后放手让智能体执行的人。

致谢

感谢参与此次活动的 1,221 位用户、获奖者、坦诚回应的论文作者,以及 Hugging Face 和 alphaXiv 的组织团队。活动中的每一份日志、评审结论、执行轨迹和产出物都已公开,起点是挑战页面。我们认为,这是迄今为止对机器学习会议论文进行的规模最大、逐条主张核查的开放审计。也希望这个纪录不会保持太久。

敬请期待未来的复现活动。🤗

原始来源: HuggingFace博客

评论 (0)