Google 研究人员发现防止自我改进 AI Agent 记忆测试的方法
那些不断自动优化自身运行环境的 AI Agent 极易在测试任务上过度特化。来自 Google Cloud AI Research 及多所大学的一项新方法旨在在防止该问题的同时降低算力成本。
现代 AI Agent 通常将固定的语言模型封装在一个所谓的 harness(框架)中。该框架由提示词、工作流、工具、记忆及逻辑构成,控制着模型在每一步看到的内容。
harness 决定了 Agent 在修改文件前是否读取了正确的文件、能否从错误中恢复以及交付结果是否清晰。根据最新研究论文,Agent 近期的许多进步主要源于对 harness 的改进,而非新模型的引入。
过去这项工作依赖人工操作,需人工复盘失败运行并手动修补 harness。较新的方法通过让语言模型根据测试任务的反馈反复重写 harness 本身,从而实现了闭环自动化。
研究人员将这种做法称为递归自我改进(recursive self-improvement)的一种实用形式。系统生成反馈以优化 harness,而 harness 反过来控制系统的行为,形成闭环。
自我优化导致 Agent 死记测试任务
论文指出,这种自我优化存在陷阱。由于 Agent 始终在同一组有限的测试任务上运行,最终会将其背下来。训练任务的分数上涨,但在新未见任务上的收益却微乎其微甚至消失。
研究人员表示,这一现象主要由几种机制引发:搜索过程记住了仅适用于特定基准测试的模式、偏好了靠运气得高分的候选项,以及堆积了不必要地增加复杂度的方案——这些都能提高测试分数,但并未真正提升 Agent 能力。
其他方法主要改善训练任务表现,但效果难以迁移至未见基准。RRSI 在三个领域中均提升了未见任务的分数。 | 图片:Google
压缩编辑预算与严格评审者,确保 harness 的通用性
RRSI(Agent 框架的规律化递归自我改进)在优化循环的两端同时发挥作用,同时保持框架完全可编辑。当系统提出新的变更时,预算机制限制候选方案一次性打包的独立编辑数量。 该预算随时间推移而缩减。早期轮次允许较大的重写,而后期轮次仅允许可明确追溯至结果的细微变更。系统还会追踪早期尝试,避免反复追逐已验证失败的想法。当进展停滞时,它会刻意对尚未触及的框架部分进行实验。 RRSI 在两个环节约束自我优化:提出新变更时,以及决定哪些变更将永久并入框架时。 | 图:Google 在筛选变更方面,一个评估器会审查每项提案,并剔除任何硬编码任务名称、解决方案或其他基准特定技巧的内容。另一条规则仅在接受更高算力开销且伴随可衡量性能提升时才允许通过。不再有用的组件会被移除。放弃训练增益在新任务上有所回报
研究人员在八项基准上测试了 RRSI,涵盖编码、代理办公工作和工程设计。基础模型 Claude Opus 4.8 在整个过程中保持冻结。团队将 RRSI 与未修改的基线框架及四种近期优化方法进行了对比。 根据论文,RRSI 在训练任务上最多提升 14.1 分,在从未见过的五个基准上最多提升 4.7 分。与未加正则化的版本相比,其运行时的 Token 消耗减少了约 30%。在任一未见基准上的整体性能均未低于基线,而记忆化框架通常会出现这种情况。 RRSI 框架在所有训练集之外的任务上均有提升,其中在 JobBench 上的增益最大,达 4.7 分。 | 图:Google 所有方法在训练任务上都表现良好,但在新任务上结果反转。两种方法甚至低于基线框架。RRSI 在所有变体中训练增益最小,却是唯一在未见任务上显著高于基线的方法。这些护栏机制旨在产生这种权衡。在各类优化后的 harness 中,RRSI 消耗的 token 和步骤最少,在新任务上的表现也最好,不过未经修改的基线 harness 反而更精简。| 图片来源:Google
在一个模型上优化出的 harness,也能帮助更弱的模型
用 Gemini 3.5 Flash 优化得到的编程 harness,无需任何修改,就把弱得多的 Gemini 3.1 Flash Lite 的准确率从 11.2 分提升到 14.6 分。可见系统发现的这些机制,并不依赖于发现它们的模型本身的能力。
作者指出,这项研究只涉及围绕冻结模型构建的 harness,并未涉及模型权重会变化的情况。
他们的结论是:只有当反复的反馈被转化为持久的改变时,自我改进才能真正让 AI agent 的能力得到可靠提升。代码已发布在 GitHub 上。
人工设计的 harness 往往难以泛化到新任务,ARC-AGI-3 上的测试就证明了这一点:借助专门定制的 harness,Opus 4.6 在熟悉的环境中得分 97.1%,而在陌生环境中得分却为 0。Nvidia 最近也发布了类似的 SoL-Pi 方法,由一个研究 agent 自动重构编程 agent 的 harness,最多可节省 49% 的 token 用量,而性能几乎没有下降。
在此之前不久,Google 曾让 agent 通过"梦境"回顾过往的搜索过程来改进搜索策略。那项工作同样没有改动模型本身。