谷歌 WikiSkill:让 AI 智能体拥有可持续积累的持久记忆
Nano Banana Pro 生成,提示词来自 THE DECODER
谷歌研究院的研究人员推出了 WikiSkill,这是一个为 AI 智能体搭配持久知识库的框架。
该系统不会在每次运行结束后丢弃智能体学到的东西,而是把关于失败与成功的经验收集进一个类 wiki 的结构中,并利用这些经验逐步提升智能体的能力。这些知识会被打包成"Agent Skills"——即可复用的模块,用于引导智能体的行为,而不会改变它在训练期间学到的东西。
因此,智能体(也就是模型本身)并没有真正意义上的持续学习能力,这仍是未解难题。但它在每次运行后会为自己写出更好的指令,并能在下次执行时调用。这种做法并不优雅,可能也比真正的学习更容易出错,但研究表明它是一种有效的变通方案。
这项工作借鉴了 Andrej Karpathy 关于"LLM Wiki"构想的一个观点,即主张把经验编译成持久的、可累积的知识。WikiSkill 将这一思路应用到 AI 智能体技能的自动化开发上。
三层结构:经验、知识与行动各就其位
WikiSkill 将 AI 智能体的工作区划分为三层。"原始层(Raw Layer)"存储完整的执行轨迹,从工具调用到返回结果。这些数据不可更改,作为原始素材使用。
其上是"Wiki 层(Wiki Layer)",原始数据在这里被提炼成结构化的洞见,比如记录下来的失败模式和成功策略。研究人员称,这一知识层从不重置,只会随每次迭代不断增长。
最顶层是"技能层(Skill Layer)",保存智能体执行任务时遵循的现行操作指令。与 wiki 不同,如果某次更新损害了性能,技能可以回滚。
首先,推理智能体使用当前技能执行任务并生成执行轨迹。随后,"Wiki 维护者(Wiki Maintainer)"分析这些轨迹,识别失败模式与成功策略,并把结论写入 wiki。
"技能提议者(Skill Proposer)"利用更新后的 wiki 和执行数据提出有针对性的技能修改。最后,一道门控机制会在独立的验证集上检验所提议的修改,确认它确实有效。如果无效,技能会被回滚,但 wiki 保持不变。即便是失败的提议也不会丢失,因为 wiki 会记录尝试过什么以及为何失败,技能提议者因此可以在后续迭代中基于这些知识继续改进。

大模型受益更多,小模型也能缩小差距
研究人员在五个基准上测试了 WikiSkill,涵盖数学推理、网页搜索、电子表格操作、文档问答以及虚拟环境中的交互式任务。所用模型包括 Qwen(4B、9B、27B)、Gemma-4-31B 和 Gemini-3.5-Flash。

在该研究中,WikiSkill 全面超越了此前所有技能演化方法。平均来看,该框架把 Gemini-3.5-Flash 的成绩从 49.5% 提升到 68.1%,把 Qwen-3.6-27B 从 39.4% 提升到 63.3%。在个别基准上提升幅度更大:Gemini-3.5-Flash 在 LiveMath 上从 33.0% 攀升至 72.6%,在 SpreadSheet 上从 50.5% 升至 76.6%。
提升幅度因任务类型而异。数学题和电子表格操作的改善最明显,而长文档语境下的任务(OfficeQA)收益要小得多。研究人员表示,像 Qwen-3.5-4B 这样的小模型难以在长上下文中可靠地执行演化出的多步搜索策略,往往会退回默认行为。
大模型往往能从演化技能中获益更多。但运行 WikiSkill 的小模型可以比肩不使用该框架的大模型的表现。一个模型发展出的技能常常能迁移到另一个模型,有时甚至比接收模型自建的技能效果更好。由于情况并非总是如此,技能的可迁移性恐怕需要逐例检验。
| 模型 | 方法 | LiveMath | SealQA | SpreadSheet | OfficeQA | ALFWorld | 平均 |
|---|---|---|---|---|---|---|---|
| Qwen-3.5-4B | 无技能 | 29.1 | 32.5 | 14.6 | 30.2 | 24.4 | 26.2 |
| Trace2Skill | 31.5 | 37.6 | 17.5 | 31.0 | 42.8 | 32.1 | |
| EvoSkill | 41.7 | 37.3 | 18.6 | 29.5 | 41.5 | 33.7 | |
| SkillOpt | 48.7 | 33.3 | 14.0 | 34.5 | 45.3 | 35.2 | |
| WikiSkill | 49.7 | 39.4 | 21.1 | 28.5 | 53.7 | 38.5 | |
| Qwen-3.5-9B | 无技能 | 28.2 | 26.3 | 24.3 | 35.9 | 34.7 | 29.9 |
| Trace2Skill | 33.1 | 36.9 | 26.5 | 38.4 | 48.8 | 36.7 | |
| EvoSkill | 58.1 | 34.5 | 35.4 | 34.9 | 48.5 | 42.3 | |
| SkillOpt | 48.7 | 29.4 | 29.0 | 38.0 | 55.7 | 40.2 | |
| WikiSkill | 56.3 | 43.1 | 33.6 | 40.5 | 63.4 | 47.4 | |
| Qwen-3.6-27B | 无技能 | 33.9 | 27.5 | 40.8 | 42.1 | 52.8 | 39.4 |
| Trace2Skill | 36.3 | 37.3 | 53.3 | 54.3 | 55.5 | 47.3 | |
| EvoSkill | 57.3 | 32.9 | 59.5 | 52.5 | 64.2 | 53.3 | |
| SkillOpt | 51.9 | 34.5 | 53.2 | 54.8 | 59.2 | 50.7 | |
| WikiSkill | 61.9 | 41.6 | 81.7 | 53.7 | 77.6 | 63.3 | |
| Gemma-4-31B | 无技能 | 33.9 | 30.6 | 48.3 | 43.3 | 50.4 | 41.3 |
| Trace2Skill | 32.3 | 37.7 | 58.5 | 43.2 | 57.2 | 45.8 | |
| EvoSkill | 29.8 | 38.4 | 56.4 | 39.9 | 52.6 | 43.4 | |
| SkillOpt | 40.1 | 36.1 | 63.1 | 44.4 | 61.9 | 49.1 | |
| WikiSkill | 56.7 | 41.2 | 68.0 | 44.2 | 64.4 | 54.9 | |
| Gemini 3.5 Flash | 无技能 | 33.0 | 29.4 | 50.5 | 48.6 | 85.9 | 49.5 |
| Trace2Skill | 41.9 | 44.3 | 56.0 | 50.0 | 85.9 | 55.6 | |
| EvoSkill | 44.6 | 43.6 | 55.4 | 51.2 | 85.9 | 56.1 | |
| SkillOpt | 49.7 | 28.2 | 66.1 | 49.8 | 85.9 | 55.9 | |
| WikiSkill | 72.6 | 44.7 | 76.6 | 60.7 | 85.9 | 68.1 |
表格:WikiSkill(高亮)在大多数模型-基准组合上取得最佳或统计等价的成绩。加粗数值表示最高分;同一列中的多个加粗值彼此无统计差异。所有数值均为三次独立运行的平均值。