← 文章 / AI技术
The Decoder 5小时前 · 2026-08-30 06:35:41 · 1 阅读

谷歌 WikiSkill:让 AI 智能体拥有可持续积累的持久记忆

Image description Nano Banana Pro 生成,提示词来自 THE DECODER

谷歌研究院的研究人员推出了 WikiSkill,这是一个为 AI 智能体搭配持久知识库的框架。

该系统不会在每次运行结束后丢弃智能体学到的东西,而是把关于失败与成功的经验收集进一个类 wiki 的结构中,并利用这些经验逐步提升智能体的能力。这些知识会被打包成"Agent Skills"——即可复用的模块,用于引导智能体的行为,而不会改变它在训练期间学到的东西。

因此,智能体(也就是模型本身)并没有真正意义上的持续学习能力,这仍是未解难题。但它在每次运行后会为自己写出更好的指令,并能在下次执行时调用。这种做法并不优雅,可能也比真正的学习更容易出错,但研究表明它是一种有效的变通方案。

这项工作借鉴了 Andrej Karpathy 关于"LLM Wiki"构想的一个观点,即主张把经验编译成持久的、可累积的知识。WikiSkill 将这一思路应用到 AI 智能体技能的自动化开发上。

三层结构:经验、知识与行动各就其位

WikiSkill 将 AI 智能体的工作区划分为三层。"原始层(Raw Layer)"存储完整的执行轨迹,从工具调用到返回结果。这些数据不可更改,作为原始素材使用。

其上是"Wiki 层(Wiki Layer)",原始数据在这里被提炼成结构化的洞见,比如记录下来的失败模式和成功策略。研究人员称,这一知识层从不重置,只会随每次迭代不断增长。

最顶层是"技能层(Skill Layer)",保存智能体执行任务时遵循的现行操作指令。与 wiki 不同,如果某次更新损害了性能,技能可以回滚。

首先,推理智能体使用当前技能执行任务并生成执行轨迹。随后,"Wiki 维护者(Wiki Maintainer)"分析这些轨迹,识别失败模式与成功策略,并把结论写入 wiki。

"技能提议者(Skill Proposer)"利用更新后的 wiki 和执行数据提出有针对性的技能修改。最后,一道门控机制会在独立的验证集上检验所提议的修改,确认它确实有效。如果无效,技能会被回滚,但 wiki 保持不变。即便是失败的提议也不会丢失,因为 wiki 会记录尝试过什么以及为何失败,技能提议者因此可以在后续迭代中基于这些知识继续改进。

WikiSkill 四步循环。推理智能体生成执行轨迹(原始层),Wiki 维护者把模式提炼进持久 wiki,技能提议者推导出技能更新,门控机制检验修改是否真的有效。wiki 持续增长,而技能在性能下滑时可以回滚。| 图片:Tang et al., 2026

大模型受益更多,小模型也能缩小差距

研究人员在五个基准上测试了 WikiSkill,涵盖数学推理、网页搜索、电子表格操作、文档问答以及虚拟环境中的交互式任务。所用模型包括 Qwen(4B、9B、27B)、Gemma-4-31B 和 Gemini-3.5-Flash。

WikiSkill(黄色)稳定优于所有其他技能演化方法和无技能基线。与基线的差距随模型规模增大而扩大,说明大模型从演化技能中获益更多。| 图片:Tang et al., 2026

在该研究中,WikiSkill 全面超越了此前所有技能演化方法。平均来看,该框架把 Gemini-3.5-Flash 的成绩从 49.5% 提升到 68.1%,把 Qwen-3.6-27B 从 39.4% 提升到 63.3%。在个别基准上提升幅度更大:Gemini-3.5-Flash 在 LiveMath 上从 33.0% 攀升至 72.6%,在 SpreadSheet 上从 50.5% 升至 76.6%。

提升幅度因任务类型而异。数学题和电子表格操作的改善最明显,而长文档语境下的任务(OfficeQA)收益要小得多。研究人员表示,像 Qwen-3.5-4B 这样的小模型难以在长上下文中可靠地执行演化出的多步搜索策略,往往会退回默认行为。

大模型往往能从演化技能中获益更多。但运行 WikiSkill 的小模型可以比肩不使用该框架的大模型的表现。一个模型发展出的技能常常能迁移到另一个模型,有时甚至比接收模型自建的技能效果更好。由于情况并非总是如此,技能的可迁移性恐怕需要逐例检验。

模型 方法 LiveMath SealQA SpreadSheet OfficeQA ALFWorld 平均
Qwen-3.5-4B 无技能 29.1 32.5 14.6 30.2 24.4 26.2
Trace2Skill 31.5 37.6 17.5 31.0 42.8 32.1
EvoSkill 41.7 37.3 18.6 29.5 41.5 33.7
SkillOpt 48.7 33.3 14.0 34.5 45.3 35.2
WikiSkill 49.7 39.4 21.1 28.5 53.7 38.5
Qwen-3.5-9B 无技能 28.2 26.3 24.3 35.9 34.7 29.9
Trace2Skill 33.1 36.9 26.5 38.4 48.8 36.7
EvoSkill 58.1 34.5 35.4 34.9 48.5 42.3
SkillOpt 48.7 29.4 29.0 38.0 55.7 40.2
WikiSkill 56.3 43.1 33.6 40.5 63.4 47.4
Qwen-3.6-27B 无技能 33.9 27.5 40.8 42.1 52.8 39.4
Trace2Skill 36.3 37.3 53.3 54.3 55.5 47.3
EvoSkill 57.3 32.9 59.5 52.5 64.2 53.3
SkillOpt 51.9 34.5 53.2 54.8 59.2 50.7
WikiSkill 61.9 41.6 81.7 53.7 77.6 63.3
Gemma-4-31B 无技能 33.9 30.6 48.3 43.3 50.4 41.3
Trace2Skill 32.3 37.7 58.5 43.2 57.2 45.8
EvoSkill 29.8 38.4 56.4 39.9 52.6 43.4
SkillOpt 40.1 36.1 63.1 44.4 61.9 49.1
WikiSkill 56.7 41.2 68.0 44.2 64.4 54.9
Gemini 3.5 Flash 无技能 33.0 29.4 50.5 48.6 85.9 49.5
Trace2Skill 41.9 44.3 56.0 50.0 85.9 55.6
EvoSkill 44.6 43.6 55.4 51.2 85.9 56.1
SkillOpt 49.7 28.2 66.1 49.8 85.9 55.9
WikiSkill 72.6 44.7 76.6 60.7 85.9 68.1

表格:WikiSkill(高亮)在大多数模型-基准组合上取得最佳或统计等价的成绩。加粗数值表示最高分;同一列中的多个加粗值彼此无统计差异。所有数值均为三次独立运行的平均值。

原始来源: The Decoder

评论 (0)