← 文章 / AI技术
微软研究院 3小时前 · 2026-08-31 12:56:19 · 0 阅读

EvoLib:让大模型把经验转化为持续演化的知识

  • EvoLib 让大语言模型在推理过程中从自身经验中学习,无需真实标签或外部反馈。
  • EvoLib 将过往尝试转化为可复用的技能与反思洞见,并应用于后续任务。
  • 有用的技能和洞见会被持续精炼、整合并重新加权,使针对具体实例的观察逐步沉淀为更具普适性的知识。
  • 通过把经验转化为可复用知识,EvoLib 帮助 AI 模型从过往的成功与失败中学习,并持续演化那些最有望提升未来表现的知识。
  • 由于无需更新模型本身,EvoLib 可应用于任何以黑盒方式部署的语言模型和 AI 系统,包括通过 API 提供服务的模型。

记忆已成为 AI 智能体的一项重要能力——它使智能体能够存储并检索过往经验。但仅有记忆并不等于学习。积累下来的对话、推理轨迹和操作历史会迅速膨胀为一个庞大的经验库,既难以从中筛选出新任务最相关的知识,更谈不上对这些知识进行精炼和演化,让表现随时间持续提升。

人类的学习方式截然不同。我们并不会记住过往经验的每一个细节,而是只记住关键的东西:有效的策略、需要规避的错误,以及可以跨情境迁移的技能。随着时间推移,这些经验教训会被精炼成越来越通用、越来越可复用的知识。把经验转化为可迁移、可演化的知识,是人类学习的重要基石之一。

在我们最近的论文 Test-Time Learning with an Evolving Library 中,我们探讨了 AI 系统如何以类似的方式从经验中学习。我们提出了 EvoLib,一个将原始经验转化为持续演化知识库的框架。EvoLib 并不把记忆视为不断增长的过往经验档案,而是从中提炼出可复用的知识,并随着新经验的到来不断打磨这些知识。通过库的演化,技能变得更加通用,见解变得更加精准,下游任务的表现也随之稳步提升。这样一来,AI 智能体无需更新底层模型,就能从不断积累的经验中持续学习。

EvoLib 的工作原理

装饰图片及文字

Azure AI Foundry Labs

一览 Microsoft Research 这些实验性技术所揭示的 AI 未来发展可能方向。

Azure AI Foundry 在新标签页中打开

不同于把原始经验当作静态信息来存储的传统 AI 记忆系统,EvoLib 的核心理念是演化的知识。在 EvoLib 中,一个知识单元可以是从成功方案中提炼出的可复用技能,也可以是从失败中习得的反思性洞察。新经验到来时,EvoLib 不是简单地把记忆越积越多,而是持续地提炼、整合并重新权衡已有的知识。具体而言,我们围绕知识演化设计了以下机制:

  • 整合(Consolidation)。从最新经验中提炼出新知识后,EvoLib 会从库中检索与之相似的知识,并尝试将其与新知识整合为更通用、更可复用的形态。这让知识能够跳出单个经验的局限,跨任务适用。
  • 权重机制。EvoLib 会持续更新每条知识单元的重要性,评判标准不仅看它在当前任务上的即时效用,还看它对今后任务中有用知识的生成有多大贡献。随着时间推移,长期影响最大的知识自然会在知识库中占据更突出的位置。
EvoLib 将原始经验转化为可复用的技能和洞察,再通过整合与动态权重不断迭代进化。
图 1:EvoLib 将原始经验转化为可复用的技能和洞察,再通过整合与动态权重不断迭代进化。

主要结果

为了评估 EvoLib,我们在多种不同类型经验与学习需求的挑战性任务上进行了测试:

  • 解决数学推理问题
  • 在效率约束下编写代码以完成指定任务
  • 做出决策来探索环境并与之交互,以完成长周期任务

在这些任务上,EvoLib 始终优于主流的基于检索的记忆方法及其他抽象记忆机制,同时 token 使用也更高效。

我们还评估了 EvoLib 将测试时算力转化为性能提升的能力——这有赖于不断进化的知识。图 2 将 EvoLib 与两类方法进行了对比:一类是各任务独立处理的算力扩展方法,另一类是性能强劲的基于记忆的学习方法。每条曲线展示了随着测试时算力增加,性能如何提升。

在三个基准上,EvoLib 在绝大多数算力区间内都取得了更高的性能,并且随算力增加性能提升得更快。

这些结果表明,更好的学习关键也许并非简单地存储更多记忆或投入更多算力——最大的收益来自于把经验转化为可复用的知识,并能在不同任务间持续打磨与应用。

在所有任务上,EvoLib 比现有方法更高效地将测试时算力转化为性能提升。
图 2. 在所有任务上,EvoLib 比现有方法更有效地将测试时算力转化为性能提升。

对随机任务顺序的鲁棒性

一个自然而然的问题是:这种学习方式是否高度依赖于任务出现的顺序。在现实世界中,AI 系统可能以任意顺序面对各种类型的任务,而一个实用的学习框架应当对任务顺序的随机性具有鲁棒性。为了评估这一点,我们在同一组异构任务上、以不同的任务顺序测量了任务性能。我们发现 EvoLib 始终优于现有的基于记忆的学习方法,并在不同顺序下保持稳定的性能。这表明 EvoLib 能够从多样化的任务中持续学习,即使这些任务是交错出现的——这意味着在现实场景中,当智能体必须处理并学习来自异构用户请求的混合流、且不依赖结构化课程时,EvoLib 具有实际优势。

随着 AI 系统承担更长时间、更复杂的任务,从经验中学习将变得越来越重要。AI 的未来可能不仅依赖于更大的模型和更多的算力,还需要能让系统持续积累、改进和复用知识的机制。

EvoLib 是迈向这一愿景的一步。通过将经验转化为持续演进的知识,它使 AI 系统在部署后能够持续改进和适应。未来的 AI 系统或许无需每次都从头开始,而是能像人类一样,在一个不断演进的、可复用技能与洞察的库上持续构建。

代码与实验结果已在 GitHub(新标签页打开) 上公开,以支持未来关于 AI 系统中记忆与知识演进的研究。

在新标签页中打开

相关论文

Test-Time Learning with an Evolving Library

认识作者

Weijia Xu 的肖像

Weijia Xu

高级研究员

了解更多 Alessandro Sordoni 的肖像

Alessandro Sordoni

高级首席研究经理

了解更多 Zelalem Gero 的肖像

Zelalem Gero

高级研究员

了解更多 Michel Galley 的肖像

Michel Galley

高级首席研究经理

了解更多 Eric Yuan 的肖像

Eric Yuan

首席研究员

了解更多 Jianfeng Gao 的肖像

Jianfeng Gao

技术专家兼公司副总裁

了解更多

研究领域

相关实验室

原始来源: 微软研究院

评论 (0)