← 文章 / AI技术
微软研究院 3小时前 · 2026-08-31 13:02:14 · 0 阅读

SkillOpt:将智能体技能文件转化为可训练参数

SkillOpt 博客 | 抽象绿色背景上的三个白色线条图标 | 盾牌图标、齿轮图标、带勾选标记的圆圈图标
  • AI 智能体经常失败,因为它们的指令(即技能)靠人工修改,无法保证效果。SkillOpt 将技能编辑转化为训练过程,在不改动模型权重的前提下让智能体行为更可靠。
  • SkillOpt 把智能体技能文件视为冻结目标模型之外的可训练参数,把技能编写从一次性提示转变为受控的优化过程。
  • 在六个基准、七个目标模型和三种执行模式下,SkillOpt 在全部 52 个评估单元中均达到最佳或并列最佳,且无需更新模型权重即可提升性能。
  • SkillOpt 通过有界文本编辑、验证门控、拒绝编辑反馈以及慢速/meta 更新机制,让技能保持简洁且可审计,避免提示词出现不受控的漂移。
  • 优化后的技能可在不同模型规模、智能体框架和相关任务之间迁移,表明它们捕获的是可复用的工作流知识,而非针对特定基准的指令。

大语言模型(LLM)正越来越多地以智能体的形式被部署,用于收集证据、调用工具并执行多步任务。对这些智能体而言,难点已不再是能否调用工具,而是能否可靠、稳定地完成任务。如今,智能体技能通常来自三个途径:专家手工编写、前沿模型一次性生成,或智能体在执行后粗略地修订。这些方式都不具备深度学习优化器的特性——缺少步长控制、缺少留出验证、也缺少对失败修订的记录。结果,技能会越改越长、每次重写都出现漂移,而一次看似合理的修订也可能悄然拉低实际任务表现。这种不受控的技能演化,已经成为从智能体原型迈向可靠、生产级部署道路上的主要障碍。

在我们最近的论文 SkillOpt: Executive Strategy for Self-Evolving Agent Skills 中,我们将问题从"如何写出更好的 prompt"重新定义为"如何训练这个 skill"。SkillOpt 把 skill 文件视为一个可训练的参数,独立于被冻结的目标模型之外,由此引入了类似训练过程那样的优化循环,在 52 个评估单元上都取得了稳定的效果提升,同时产出的 skill 文件简洁可读、可审计、可迁移。

Figure 1. A frozen target model executes tasks while a separate optimizer model trains the skill layer from trajectory feedback, exporting the reusable skill file best_ skill.md through validation gating.
图 1. 被冻结的目标模型负责执行任务,而独立的优化器模型根据轨迹反馈训练 skill 层,最终通过验证门控导出可复用的 skill 文件 best_skill.md。

SkillOpt 的工作原理

视频 1. SkillOpt 的优化循环,从轨迹收集到导出 skill 文件的全过程。

SkillOpt 把 skill 编辑组织成在文本空间中进行的"前向–反向–更新"循环。在前向阶段,被冻结的目标模型用当前 skill 执行一批训练任务,每次更新所依据的证据量由 rollout 的 batch size 控制。在反向阶段,独立的优化器模型以反思小批量的形式读取产生的轨迹,从中提炼出成功轨迹中需要保留的模式,以及失败案例中需要修正的模式。

在更新步骤中,优化器会提出小幅的添加、删除和替换编辑;候选编辑经过合并、去重、排序后,再按文本学习率(即每步编辑预算)进行截断。每个候选技能都必须通过严格的验证门控:只有当它在预留验证集上的得分严格高于当前技能时,才会被采纳。被拒绝的编辑不会被丢弃,而是进入一个拒绝编辑缓冲区,作为同一轮后续优化器调用的负反馈。此外,还有一个节奏较慢的逐轮慢更新(元更新),用于归纳单个批次无法揭示的长期规律(图 2)。总的来说,有界编辑、验证门控和最优版本选择三者结合,使技能优化过程可控且可审计,从而使技能趋于收敛而非漂移。

图 2. SkillOpt 流程:轨迹收集、小批量反思、有界文本更新、验证门控和逐轮慢/元更新共同约束技能训练。
图 2. SkillOpt 流程:轨迹收集、小批量反思、有界文本更新、验证门控和逐轮慢/元更新共同约束技能训练。

在各类基准、模型和执行模式下均取得稳定提升

我们在六个基准上对 SkillOpt 进行了评估(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld),使用了从前沿规模的 GPT-5.5 到小型开源模型 Qwen3.5-4B 的七个目标模型,以及三种执行模式(直接对话、Codex 和 Claude Code)。将每种组合计为一个评估单元,与人工编写的技能、一次性 LLM 技能、Trace2Skill、TextGrad、GEPA 和 EvoSkill 相比,SkillOpt 在全部 52 个评估单元上都取得了最优或并列最优的成绩。对于一个不更新任何模型权重的方法来说,这样的性能提升异常显著。在直接对话模式下使用 GPT-5.5,SkillOpt 将六个基准的平均分从 58.8 提升到 82.3,绝对提升达 +23.5 分,比逐单元挑选最佳竞争方法的"神谕"基线还高出 +5.4 分。最大的提升出现在过程性基准上:SpreadsheetBench 从 41.8 升至 80.7,OfficeQA 从 33.1 升至 72.1,LiveMathematicianBench 从 37.6 升至 66.9。同一套接口同样适用于智能体循环,相较于无技能基线,在 Codex 内为 GPT-5.5 带来 +24.8 分的提升,在 Claude Code 内带来 +19.1 分的提升。

播客系列

Daniel Carpenter、Timo Minssen、Chad Atalla 和 Kathleen Sullivan 的插画头像,Microsoft Research 播客封面

AI 测试与评估:来自科学界与工业界的经验

了解 Microsoft 如何借鉴其他领域的经验,将评估和测试打造为 AI 治理的支柱。

立即收听 在新标签页中打开

小模型加一个技能文件

面向下一档模型:SkillOpt 还缩小了小型或开源权重模型与前沿模型之间的差距——无需修改任何权重,也无需在推理时增加额外的模型调用。经过优化后,GPT-5.4-mini 在六个基准上的平均分(64.3)超过了更大的 GPT-5.4 无技能基线(59.7),GPT-5.4-nano(57.4)也超过了 GPT-5.2 的无技能基线(51.3)。拥有 40 亿参数的开放权重模型 Qwen3.5-4B 同样超越了 GPT-5.2 的无技能基线。曾经需要更大模型才能获得的性能提升,现在只需一个优化好的技能文件即可逼近。

技能可迁移:一次训练,处处复用

优化后的技能文件捕捉的是可复用的任务求解流程,而不是针对某一模型、基准或执行环境过拟合的指令。正因如此,同一个技能在迁移到不同模型规模、Agent 框架以及相关任务时,依然能提升性能。在我们的迁移实验中,技能在跨模型规模、跨执行框架迁移到邻近的数学基准时,持续带来收益。最具说服力的例子是跨框架迁移:在 Codex 中训练的一张电子表格技能,未经任何额外优化直接放入 Claude Code,就能将无技能基线从 22.1 提升到 81.8(+59.7),略高于在 Claude Code 中直接训练所达到的 80.4。由于两个框架暴露的工具接口并不相同,这表明 SkillOpt 学到的是通用工作流逻辑,而不仅仅是针对特定框架的"配方"。

紧凑、可读,且仅由极少数被采纳的编辑构建而成

最终部署的工件 best_skill.md 既不是不透明的参数文件,也不是不断膨胀的日志。在六项案例研究中,最终 skill 的中位长度约为 920 token;而由于验证门控会拒绝大多数提议,最终文件中通常仅有一到四处修改被接受。OfficeQA 上 +39.0 分的提升正是来自单次被接受的修改。学到的规则读起来就像资深从业者的建议。组件消融实验证实了各个控制机制的作用:去掉已拒绝修改的缓冲后,三个消融基准上的得分均有所下降;而同时去掉 meta skill 和慢速更新机制,则使 SpreadsheetBench 的得分从 77.5 跌至 55.0。

面向智能体时代的新型适配层

SkillOpt 为智能体的领域适配指出了一条更轻量的路径:无需微调权重、无需硬编码任务逻辑、无需手工调优提示词,只要有自动评估或可靠验证器,团队就能训练出一层小巧、可版本化、可审计的自然语言 skill。

通过将学习率、调度策略、验证划分、拒绝样本和慢速更新机制引入到智能体 skill 中,SkillOpt 表明训练对象不必局限于模型权重——模型之外的程序性知识同样可以被优化。

当这个过程受到控制、经过验证并被完整记录时,自然语言 skill 就成为了连接前沿模型能力与真实业务负载之间一个稳定、可迁移、可逆的适配器。阅读完整论文,请访问项目页面 aka.ms/skillopt,或在 GitHub 仓库 github.com/microsoft/SkillOpt 查看代码。构建智能体工作流的团队可以将 SkillOpt 作为基础框架,针对自身任务和验证器训练可复用的 skill。也可参阅我们的姊妹项目 SkillLens。

论文 GitHub SkillLens 项目页面 在新标签页中打开

相关发表

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

认识作者

Yifan Yang 的肖像

Yifan Yang

高级研究软件工程师

了解更多

Xuemei Gao

研究员

Qi Dai 的肖像

Qi Dai

首席研究员

了解更多 Bei Liu 的肖像

Bei Liu

高级研究员

了解更多 Kai Qiu 的肖像

Kai Qiu

研究员

了解更多 Dongdong Chen 的肖像

Dongdong Chen

高级研究员

了解更多

Chong Luo

高级首席研究经理

了解更多

研究领域

相关实验室

原始来源: 微软研究院

评论 (0)