← 文章 / 开源项目
微软研究院 3小时前 · 2026-08-31 12:49:19 · 0 阅读

Orchard:面向可扩展智能体 AI 的开源框架

  • Orchard 是一个面向可扩展、高性价比智能体 AI 研究构建的开源框架,其核心是可复用的环境服务 Orchard Env,可在各类任务领域中训练和评估智能体。
  • 同一套 Orchard 基础设施可同时支撑软件开发、网页导航和个人助手类智能体,并能直接在 Codex、OpenClaw、ZeroClaw 等真实部署环境中训练它们——让研究者在不同任务间复用环境、数据流水线和评估流程。
  • Orchard-SWE、Orchard-GUI 和 Orchard-Claw 证明,规模相对较小的开放权重模型也能在复杂的真实任务上取得优异表现。例如 Orchard-SWE 仅使用约 30 亿活跃参数,就在 SWE-bench Verified 上达到了 69.7%(加入价值模型重排序后为 73.0%),逼近参数规模超过其 10 倍的前沿系统。

除了模型和工作流,项目还发布了训练数据和评估方法,旨在帮助更广泛的研究社区构建并研究开放的智能体系统。人工智能正在从静态问答快速迈向能够规划、推理并在复杂多步骤环境中自主行动的智能体。这些系统可以修复庞大代码库中的缺陷,代替用户浏览网页,并管理涉及日历和邮件的工作流。

尽管围绕智能体 AI 能力的讨论热度不断攀升,研究社区却始终面临一个瓶颈:构建最先进的智能体系统往往依赖专有基础设施——包括定制沙箱、封闭的训练流水线以及大多数研究者和从业者无法获取或复现的专有数据集。

为填补这一空白,我们推出了 Orchard(在新标签页中打开),一个面向可扩展智能体建模的开源框架。Orchard 的核心是 Orchard Env——一个轻量级的 Kubernetes 环境,提供可复用的隔离组件,支持大规模运行和构建智能体,覆盖从训练数据采集、强化学习 rollout 到评估的完整流程。

与许多现有框架不同,Orchard Env 的设计目标是在无需修改的情况下支持不同的智能体系统和任务类型。同一套服务可以同时支持软件工程智能体、网页浏览智能体以及个人助理智能体,覆盖各类应用场景。

为了展示这一思路,我们发布了三个面向特定领域的训练方案——Orchard-SWE、Orchard-GUI 和 Orchard-Claw。(在新标签页中打开)同时,我们也开源了构建这些方案所使用的训练数据和评估方法。

聚焦:系列活动

Research Forum | 抽象背景搭配彩色六边形

微软研究院论坛

与我们一同开启一场持续的对话,探讨通用 AI 时代的研究方向。点播观看最新一期的内容。

观看点播 在新标签页中打开

可跨任务类型扩展的环境层

Orchard 的核心理念是:运行时环境应当作为一个独立、可复用的服务存在,而不是嵌入到某个特定训练框架内部的基础设施。Orchard Env 基于 Kubernetes 构建,能够并行地创建、管理和销毁成千上万个隔离的组件。

该系统在设计上能够同时胜任编程、网页浏览和工具调用等任务,也支持不同的智能体系统,并覆盖训练和评估流程中的各个阶段,包括数据蒸馏和强化学习 rollout。

这种灵活性让 Orchard 在研究规模下也具备良好的实用性。团队可以引入新的基准、智能体系统或训练算法,而无需从零开始重建底层基础设施。

Orchard 还支持在任意 harness 中训练智能体。当今能力最强的智能体很少以裸模型的形式运行,它们通常依托 Claude Code、Codex、OpenClaw 这类精密的 harness 来处理多轮推理、工具调用以及与外部系统的对接。开源训练工具往往难以驾驭这类有状态的、多进程的 harness,研究人员只能先用简化版本训练、再到真实环境中部署,由此产生训练与部署的不匹配。Orchard 弥合了这一鸿沟:它用一个轻量代理在每次 rollout 的容器中记录 harness 自身的模型调用作为训练数据,从而让智能体能够在最终部署所用的 harness(OpenClaw、Codex、ZeroClaw 或其他)中直接完成端到端训练,并可同时跨多个 harness 进行训练。

Orchard-SWE:推进开源软件工程智能体的发展

软件工程是自主智能体最严苛的应用场景之一。它要求在真实代码库上进行多步推理、使用工具,并能从错误中恢复。Orchard-SWE 是我们针对该领域设计的训练流程。它基于 Mini-SWE-Agent 框架构建,用于自主解决软件工程任务,并在广泛使用的 SWE-bench Verified 基准上进行评测,该基准用于测试模型在真实代码库中导航、诊断和修复问题的能力。

在训练阶段,我们从两款先进的开源权重模型(MiniMax-M2.5 和 Qwen3.5-397B)中提炼出 107,000 条智能体交互记录,覆盖各类 GitHub Issue。训练过程采用信用分配监督微调(credit-assignment supervised fine-tuning):即使智能体未能完全解决问题,系统也不会丢弃这些尝试,而是从其中有价值的部分中学习,从而大幅扩充了可供模型使用的有效训练数据。

接下来是强化学习,但强化学习的反馈很稀疏——智能体通常只能得知最终的补丁是否通过了隐藏测试。我们先采用平衡自适应 rollout(Balanced Adaptive Rollout),尽可能利用这些难得的成功信号,然后引入两种"稠密奖励"技术来提供更丰富的指导:一是在策略蒸馏,让一个更强的教师模型逐步评估智能体的决策;二是过程奖励模型,由 AI 裁判对合理的问题解决过程——比如编写能复现 bug 的测试、验证修复是否有效、检查现有功能是否仍正常工作——给予奖励,而不论最终测试是否通过。

最后,我们用历史 rollout 训练一个价值模型来对候选方案重排序。强化学习会产生大量实践轨迹,这些轨迹通常会被丢弃;而我们则利用 20 次先前实验的轨迹,训练一个紧凑的 40 亿参数价值模型来识别高质量方案,在解题时对若干候选答案打分并选出最佳。这些技术合力将 Orchard-SWE 在 SWE-bench Verified 上的成绩从 61.4% 的基线提升到 69.1%(加入平衡自适应 rollout),再到 69.7%(加入稠密奖励技术),在参数规模相当(约 30 亿活跃参数)的开源模型中达到了新的最优水平;通过价值模型重排序,这一成绩进一步提升到 73%,已经逼近体量超出十倍的前沿系统,如图 1 所示。

Orchard-GUI:面向真实网页任务的轻量级浏览器智能体

网页导航面临的是另一类挑战:智能体需要理解视觉布局、与动态界面交互,并完成仅以自然语言描述的开放式任务。

Orchard-GUI 将一个 40 亿参数的视觉语言模型训练为浏览器智能体,所用监督数据相对较少:400 条蒸馏演示加上 2,200 个开放式训练任务。尽管训练数据有限,最终模型在多个网页导航基准上仍取得了强劲成绩:WebVoyager 上 74.1%,Online-Mind2Web 上 67.0%,DeepShop 上 64.0%,平均 68.4%,如图 1 所示。

左图:Orchard-SWE(30B-A3B)在 SWE-bench Verified 上达到 67.5%,与比它大 10—30 倍的前沿系统相当。右图:Orchard-GUI(4B)在 WebVoyager、Online-Mind2web 和 DeepShop 上平均成功率 68.4%,成为最强的开源 GUI 代理,同时与 OpenAI、Google 的闭源系统持平。
图 1. 性能对比。左图:Orchard-SWE(35B-A3B,约 30 亿激活参数)在 SWE-bench Verified 上达到 69.7%(加入价值模型重排后为 73%),与比它大 10 倍以上的前沿系统持平。右图:Orchard-GUI(4B)在 WebVoyager、Online-Mind2web 和 DeepShop 上平均成功率 68.4%,成为最强的开源 GUI 代理,同时与 OpenAI、Google 的闭源系统水平相当。

这些成绩使 Orchard-GUI 跻身迄今为止最强的开源网页代理之列,同时仍能与更大的闭源模型保持竞争力。结果也表明,只要采用合适的训练方法和环境,小型开源模型同样能在真实网页任务中表现出色。

Orchard-Claw:面向日常办公场景的个人助理代理

许多最具影响力的代理应用都涉及日常办公任务,包括阅读和起草邮件、管理日程、搜索信息以及跨工具协同。Orchard-Claw 专注于个人助理任务,仅基于 200 个合成任务训练一个代理。在 Claw-Eval(一个覆盖真实办公工作流的基准)上评测时,该代理在最多三次尝试的条件下可成功完成 59.6% 的任务;与更强的 ZeroClaw 代理系统搭配后,完成率进一步提升至 73.9%。

由于 Orchard 能够直接在真实部署框架内训练代理,Orchard-Claw 的训练涵盖了多个框架——包括 ReACT、ZeroClaw、OpenClaw 和 Codex——而非仅依赖单一简化流程。在这些真实框架中训练大幅提升了代理的可靠性:例如在 Codex 框架下,未训练模型的成功率仅为 18.6%,经 Orchard 训练后提升至 51.5%。

启示与未来展望

Orchard 的研究结果印证了一个更广泛的观点:环境层至关重要。通过将底层基础设施做到开放、轻量且可复用,Orchard 降低了智能体 AI 研究的成本。团队不再需要从零搭建定制化的隔离环境,也不必依赖专有的云服务。同一个 Orchard Env 可同时用于生成训练数据、运行强化学习 rollout 以及评估最终模型,无需每次重建系统。

展望未来,我们认为复用训练经验是实现智能体累积学习的一条很有前景的路径。与其在一次训练结束后就丢弃轨迹数据,我们将其视为持久化的资产——例如,把它们提炼成可复用的价值模型。这使得智能体经验能够随时间不断积累,让新一代智能体继承并扩展前代所获得的知识,而非从零开始。

Orchard-GUI 所展现的数据效率表明,未来在训练更大规模的 Web 智能体时,无需依赖大量人工标注的训练数据。我们将完整发布 Orchard 整套工具,包括环境服务、训练流程以及训练数据集,希望帮助更广泛的研究社区更快地构建出能力更强的开放智能体。

致谢

感谢 Microsoft Research 以及各合作机构团队对 Orchard 项目的贡献,同时也感谢开源社区——他们的基准测试和工具使本研究成为可能。

(在新标签页中打开)

作者简介

彭宝林(Baolin Peng)

首席研究经理

了解更多 姚文林(Wenlin Yao)肖像

姚文林(Wenlin Yao)

首席研究员

Microsoft Research

了解更多 伍倩辉(Qianhui Wu)肖像

伍倩辉(Qianhui Wu)

高级研究员

了解更多 程昊(Hao Cheng)肖像

程昊(Hao Cheng)

首席研究员

了解更多 高建峰(Jianfeng Gao)肖像

高建峰(Jianfeng Gao)

技术院士兼公司副总裁

了解更多

研究方向

Portrait of Jianfeng Gao
原始来源: 微软研究院

评论 (0)