← 文章 / AI技术
微软研究院 3小时前 · 2026-08-31 12:53:36 · 1 阅读

Echoverse:为计算机使用智能体打造的深度演进训练环境

与其追求数量,不如提升保真度——瞄准智能体真正欠缺的能力,并随训练模型的成长而持续演进。

Diagram of an iterative training loop where a model generates a world, the world produces a graded run, and feedback updates both the world and the model.

我们为计算机使用类智能体构建了十二个训练世界:十个深度领域世界和两个能力世界,每个世界围绕同一种控件(日期选择器、嵌套筛选器等)以多种形式反复训练。深度是这些世界值得训练的关键:它们复刻了应用程序的真实行为,预置了真实数据,并在各页面和各用户之间保持状态一致。在全部十二个世界上训练后,一个 9B 模型的得分几乎翻倍(从 36.5% 提升到 67.1%),与 GPT-5.4 仅差十四分。这次实验带给我们几点启示:

计算机使用 Agent 只有在动作产生真实后果的地方才能学到结果。一次点击会改变已保存的状态,一条消息会送达真实的人,或者一个拒绝跳转的页面会告诉 Agent 它上一步什么都没做。截图能展示界面的样子,但只有一个真正运行的世界才能展示一个动作造成了什么。

值得学习的后果是有状态的,而且其中大部分都藏在登录墙后面。人们希望自动化的任务存在于封闭系统中:邮件和聊天、银行、健康记录、云与 ML 的内部控制台。你没法用这些系统的线上版本来训练 Agent —— 每一次尝试都会写入真实账户,尝试之间无法重置,真实状态隐藏在屏幕背后。因此你需要把系统重建为一个合成世界,在那里数据库归你所有:状态是真实的,也会真实地变化,但可以放心地弄坏、能快速重置,并且依据数据而非截图来评分。

装饰图片及文字

Azure AI Foundry Labs

通过这些来自微软研究院的实验性技术,一窥 AI 未来可能的发展方向。

Azure AI Foundry 在新标签页中打开

我们所称的"世界",包含三层紧密相连的东西:一个环境(即应用程序、其状态以及改变状态的操作)、在其中设定目标的任务,以及一个根据真实结果打分的验证器。社区目前已能熟练地构建这些:流水线负责部署应用、初始化数据、生成任务并挂载验证器,由此产出数百个环境和数千个可校验的任务。本文正是建立在这些进展之上。然而,当世界数量不再是瓶颈时,真正的瓶颈变成了其内部结构:无论状态在多用户、多屏幕间能否保持一致、工作流能否维系依赖关系、一个薄弱的技能能否以足够多的形式出现从而实现泛化,以及成功究竟该由结果还是外观来判定。

Echoverse 所验证的判断是:真正的杠杆不在于堆砌更多世界,而在于一个能让既有世界持续变好的闭环。它把"构建环境"和"训练模型"视为同一个过程,而非两个独立阶段:在世界中运行模型、找出失败点、让世界及其任务与验证器在该处更贴近现实或更具挑战性、再用更锐利的信号训练、然后循环往复。普通的微调只改进模型本身;而在这里,每一次带评分的运行既在衡量模型,也在改进评判它的世界。于是静态基准会饱和,而闭环则在不断累积。

让该闭环保持活力的有三个杠杆,没有一个靠堆环境数量取胜。深度:为目标领域——包括那些封闭的、专有的领域——打造行为层面足够忠实的世界。能力定向:围绕模型反复失败的特定交互,量身构建窄而精的世界。共同演化:在每一次带评分的运行中同时改进环境、任务与验证器,而非只更新模型。

为什么要用合成环境?为什么要做深?

那些无需登录的开放站点看似可以让我们绕开合成环境的必要性,但它们其实是糟糕的训练场,原因完全不同:它们不会保持静止。页面会被重新设计,房源列表和日期会向前滚动,宿主服务还会限速甚至封禁自动化流量——因此,绑定在这些站点上的基准会随时间漂移,每次跑出来的环境都不一样。偶尔做一次评测还能容忍这种漂移,但训练不行,因为同一个任务要跑上千次,每次都需要一模一样的环境。合成环境在时间和数据上是冻结的:日历不会走动,种子数据不会变化,第一千次 rollout 上的任务含义与第一次完全相同。我们用一点点表层真实感的损失,换来一个完全可控的世界。

可控只是底线。一个环境可以做到完美稳定,却仍然是空洞的。所以真正值得花训练时间的是深度:不是页面数量,而是它能在多大程度上保留真实工作流的因果结构。衡量深度的有五项标准:行为保真度(控件、权限和报错都符合产品的逻辑);状态一致性(发出的消息会在收件人那里出现,取消的会议会在双方的日历上同时清除);工作流深度(早期的选择会约束后续走向);权威验证(以应用状态为准,而非像素);以及领域价值(这个工作流值得被改进)。在真正重要的系统里,难度集中在权限、共享状态和审计历史中——而这恰恰是浅层克隆会跳过的结构。越过这条线,更多环境带来多样性;没越过这条线,更多环境只会带来噪声。

Echoverse 工厂是如何运作的?

Echoverse 是一条单一流水线,有两个产出:保留完整工作流深度的全领域世界,以及只改变某一诊断交互的能力世界。两者都依托于同一个事实——我们掌握底层数据库,因此任务是否成功取决于应用自身的状态,而非模型对截图的解读。

构建世界

流水线先把少量种子场景扩展成规格说明,再编译成关于路由、状态和行为的机器可校验声明。声明就绪后才开始生成应用:FastAPI + SQLite 后端搭配 React 前端。新生成的应用只是一个假设,还不是世界:构建器针对每条声明在运行环境中逐一验证,必要时修复数据库、后端或前端,直到全部通过,然后写入一份就绪记录,将硬性阻塞和一般性风险分开。存在未解决阻塞的世界不会进入下一阶段。这里的"深度"不是写在提示词里的承诺,而是这个世界已被验证通过的那份声明清单。

扩充语料

即使一个世界构建得很干净,也还不能直接当作训练数据。我们针对每个任务在实时数据库上重新落地,从真实存在的实体中抽取目标,再把每个目标送进一组分析器:目标中的实体是否真实?目标本身是否合理?难度与工作量是否匹配?最后还有最严格的一道关——驱动真实界面运行的智能体能否完成它?这最后一步在浏览器中执行,能在模型介入之前就拦下任何界面无法满足的目标。生成的目标只是一项声明;针对真实应用完成求解才算证明。

每一次失败都会变成一条带标签的工单,标明需要修改的层级:数据库、后端、前端、任务文本或验证器。各层专用的修复器负责打补丁,针对运行中的应用重新校验,一旦引发回归就回滚。这个循环会依据数据库真值反复打分,直到通过率不再上升;每个存活下来的任务在导出时都附带判定它成绩的精确检查。这些任务成为训练数据的路径只有一条:GPT-5.4 求解每个任务,验证器把通过真值校验的轨迹保留下来,最终作为下文所有实验的有监督微调(SFT)数据。

构建世界与扩充语料不是两个独立阶段,而是同一个闭环:大多数缺陷出在世界本身,因此每次迭代我们都重新版本化环境。更难的任务会暴露世界的短板,更坚固的世界又能承载更难的任务——每一轮循环下来,两边都会变得更强。

两阶段流水线示意图。第一阶段把种子场景扩展成一个应用,并反复修复数据库、后端和前端,直到通过机器可校验的断言。第二阶段将任务重新锚定到实时数据上,迭代运行分析器与修复器智能体组成的流程,然后以数据库真值重新打分,直到通过率趋于平稳。虚线箭头表示大量任务循环的修复回流到世界本身。
图 2:环境工厂——每个世界背后的两重循环。第一阶段把少量种子扩展成一个应用,然后修复数据库、后端和前端,直到通过机器可校验的断言。第二阶段将任务重新锚定到实时数据上,运行一组分析器与分层修复智能体,并以数据库真值重新打分,直到通过率趋于平稳。其中许多修复最终回流到世界本身(虚线箭头)。

验证器以数据库为锚

每条任务都自带一份答案——由生成时的一条 SQL 查询从真实数据库中铸成的一个值或一次状态变更,构造上即为真,并在智能体完成后再次复核。类按与存储值的语义等价度打分(288 美元和 287.62 美元算通过);类按真实的数据库 before/after 差异打分,所以除非工单那一行真的翻了状态,否则声称"已关闭"即为失败;读写合一类取两者中较低的分。评分难以被钻空子,以锚定为依据而非人工标注,且在 EchoStay 订房、EchoForge 工单、EchoBank 转账之间保持一致。

完整领域承载完整工作流

真正重要的任务集中在公开基准最难触及的领域:封闭的、私有的系统——难度来自权限、共享状态和历史,而非界面布局。一个忠实的克隆必须复刻这一点。重要的不是像素,而是操作的后果能否跨页面、跨用户贯穿始终,使任务能运行一段真实的工作流,并按其留下的状态打分。

十个 Echo 领域涵盖通信、技术工作、监管记录、社区、媒体和旅行。如果存在丰富的公开数据集,我们就直接基于它来构建:EchoStay 以 InsideAirbnb 为种子,因此其房源、房东、评论和配套设施都是真实的而非虚构的;EchoForum 则依托一个包含 255 万条评论的公开论坛语料库。当没有现成数据时(如邮件、日历、银行和健康记录),我们通过种子数据生成管道在严格约束下生成状态——数据密集且内部自洽,而不是少量占位行。

工作流类别环境世界需要承载的深度
通信与协作EchoMail、EchoCalendar、EchoChat共享会话线程、日程安排、参与人、权限、历史记录
技术创建与运维EchoML、EchoForge制品产物、配置、依赖关系、角色、多阶段变更
监管记录与交易EchoBank、EchoCare余额或记录、授权、审计历史、影响重大的写入操作
社区、媒体与旅行EchoForum、EchoTunes、EchoStay持久化偏好、社交状态、搜索、预订、账户操作
表 1:Echo 家族的十个全领域环境,按其所代表的工作进行分组。每个环境都是一款广泛使用产品的忠实替代品,其命名以工作流而非品牌为依据。

正是这些累积的状态,使得一个操作的后果能够跨越不同界面和用户。在 EchoStay 中,一次预订要经由搜索、房源展示、可用性和支付等环节,跨越约 87 条路由和 23 张表,却连一个确认页面都没有;一条 EchoMail 会话线程承载着从起草到发送、回复和标签状态的完整意图;EchoCare 中的每一条医嘱都会写入审计日志。正因如此,这些任务代价高昂,往往需要五到二十步操作才能完成,且只有在底层状态真正改变后才算结束。

Grid of per-domain cards for the Echo suite. Each card names an environment and lists grounded database counts for its backend, seeded data, and feature surface, showing each is a self-contained interactive clone rather than a mockup.
图 3:Echo 套件中各领域的细节。每个环境都是一个独立、完整可交互的应用克隆,拥有自己的后端、预填充数据库和功能集合。所列计数均为真实的数据库状态,而非界面原型。

能力世界:聚焦单一技能

并非所有短板都源于缺少某个领域——有些仅仅是因为代理无法稳定操作某个特定控件。设想一个代理在预订行程:它搜索、筛选、打开合适的房源,最后却卡在日期选择器上,无法把"三月的第二周"转化为在陌生日历控件上的正确点击操作。再造一个预订网站并不能解决这类问题。只有让同一种控件以足够多样的形式反复出现,这项技能才能被真正习得。日期选择器和嵌套式筛选搜索在真实网页上无处不在,却以千百种方式呈现——这种多样性恰恰是任何单一深度应用都无法提供的。

因此,我们把控件单独抽离出来,在不同的布局、状态和约束下大量复用,然后基于每种变体生成具体任务。日期选择器世界将同一种日期控件渲染为六种核心组件,分布在 10 种上下文场景中,并额外预留 10 种未参与训练的全新变体——从日历热力图到滚轮选择器、财政季度选择器等;其中最具难度的任务要求把"转写"升级为"推理",需要将"2026 年 1 月最后一个周四"或"起始日期之后的第 10 个工作日"解析为唯一精确且可通过控件到达的日期。嵌套筛选世界涵盖 20 种组件类型,并将 9 种复合面板类型留作分布外测试集;每次提交都按照筛选结果是否真正满足所要求的条件来评分,评判依据是应用自身的业务逻辑,而非界面外观。

Plain-English catalog of the widget families the capability worlds render. Each entry is a distinct rendering of the same control (a date picker or a nested filter) re-themed across real-world verticals, with several families marked held out for evaluation only.
图 4:两类技能所覆盖的全部控件家族,分为训练集(分布内)和仅用于评估的留出集:嵌套过滤器,20 个家族加 9 个留出复合面板;日期选择器,10 种场景下的 6 个核心类型加 10 个留出控件。
Diagram showing the capability controls re-themed across many domains: nested filters across six verticals and date pickers across ten everyday contexts, with the held-out sets reaching 36 further scenarios.
图 5:跨领域主题化的日期选择器与嵌套过滤器:嵌套过滤器覆盖从房产到宠物领养等六个垂直领域;日期选择器覆盖从日程排定到保险等十种日常场景。

更深、更具针对性的环境带来了什么

更多的轨迹并不自动带来更多的训练信号。关键在于深度:一个回合是否能在真实工作流的依赖步骤中贯穿整个任务,而不是孤立地重复某个动作。两个实验从相反的方向把这一区别讲清楚:一个在完整领域上做得更深,另一个则聚焦于一项失效的技能。

浅层环境适得其反;深层环境才能迁移

浅层环境是廉价的方案。它搭建迅速,看起来也像模像样,却只演练了那些看似正确、彼此孤立的点击。模型若在这样的环境上训练,就会学到错误的反应模式——过度操作、来回打转、重复无效动作——因为简单的环境从不为此付出代价。深层环境的成本更高,但它的轨迹承载了真实网站所需的依赖结构,能够实现有效迁移。

为了把这一点拆解清楚,我们选取两个实时 WebVoyager 站点——Allrecipes 和 Hugging Face——并对比三个模型版本:基线模型,以及两个分别在"浅层世界"和"深层世界"轨迹上训练得到的模型。浅层世界给出的任务短小且自包含;深层世界给出的任务则跨越多个相互依赖的步骤,某个早期操作会改变后续的状态、可选项以及校验方式。两者让模型接触的领域知识完全相同,唯一不同的是任务深度。评测时使用这些领域在公开 WebVoyager 基准上的任务,在脱离任何训练环境的真实站点上运行。

在 Allrecipes 上,浅层世界反而把模型从 80.0% 拉低到 75.0%;在 Hugging Face 上则维持 48.0% 不变。只有深层世界同时提升了两个站点,把 Allrecipes 提升到 85.0%,把难度更高的 Hugging Face 部分提升到 65.0%。在领域接触量相同的前提下,差距就来自深度:深层模型陷入循环的次数更少,在 37 个 Hugging Face 任务中,耗尽步数预算的任务从 15 个降到 9 个。拉开两者距离的并非模型"看"到了多少,而是它看到的东西是否保留了真实工作的结构。

Grouped bar chart on two live WebVoyager domains, Allrecipes and Hugging Face, comparing base, shallow-world-trained, and deep-world-trained models. Shallow drops Allrecipes from 80.0% to 75.0% and leaves Hugging Face flat at 48.0%; the deep world lifts them to 85.0% and 65.0%.
图 6:两个实时 WebVoyager 站点上深层与浅层世界的对比,领域接触量相同,任务深度不同。深层世界让两者都得到提升;浅层世界在 Allrecipes 上低于基线,在 Hugging Face 上则停滞不前。

聚焦某一项能力的精度

日期选择器和嵌套筛选这两个训练场景,恰好对应评估中暴露出的薄弱控件,而且这两项能力还能相互强化:专项训练后,日期选择器的分布内评估从 60.0% 提升到 82.6%,未见过的布局从 34.0% 提升到 54.0%;嵌套筛选在未见过的测试集上从 62.8% 提升到 84.1%。这种在从未训练过的表单上仍然有效的提升,说明模型学到的是规则本身,而非死记布局。两个能力之间是相互迁移而非相互竞争:单独训练其中任何一项,另一项的得分也会跟着上涨;而两者一起训练,在所有测试维度上都表现最好。拿 GPT-5.4 作为前沿参照,这个组合模型在嵌套筛选上已经略微领先,在日期选择器分布内任务上也追平了大部分差距,只有在未见过的日期选择器上明显落后。更重要的是,这条规则同样适用于真实的互联网——在从未接触过的网站上,把 Online-Mind2Web 的成功率从 29.5% 提升到了 34.3%。

在四个能力维度(日期选择器分布内与未见集、嵌套筛选分布内与未见集)上对比 base、plus-datepicker、plus-nested-filter、plus-both 四款模型的分组柱状图。训练任何一项都能同时提升两类控件的训练效果,而两项一起训练在所有维度上都是最佳。
图 7:定向训练带来定向提升:单独训练日期选择器或嵌套筛选中的任何一项,都能同时提升两类控件的表现——包括从未训练过的控件样式和组合方式——而两者结合训练在所有维度上都是最优方案。数值越高越好。

从合成环境到真实互联网

本节后续实验涉及三款模型。Base 是在 Qwen3.5-9B 的基础上,仅喂入少量合成轨迹数据,使其能基本对齐浏览器操作空间而做的轻量微调。我们的模型(Our model)则是同一个 9B 参数网络在整个合成数据集上训练得到的。GPT-5.4 作为参数规模远大的前沿模型,用作参考上限。

训练学到的技能在真实互联网上还管用吗?我们将模型完全不变地放到 WebVoyager 和 Online-Mind2Web 上测试,这两个基准模型从未训练过。它们与我们构建的内容重叠极少:两个测试都以开放的公共站点和只读式浏览为主,而我们训练的是需要登录、以写操作为主的工作流。本来的目标就不是追求大幅跃升,而是看趋势走向。这个冻结模型在这两项测试上都超过了基座模型:WebVoyager 从 66.5% 提升到 71.5%,Online-Mind2Web 从 40.5% 提升到 43.4%(不使用 BrowserBase 时,分别为 50.9% 提升到 52.9%、29.5% 提升到 37.2%),这些分数都是通过 BrowserBase 跑出来的,因为托管浏览器去除了数据中心的反爬拦截和限速,否则任何智能体的分数都会被压低。训练数据里没有来自真实互联网的数据,所以这是迁移泛化,而不是死记硬背。

柱状图展示两个在线基准通过 BrowserBase 测试的结果。完整语料模型在 WebVoyager(66.5% 对 71.5%)和 Online-Mind2Web(40.5% 对 43.4%)上都优于基座模型,说明合成训练可以迁移到它从未训练过的站点上。
图 8:合成训练可以迁移到真实互联网上。完整语料模型在两个从未训练过的基准上都超过了基座模型;分数通过 BrowserBase 跑出,以排除数据中心的反爬拦截。

在真实互联网上提升不大是覆盖范围的问题,不是能力天花板:如果瞄准某个真实领域的场景训练,分数就会涨上去。我们打造的代码托管环境 EchoForge 与 GitHub 属于同类应用,而 GitHub 正是 WebVoyager 测试的真实站点之一。把 EchoForge 加入训练后,真实 GitHub 上的得分从 58.5% 提升到 63.4%,整体真实测试分数也水涨船高(WebVoyager 从 50.9% 到 52.9%,Online-Mind2Web 从 29.5% 到 31.1%)。平均涨幅看上去不大,原因很简单:我们构建的大部分环境都落在这些基准根本不涉及的领域里。

Dumbbell chart, per environment, of closing the gap to the frontier. For each of fourteen domains a grey dot marks base, a green dot our full-corpus model, and an amber diamond GPT-5.4; the green bar is the gain from base and the faded remainder is the distance still to GPT-5.4. A right-hand strip lists each model's exact Base, Our, and GPT score. Our model nearly doubles the base average to 67.1% and its green dot sits past the diamond on EchoBank and both nested filters, surpassing GPT-5.4.
图 9:各环境与前沿水平的差距收窄情况。绿色条段表示从基线模型到本模型的提升幅度,浅色剩余部分表示与 GPT-5.4 之间尚存的距离。本模型在 EchoBank 和两个嵌套筛选器上超越了 GPT-5.4,在其他环境上也大幅缩小了差距;右侧标注了每个模型的具体分数。

我们构建的领域大多封闭且需要登录,结果却截然相反。在全部十四个领域上,模型表现几乎翻倍,从 36.5% 提升到 67.1%;基线最弱的地方更是跃升了三到九倍,EchoCalendar、EchoML、EchoChat、EchoCare、EchoForge 和 EchoForum 从个位数或刚过两位数跃升至四十分到六十分的区间。这让一个 90 亿参数的模型在平均水平上距 GPT-5.4 仅差 14 个百分点(67.1% 对 80.7%)。在 EchoMail、EchoBank 以及两个嵌套筛选器上,它更是直接追平或击败了这个规模远大的前沿模型;仅在分布内的日期选择器上落后几分。让一个 9B 模型逼近到这个程度的,不是更大的参数量,而是深厚、精准且可验证的训练数据——这恰恰是流水线工厂所擅长生产的。

规模化的收益与局限

我们分别沿两个维度进行扩展:在固定环境集中增加轨迹数量(从各环境中等量采样),以及增加环境的多样性。两者表现迥异。在同一批环境中增加轨迹数,分布内平均分仍在持续提升,但收益逐渐递减;而向真实 Web 场景的迁移能力则基本停滞:从 6,400 增加到 20,000 条轨迹,WebVoyager 几乎不变(54.8% 到 55.6%),Online-Mind2Web 甚至略有下滑(40.1% 到 37.2%)。由于每个采样点都从各环境中均匀抽取,这并非采样偏差所致:每个环境所能提供的可迁移技能是有限的,一旦模型将其充分汲取,更多的轨迹迭代大多只是在打磨已有的能力。

扩大环境规模则得出相反的结果。随着覆盖范围的增长,平均分持续上升,WebVoyager 只有在用上全部环境时才达到最佳表现。对于泛化能力,关键在于多样性,而非体量。模型之所以能触达从未见过的网站,靠的是在各种任务中训练,而不是把同一类任务重复更多遍。

即便如此,规模本身在两个轴上都并非关键杠杆。把大量轨迹预算花在浅层环境上,或用错误的答案来评分,只会拉动合成指标,对真实网页却毫无帮助。真正起作用的是每条轨迹内部的东西——保留真实工作流的任务深度、瞄准智能体所欠缺操作的针对性,以及由数据库支撑的、保持信号可靠的评分机制。

两张折线图,均绘制了合成平均分、WebVoyager 和 Online-Mind2Web 随规模的变化。左侧是在固定环境集中投入更多轨迹,x 轴按实际轨迹数量等距排列,因此点在低数量处密集、向 20,000 拉伸;曲线先陡升后趋于平缓,WebVoyager 走平,Online-Mind2Web 在末段下滑,而合成平均分仅缓慢爬升。右侧是环境从两个领域扩展到十二个领域,合成平均分和 WebVoyager 随覆盖范围的扩大持续攀升。对比表明,将能力迁移到未见网站的关键是环境的多样性,而非轨迹的体量。
图 10:两条规模扩展轴,均未使用 BrowserBase 评分。左侧:在固定环境集中投入更多轨迹,每种环境等量采样,x 轴按实际轨迹数量等距排列。合成平均分持续上升,但真实网页迁移趋于饱和——WebVoyager 走平,Online-Mind2Web 在超过 6,400 条轨迹后下滑。右侧:增加环境数量,覆盖范围的扩大使合成平均分和 WebVoyager 持续攀升。将能力迁移到未见网站的关键是环境的多样性,而非轨迹的体量。

学习的并非只有模型

智能体拿到的分数从来不只是模型本身的功劳,而是整个链路共同作用的结果:智能体、环境、任务、验证器,缺一不可。零分可能意味着模型做错了,也可能是环境本身有故障,或者目标状态根本无法达成,又或者验证器检查的对象不对。把每一次零分都当成模型的监督信号来训练,等于在用本该修复的缺陷当教材。因此,我们把每一次有评分的回放都当作对整条链路的测试,让整条链路一起学习。环境随着损坏的控件和接线被修复而变好,任务随着目标的重新校准和难度提升而变难,验证器在偏离数据时会被纠正。只有经过这三层筛选后仍然存在的失败,才会进入模型的训练课程。

EchoStay 让这一点变得清晰可见。它的失败根源在于环境本身,而不是智能体:一个客人数量控件在预订任务中悄悄失效,导致即使预订逻辑完全正确也无法被识别。修复之后,原本能完成的那部分预订任务完成率从 48% 提升到 78%,此前被挡住的 24 个任务中救回了 15 个。同样的循环在其他环境里也发现了不同的问题:EchoForum 需要修复前端并加快页面加载速度,一组原本 37 个全部失败的任务因此变成 36 个可通过;EchoChat 的验证器已经和实际数据脱节,重新对齐后,可评分任务的占比从 34% 提升到 99%;EchoCare 需要一次状态接线的修复;EchoForge 的后端逻辑没问题,却缺少一个能触发它的界面控件。

随着环境质量提升,模型的能力也随之水涨船高。在 EchoStay 上跑两轮循环后,基于其语料训练的模型得分从 16.2% 翻了一倍多,达到 38.5%,相当于追上了 GPT-5.4(50.4%)三分之二的距离。模型并不是唯一在学习的东西;它是当所有底层都学会之后,才开始产生复利效应的那一个。

Bar chart of the model's score on EchoStay before and after one co-evolution round. As the world went from v1 to v2 the model more than doubled, from 16.2% to 38.5%, shown against GPT-5.4's 50.4% reference.
图 11:协同进化提升了模型在 EchoStay 上的表现。世界从 v1 演进到 v2 后,基于该世界训练的模型得分翻了一倍多,从 16.2% 升至 38.5%,这与世界自身的解题率是独立的指标。得分越高越好。

在可控环境中,修补世界和训练模型之间的边界很容易把握,因为两者都可检查。但开放的互联网抹掉了这条边界:没有世界可在任务中途修补,当操作落空时,正确性完全取决于智能体能否察觉并改弦更张。这正是世界模型最需要教会智能体的事,也是开放互联网最不留情面的地方。

从 SFT 到 RL:把世界变成 RLE

目前所有结果都来自模仿学习:9B 模型照搬 GPT-5.4 成功完成的轨迹。但模仿学习存在天花板:干净的标准示范从不展示如何从错误中恢复、何时该及时收手,而这些恰恰是在真实场景中击垮智能体的失败模式。强化学习直接优化我们评分的目标结果,让模型从自身轨迹中学习,而非依赖教师示范。

然而,强化学习需要一个可大规模驱动的 RL 环境(RLE)。每次 rollout 都需要重置到已知状态、需要并行采样的吞吐量,以及一个可信的奖励信号,同一个任务会重复运行上千次。开放互联网不是 RLE:它无法重置,每次 rollout 的起始状态各不相同;它在远未达到 RL 所需的规模前就会限流甚至封禁自动化流量;而且它不暴露真值,只提供截图让另一个模型来评判,于是奖励和评判器一样充满噪声,策略学到的也只是评判器的盲点,而非任务本身。Echoverse 在设计上就是 RLE:每个世界都是一个独立应用,每次 rollout 时快照保存并重置,支持并行运行,并从自有数据库中评分——因此筛选 SFT 数据时所用的验证器能给出有据可查、可验证的奖励,而非从像素中推断的奖励。同一套世界,既是智能体的基准,也是训练场。

Left-to-right block diagram of reinforcement learning on an Echoverse RL environment. A policy pi-theta, initialised from the SFT checkpoint, rolls out a group of G trajectories inside an Echoverse RLE drawn as a stack of worlds; within one world the agent repeats act and execute steps that change a database. Outside the environment, a grader, the grounded verifier, reads each rollout's final database state and returns a reward. The group of rewards updates the policy with a policy-gradient step and a KL penalty to a reference, and the loop repeats across every training world.
图 12:在 Echoverse RLE 上进行强化学习。从 SFT 策略出发,在一个世界中采样一组轨迹;每条轨迹由一系列 act 与 execute 步骤组成,不断修改数据库。一位评分器(即过滤 SFT 数据时所用的同一个 grounded verifier)位于环境外部,根据每条轨迹最终的数据库状态打出奖励。一组奖励共同更新策略,然后循环在每个训练世界上重复执行。

我们以 SFT 模型作为初始策略,在五个世界上运行 RL:EchoBank、EchoForge、EchoForum、EchoStay 和 EchoTunes。任务取自各世界中 SFT 策略仍有提升空间的较难部分,每次更新都基于多条已评分的轨迹。每条轨迹获得两项奖励:一项来自以数据库为依据的验证器(LLM judge GPT-4.1)打出的轨迹级奖励,另一项来自多模态 judge(GPT-4.1 vision)对每张截图逐帧打分得到的稠密步级奖励。我们在 SFT 数据之外,每个世界大约 100 个任务上训练两个 epoch。在每个世界 25 道题的留出测试集上,评分从 58% 提升到 69%。老师教了它做什么,世界教了它何时收手、何时补救、何时放弃。

两条折线图,展示五个世界上的强化学习训练过程。左侧为保留集验证评分(每世界 25 个任务),从 58.8% 上升到 69.6% 的峰值,最终稳定在约 68%。右侧为评论器的平均评分(RL 奖励信号)及其五步滑动平均,经过六十步从约 0.5 上升到 0.6。
图 13:五个世界、两个 epoch 上的强化学习。左侧:保留集评分(每世界 25 个任务)从 58% 攀升到 69%。右侧:作为 RL 奖励信号的评论器平均评分在整个训练过程中持续上升。该奖励由两部分相加:一是基于数据库的验证器(LLM 评判器 GPT-4.1)给出的轨迹奖励,二是多模态评判器(GPT-4.1 视觉)给出的逐步稠密奖励。

现状与展望

"世界"不再是用于打分的固定基准,而是一张可以持续打磨的训练场——同一次分级运行,既在衡量模型,也在精进评判它的世界。深度世界迁移时能保住能力,而浅层克隆则会拉低能力;同一个小组件被重做成上百种形态,教会了一项迁移到真实网页上的技能;协同进化让两端同步前进;在同一批世界里做强化学习,让智能体超越了模仿,既提升了保留集表现,又减少了冗余步骤。

真正持久的优势不是拥有最大的合成网站库存,而是一座工厂:诊断出智能体还做不好的事,建造或修补能教会它的世界,守护已得的能力,然后再次启动循环。下一阶段要同时推进三条战线。其一,为公开基准无法触及的封闭领域打造更多深度世界。其二,为模型反复失败的交互场景构建更多能力世界。最关键的,是围绕这些有据可依的世界做更多强化学习——更长的训练、更难的任务、更广的奖励探索,把智能体的行为和表现推向模仿永远无法抵达的高度。这些杠杆相互叠加:更深更广的世界带来更强的 RL,更强的 RL 反过来提升智能体,而每一轮循环又会暴露下一项需要构建的能力。

我们公开了工厂的一部分:四个世界的环境代码与分级测试任务,包括两个深度领域(EchoStay 和 EchoForge)以及两个能力世界(datepicker 和 nested-filter,每个都包含分布内与留出两部分)。每个任务都配有基于数据库的验证器进行打分,因此这些世界既可以用于智能体评测,也可以用于训练。代码与任务地址:https://aka.ms/echoverse

当世界随着智能体能力的提升而持续生长时,评估就不再仅仅是一块记分牌,而是驱动下一步该造什么的引擎——与所训练的智能体一同进化的世界。

致谢

我们感谢 Alexey Taymanov、Andrew Zhao、Aravind Rajeswaran、Corby Rosset、Hussein Mozannar、Luiz Do Valle、Sara Abdali、Spencer Whitehead、Vibhav Vineet、Zach Nussbaum、Yadong Lu、Pashmina Cameron、Rafah Hosn 和 Chinmay Karkar 在整个研究过程中给予的宝贵帮助、富有洞见的讨论和持续支持。

在新标签页中打开

相关论文

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

认识作者

Akshay Nambi 的肖像

Akshay Nambi

首席研究员

了解更多 Yash Pandya 的肖像

Yash Pandya

高级研究工程师

了解更多 Sahil Gupta 的肖像

Sahil Gupta

研究实习生

了解更多 Sarthak Harne 的肖像

Sarthak Harne

研究员

微软研究院

了解更多 Archana Yadav 的肖像

Archana Yadav

软件工程师 2

Kavyansh Chourasia 的肖像

Kavyansh Chourasia

研究 SDE 2

了解更多 Yash Lara 的肖像

Yash Lara

高级 PM

了解更多 Ahmed Awadallah 的肖像

Ahmed Awadallah

合伙人研究经理

了解更多 Ece Kamar 的肖像

Ece Kamar

AI Frontiers 实验室副总裁兼总监

研究方向

原始来源: 微软研究院

评论 (0)