Echoverse:为计算机使用智能体打造的深度演进训练环境
与其追求数量,不如提升保真度——瞄准智能体真正欠缺的能力,并随训练模型的成长而持续演进。

我们为计算机使用类智能体构建了十二个训练世界:十个深度领域世界和两个能力世界,每个世界围绕同一种控件(日期选择器、嵌套筛选器等)以多种形式反复训练。深度是这些世界值得训练的关键:它们复刻了应用程序的真实行为,预置了真实数据,并在各页面和各用户之间保持状态一致。在全部十二个世界上训练后,一个 9B 模型的得分几乎翻倍(从 36.5% 提升到 67.1%),与 GPT-5.4 仅差十四分。这次实验带给我们几点启示:
- 高仿真保真度不可或缺;浅层世界反而会损害智能体。在同一站点的浅层与深层版本上分别训练,模型在浅层版本上出现了退步,在深层版本上则取得了提升。
- 智能体往往在同一些棘手的 UI 元素上反复栽跟头,比如日期选择器和嵌套筛选器。以多种形式反复演练这些控件,使模型在训练中未见过的领域也能操作它们。
- 让模型、世界和验证器协同演进,三者都能从中获益。随着世界变得更准确、任务变得更困难,模型的能力也随之提升。
- 在世界之上进行强化学习,能让智能体突破单纯模仿的上限。以真实验证器作为奖励信号,强化学习不仅提升了在留出测试集上的表现,还教会了智能体用更少的步骤达成目标。
- 我们将发布其中四个世界,附带代码、数据和真实评分器,以支持面向高保真计算机使用世界的研究。
Github:microsoft/Echoverse:面向计算机使用 Agent 的深度、演进环境(在新标签页中打开)
Hugging Face:microsoft/Echoverse · Hugging Face 上的数据集(在新标签页中打开)
技术报告:https://www.microsoft.com/en-us/research/publication/echoverse-deep-evolving-environments-for-training-computer-use-agents-at-scale/
计算机使用 Agent 只有在动作产生真实后果的地方才能学到结果。一次点击会改变已保存的状态,一条消息会送达真实的人,或者一个拒绝跳转的页面会告诉 Agent 它上一步什么都没做。截图能展示界面的样子,但只有一个真正运行的世界才能展示一个动作造成了什么。
值得学习的后果是有状态的,而且其中大部分都藏在登录墙后面。人们希望自动化的任务存在于封闭系统中:邮件和聊天、银行、健康记录、云与 ML 的内部控制台。你没法用这些系统的线上版本来训练 Agent —— 每一次尝试都会写入真实账户,尝试之间无法重置,真实状态隐藏在屏幕背后。因此你需要把系统重建为一个合成世界,在那里数据库归你所有:状态是真实的,也会真实地变化,但可以放心地弄坏、能快速重置,并且依据数据而非截图来评分。
Azure AI Foundry Labs
通过这些来自微软研究院的实验性技术,一窥 AI 未来可能的发展方向。
Azure AI Foundry 在新标签页中打开我们所称的"世界",包含三层紧密相连的东西:一个环境(即应用程序、其状态以及改变状态的操作)、在其中设定目标的任务,以及一个根据真实结果打分的验证器。社区目前已能熟练地构建这些:流水线负责部署应用、初始化数据、生成任务并挂载验证器,由此产出数百个环境和数千个可校验的任务。本文正是建立在这些进展之上。然而,当世界数量不再是瓶颈时,真正的瓶颈变成了其内部结构:无论状态在多用户、多屏幕间能否保持一致、工作流能否维系依赖关系、一个薄弱的技能能否以足够多的形式出现从而实现泛化,以及成功究竟该由结果还是外观来判定。
Echoverse 所验证的判断是:真正的杠杆不在于堆砌更多世界,而在于一个能让既有世界持续变好的闭环。它把"构建环境"和"训练模型"视为同一个过程,而非两个独立阶段:在世界中运行模型、找出失败点、让世界及其任务与验证器在该处更贴近现实或更具挑战性、再用更锐利的信号训练、然后循环往复。普通的微调只改进模型本身;而在这里,每一次带评分的运行既在衡量模型,也在改进评判它的世界。于是静态基准会饱和,而闭环则在不断累积。
让该闭环保持活力的有三个杠杆,没有一个靠堆环境数量取胜。深度:为目标领域——包括那些封闭的、专有的领域——打造行为层面足够忠实的世界。能力定向:围绕模型反复失败的特定交互,量身构建窄而精的世界。共同演化:在每一次带评分的运行中同时改进环境、任务与验证器,而非只更新模型。
为什么要用合成环境?为什么要做深?
那些无需登录的开放站点看似可以让我们绕开合成环境的必要性,但它们其实是糟糕的训练场,原因完全不同:它们不会保持静止。页面会被重新设计,房源列表和日期会向前滚动,宿主服务还会限速甚至封禁自动化流量——因此,绑定在这些站点上的基准会随时间漂移,每次跑出来的环境都不一样。偶尔做一次评测还能容忍这种漂移,但训练不行,因为同一个任务要跑上千次,每次都需要一模一样的环境。合成环境在时间和数据上是冻结的:日历不会走动,种子数据不会变化,第一千次 rollout 上的任务含义与第一次完全相同。我们用一点点表层真实感的损失,换来一个完全可控的世界。
可控只是底线。一个环境可以做到完美稳定,却仍然是空洞的。所以真正值得花训练时间的是深度:不是页面数量,而是它能在多大程度上保留真实工作流的因果结构。衡量深度的有五项标准:行为保真度(控件、权限和报错都符合产品的逻辑);状态一致性(发出的消息会在收件人那里出现,取消的会议会在双方的日历上同时清除);工作流深度(早期的选择会约束后续走向);权威验证(以应用状态为准,而非像素);以及领域价值(这个工作流值得被改进)。在真正重要的系统里,难度集中在权限、共享状态和审计历史中——而这恰恰是浅层克隆会跳过的结构。越过这条线,更多环境带来多样性;没越过这条线,更多环境只会带来噪声。
Echoverse 工厂是如何运作的?
Echoverse 是一条单一流水线,有两个产出:保留完整工作流深度的全领域世界,以及只改变某一诊断交互的能力世界。两者都依托于同一个事实——我们掌握底层数据库,因此任务是否成功取决于应用自身的状态,而非模型对截图的解读。
构建世界
流水线先把少量种子场景扩展成规格说明,再编译成关于路由、状态和行为的机器可校验声明。声明就绪后才开始生成应用:FastAPI + SQLite 后端搭配 React 前端。新生成的应用只是一个假设,还不是世界:构建器针对每条声明在运行环境中逐一验证,必要时修复数据库、后端或前端,直到全部通过,然后写入一份就绪记录,将硬性阻塞和一般性风险分开。存在未解决阻塞的世界不会进入下一阶段。这里的"深度"不是写在提示词里的承诺,而是这个世界已被验证通过的那份声明清单。
扩充语料
即使一个世界构建得很干净,也还不能直接当作训练数据。我们针对每个任务在实时数据库上重新落地,从真实存在的实体中抽取目标,再把每个目标送进一组分析器:目标中的实体是否真实?目标本身是否合理?难度与工作量是否匹配?最后还有最严格的一道关——驱动真实界面运行的智能体能否完成它?这最后一步在浏览器中执行,能在模型介入之前就拦下任何界面无法满足的目标。生成的目标只是一项声明;针对真实应用完成求解才算证明。
每一次失败都会变成一条带标签的工单,标明需要修改的层级:数据库、后端、前端、任务文本或验证器。各层专用的修复器负责打补丁,针对运行中的应用重新校验,一旦引发回归就回滚。这个循环会依据数据库真值反复打分,直到通过率不再上升;每个存活下来的任务在导出时都附带判定它成绩的精确检查。这些任务成为训练数据的路径只有一条:GPT-5.4 求解每个任务,验证器把通过真值校验的轨迹保留下来,最终作为下文所有实验的有监督微调(SFT)数据。
构建世界与扩充语料不是两个独立阶段,而是同一个闭环:大多数缺陷出在世界本身,因此每次迭代我们都重新版本化环境。更难的任务会暴露世界的短板,更坚固的世界又能承载更难的任务——每一轮循环下来,两边都会变得更强。

验证器以数据库为锚
每条任务都自带一份答案——由生成时的一条 SQL 查询从真实数据库中铸成的一个值或一次状态变更,构造上即为真,并在智能体完成后再次复核。读类按与存储值的语义等价度打分(288 美元和 287.62 美元算通过);写类按真实的数据库 before/after 差异打分,所以除非工单那一行真的翻了状态,否则声称"已关闭"即为失败;读写合一类取两者中较低的分。评分难以被钻空子,以锚定为依据而非人工标注,且在 EchoStay 订房、EchoForge 工单、EchoBank 转账之间保持一致。
完整领域承载完整工作流
真正重要的任务集中在公开基准最难触及的领域:封闭的、私有的系统——难度来自权限、共享状态和历史,而非界面布局。一个忠实的克隆必须复刻这一点。重要的不是像素,而是操作的后果能否跨页面、跨用户贯穿始终,使任务能运行一段真实的工作流,并按其留下的状态打分。
十个 Echo 领域涵盖通信、技术工作、监管记录、社区、媒体和旅行。如果存在丰富的公开数据集,我们就直接基于它来构建:EchoStay 以 InsideAirbnb 为种子,因此其房源、房东、评论和配套设施都是真实的而非虚构的;EchoForum 则依托一个包含 255 万条评论的公开论坛语料库。当没有现成数据时(如邮件、日历、银行和健康记录),我们通过种子数据生成管道在严格约束下生成状态——数据密集且内部自洽,而不是少量占位行。
| 工作流类别 | 环境 | 世界需要承载的深度 |
|---|---|---|
| 通信与协作 | EchoMail、EchoCalendar、EchoChat | 共享会话线程、日程安排、参与人、权限、历史记录 |
| 技术创建与运维 | EchoML、EchoForge | 制品产物、配置、依赖关系、角色、多阶段变更 |
| 监管记录与交易 | EchoBank、EchoCare | 余额或记录、授权、审计历史、影响重大的写入操作 |
| 社区、媒体与旅行 | EchoForum、EchoTunes、EchoStay | 持久化偏好、社交状态、搜索、预订、账户操作 |
正是这些累积的状态,使得一个操作的后果能够跨越不同界面和用户。在 EchoStay 中,一次预订要经由搜索、房源展示、可用性和支付等环节,跨越约 87 条路由和 23 张表,却连一个确认页面都没有;一条 EchoMail 会话线程承载着从起草到发送、回复和标签状态的完整意图;EchoCare 中的每一条医嘱都会写入审计日志。正因如此,这些任务代价高昂,往往需要五到二十步操作才能完成,且只有在底层状态真正改变后才算结束。

能力世界:聚焦单一技能
并非所有短板都源于缺少某个领域——有些仅仅是因为代理无法稳定操作某个特定控件。设想一个代理在预订行程:它搜索、筛选、打开合适的房源,最后却卡在日期选择器上,无法把"三月的第二周"转化为在陌生日历控件上的正确点击操作。再造一个预订网站并不能解决这类问题。只有让同一种控件以足够多样的形式反复出现,这项技能才能被真正习得。日期选择器和嵌套式筛选搜索在真实网页上无处不在,却以千百种方式呈现——这种多样性恰恰是任何单一深度应用都无法提供的。
因此,我们把控件单独抽离出来,在不同的布局、状态和约束下大量复用,然后基于每种变体生成具体任务。日期选择器世界将同一种日期控件渲染为六种核心组件,分布在 10 种上下文场景中,并额外预留 10 种未参与训练的全新变体——从日历热力图到滚轮选择器、财政季度选择器等;其中最具难度的任务要求把"转写"升级为"推理",需要将"2026 年 1 月最后一个周四"或"起始日期之后的第 10 个工作日"解析为唯一精确且可通过控件到达的日期。嵌套筛选世界涵盖 20 种组件类型,并将 9 种复合面板类型留作分布外测试集;每次提交都按照筛选结果是否真正满足所要求的条件来评分,评判依据是应用自身的业务逻辑,而非界面外观。


更深、更具针对性的环境带来了什么
更多的轨迹并不自动带来更多的训练信号。关键在于深度:一个回合是否能在真实工作流的依赖步骤中贯穿整个任务,而不是孤立地重复某个动作。两个实验从相反的方向把这一区别讲清楚:一个在完整领域上做得更深,另一个则聚焦于一项失效的技能。
浅层环境适得其反;深层环境才能迁移
浅层环境是廉价的方案。它搭建迅速,看起来也像模像样,却只演练了那些看似正确、彼此孤立的点击。模型若在这样的环境上训练,就会学到错误的反应模式——过度操作、来回打转、重复无效动作——因为简单的环境从不为此付出代价。深层环境的成本更高,但它的轨迹承载了真实网站所需的依赖结构,能够实现有效迁移。
为了把这一点拆解清楚,我们选取两个实时 WebVoyager 站点——Allrecipes 和 Hugging Face——并对比三个模型版本:基线模型,以及两个分别在"浅层世界"和"深层世界"轨迹上训练得到的模型。浅层世界给出的任务短小且自包含;深层世界给出的任务则跨越多个相互依赖的步骤,某个早期操作会改变后续的状态、可选项以及校验方式。两者让模型接触的领域知识完全相同,唯一不同的是任务深度。评测时使用这些领域在公开 WebVoyager 基准上的任务,在脱离任何训练环境的真实站点上运行。
在 Allrecipes 上,浅层世界反而把模型从 80.0% 拉低到 75.0%;在 Hugging Face 上则维持 48.0% 不变。只有深层世界同时提升了两个站点,把 Allrecipes 提升到 85.0%,把难度更高的 Hugging Face 部分提升到 65.0%。在领域接触量相同的前提下,差距就来自深度:深层模型陷入循环的次数更少,在 37 个 Hugging Face 任务中,耗尽步数预算的任务从 15 个降到 9 个。拉开两者距离的并非模型"看"到了多少,而是它看到的东西是否保留了真实工作的结构。

聚焦某一项能力的精度
日期选择器和嵌套筛选这两个训练场景,恰好对应评估中暴露出的薄弱控件,而且这两项能力还能相互强化:专项训练后,日期选择器的分布内评估从 60.0% 提升到 82.6%,未见过的布局从 34.0% 提升到 54.0%;嵌套筛选在未见过的测试集上从 62.8% 提升到 84.1%。这种在从未训练过的表单上仍然有效的提升,说明模型学到的是规则本身,而非死记布局。两个能力之间是相互迁移而非相互竞争:单独训练其中任何一项,另一项的得分也会跟着上涨;而两者一起训练,在所有测试维度上都表现最好。拿 GPT-5.4 作为前沿参照,这个组合模型在嵌套筛选上已经略微领先,在日期选择器分布内任务上也追平了大部分差距,只有在未见过的日期选择器上明显落后。更重要的是,这条规则同样适用于真实的互联网——在从未接触过的网站上,把 Online-Mind2Web 的成功率从 29.5% 提升到了 34.3%。

从合成环境到真实互联网
本节后续实验涉及三款模型。Base 是在 Qwen3.5-9B 的基础上,仅喂入少量合成轨迹数据,使其能基本对齐浏览器操作空间而做的轻量微调。我们的模型(Our model)则是同一个 9B 参数网络在整个合成数据集上训练得到的。GPT-5.4 作为参数规模远大的前沿模型,用作参考上限。
训练学到的技能在真实互联网上还管用吗?我们将模型完全不变地放到 WebVoyager 和 Online-Mind2Web 上测试,这两个基准模型从未训练过。它们与我们构建的内容重叠极少:两个测试都以开放的公共站点和只读式浏览为主,而我们训练的是需要登录、以写操作为主的工作流。本来的目标就不是追求大幅跃升,而是看趋势走向。这个冻结模型在这两项测试上都超过了基座模型:WebVoyager 从 66.5% 提升到 71.5%,Online-Mind2Web 从 40.5% 提升到 43.4%(不使用 BrowserBase 时,分别为 50.9% 提升到 52.9%、29.5% 提升到 37.2%),这些分数都是通过 BrowserBase 跑出来的,因为托管浏览器去除了数据中心的反爬拦截和限速,否则任何智能体的分数都会被压低。训练数据里没有来自真实互联网的数据,所以这是迁移泛化,而不是死记硬背。

在真实互联网上提升不大是覆盖范围的问题,不是能力天花板:如果瞄准某个真实领域的场景训练,分数就会涨上去。我们打造的代码托管环境 EchoForge 与 GitHub 属于同类应用,而 GitHub 正是 WebVoyager 测试的真实站点之一。把 EchoForge 加入训练后,真实 GitHub 上的得分从 58.5% 提升到 63.4%,整体真实测试分数也水涨船高(WebVoyager 从 50.9% 到 52.9%,Online-Mind2Web 从 29.5% 到 31.1%)。平均涨幅看上去不大,原因很简单:我们构建的大部分环境都落在这些基准根本不涉及的领域里。

我们构建的领域大多封闭且需要登录,结果却截然相反。在全部十四个领域上,模型表现几乎翻倍,从 36.5% 提升到 67.1%;基线最弱的地方更是跃升了三到九倍,EchoCalendar、EchoML、EchoChat、EchoCare、EchoForge 和 EchoForum 从个位数或刚过两位数跃升至四十分到六十分的区间。这让一个 90 亿参数的模型在平均水平上距 GPT-5.4 仅差 14 个百分点(67.1% 对 80.7%)。在 EchoMail、EchoBank 以及两个嵌套筛选器上,它更是直接追平或击败了这个规模远大的前沿模型;仅在分布内的日期选择器上落后几分。让一个 9B 模型逼近到这个程度的,不是更大的参数量,而是深厚、精准且可验证的训练数据——这恰恰是流水线工厂所擅长生产的。
规模化的收益与局限
我们分别沿两个维度进行扩展:在固定环境集中增加轨迹数量(从各环境中等量采样),以及增加环境的多样性。两者表现迥异。在同一批环境中增加轨迹数,分布内平均分仍在持续提升,但收益逐渐递减;而向真实 Web 场景的迁移能力则基本停滞:从 6,400 增加到 20,000 条轨迹,WebVoyager 几乎不变(54.8% 到 55.6%),Online-Mind2Web 甚至略有下滑(40.1% 到 37.2%)。由于每个采样点都从各环境中均匀抽取,这并非采样偏差所致:每个环境所能提供的可迁移技能是有限的,一旦模型将其充分汲取,更多的轨迹迭代大多只是在打磨已有的能力。
扩大环境规模则得出相反的结果。随着覆盖范围的增长,平均分持续上升,WebVoyager 只有在用上全部环境时才达到最佳表现。对于泛化能力,关键在于多样性,而非体量。模型之所以能触达从未见过的网站,靠的是在各种任务中训练,而不是把同一类任务重复更多遍。
即便如此,规模本身在两个轴上都并非关键杠杆。把大量轨迹预算花在浅层环境上,或用错误的答案来评分,只会拉动合成指标,对真实网页却毫无帮助。真正起作用的是每条轨迹内部的东西——保留真实工作流的任务深度、瞄准智能体所欠缺操作的针对性,以及由数据库支撑的、保持信号可靠的评分机制。

学习的并非只有模型
智能体拿到的分数从来不只是模型本身的功劳,而是整个链路共同作用的结果:智能体、环境、任务、验证器,缺一不可。零分可能意味着模型做错了,也可能是环境本身有故障,或者目标状态根本无法达成,又或者验证器检查的对象不对。把每一次零分都当成模型的监督信号来训练,等于在用本该修复的缺陷当教材。因此,我们把每一次有评分的回放都当作对整条链路的测试,让整条链路一起学习。环境随着损坏的控件和接线被修复而变好,任务随着目标的重新校准和难度提升而变难,验证器在偏离数据时会被纠正。只有经过这三层筛选后仍然存在的失败,才会进入模型的训练课程。
EchoStay 让这一点变得清晰可见。它的失败根源在于环境本身,而不是智能体:一个客人数量控件在预订任务中悄悄失效,导致即使预订逻辑完全正确也无法被识别。修复之后,原本能完成的那部分预订任务完成率从 48% 提升到 78%,此前被挡住的 24 个任务中救回了 15 个。同样的循环在其他环境里也发现了不同的问题:EchoForum 需要修复前端并加快页面加载速度,一组原本 37 个全部失败的任务因此变成 36 个可通过;EchoChat 的验证器已经和实际数据脱节,重新对齐后,可评分任务的占比从 34% 提升到 99%;EchoCare 需要一次状态接线的修复;EchoForge 的后端逻辑没问题,却缺少一个能触发它的界面控件。
随着环境质量提升,模型的能力也随之水涨船高。在 EchoStay 上跑两轮循环后,基于其语料训练的模型得分从 16.2% 翻了一倍多,达到 38.5%,相当于追上了 GPT-5.4(50.4%)三分之二的距离。模型并不是唯一在学习的东西;它是当所有底层都学会之后,才开始产生复利效应的那一个。

在可控环境中,修补世界和训练模型之间的边界很容易把握,因为两者都可检查。但开放的互联网抹掉了这条边界:没有世界可在任务中途修补,当操作落空时,正确性完全取决于智能体能否察觉并改弦更张。这正是世界模型最需要教会智能体的事,也是开放互联网最不留情面的地方。
从 SFT 到 RL:把世界变成 RLE
目前所有结果都来自模仿学习:9B 模型照搬 GPT-5.4 成功完成的轨迹。但模仿学习存在天花板:干净的标准示范从不展示如何从错误中恢复、何时该及时收手,而这些恰恰是在真实场景中击垮智能体的失败模式。强化学习直接优化我们评分的目标结果,让模型从自身轨迹中学习,而非依赖教师示范。
然而,强化学习需要一个可大规模驱动的 RL 环境(RLE)。每次 rollout 都需要重置到已知状态、需要并行采样的吞吐量,以及一个可信的奖励信号,同一个任务会重复运行上千次。开放互联网不是 RLE:它无法重置,每次 rollout 的起始状态各不相同;它在远未达到 RL 所需的规模前就会限流甚至封禁自动化流量;而且它不暴露真值,只提供截图让另一个模型来评判,于是奖励和评判器一样充满噪声,策略学到的也只是评判器的盲点,而非任务本身。Echoverse 在设计上就是 RLE:每个世界都是一个独立应用,每次 rollout 时快照保存并重置,支持并行运行,并从自有数据库中评分——因此筛选 SFT 数据时所用的验证器能给出有据可查、可验证的奖励,而非从像素中推断的奖励。同一套世界,既是智能体的基准,也是训练场。

我们以 SFT 模型作为初始策略,在五个世界上运行 RL:EchoBank、EchoForge、EchoForum、EchoStay 和 EchoTunes。任务取自各世界中 SFT 策略仍有提升空间的较难部分,每次更新都基于多条已评分的轨迹。每条轨迹获得两项奖励:一项来自以数据库为依据的验证器(LLM judge GPT-4.1)打出的轨迹级奖励,另一项来自多模态 judge(GPT-4.1 vision)对每张截图逐帧打分得到的稠密步级奖励。我们在 SFT 数据之外,每个世界大约 100 个任务上训练两个 epoch。在每个世界 25 道题的留出测试集上,评分从 58% 提升到 69%。老师教了它做什么,世界教了它何时收手、何时补救、何时放弃。

现状与展望
"世界"不再是用于打分的固定基准,而是一张可以持续打磨的训练场——同一次分级运行,既在衡量模型,也在精进评判它的世界。深度世界迁移时能保住能力,而浅层克隆则会拉低能力;同一个小组件被重做成上百种形态,教会了一项迁移到真实网页上的技能;协同进化让两端同步前进;在同一批世界里做强化学习,让智能体超越了模仿,既提升了保留集表现,又减少了冗余步骤。
真正持久的优势不是拥有最大的合成网站库存,而是一座工厂:诊断出智能体还做不好的事,建造或修补能教会它的世界,守护已得的能力,然后再次启动循环。下一阶段要同时推进三条战线。其一,为公开基准无法触及的封闭领域打造更多深度世界。其二,为模型反复失败的交互场景构建更多能力世界。最关键的,是围绕这些有据可依的世界做更多强化学习——更长的训练、更难的任务、更广的奖励探索,把智能体的行为和表现推向模仿永远无法抵达的高度。这些杠杆相互叠加:更深更广的世界带来更强的 RL,更强的 RL 反过来提升智能体,而每一轮循环又会暴露下一项需要构建的能力。
我们公开了工厂的一部分:四个世界的环境代码与分级测试任务,包括两个深度领域(EchoStay 和 EchoForge)以及两个能力世界(datepicker 和 nested-filter,每个都包含分布内与留出两部分)。每个任务都配有基于数据库的验证器进行打分,因此这些世界既可以用于智能体评测,也可以用于训练。代码与任务地址:https://aka.ms/echoverse
当世界随着智能体能力的提升而持续生长时,评估就不再仅仅是一块记分牌,而是驱动下一步该造什么的引擎——与所训练的智能体一同进化的世界。
致谢
我们感谢 Alexey Taymanov、Andrew Zhao、Aravind Rajeswaran、Corby Rosset、Hussein Mozannar、Luiz Do Valle、Sara Abdali、Spencer Whitehead、Vibhav Vineet、Zach Nussbaum、Yadong Lu、Pashmina Cameron、Rafah Hosn 和 Chinmay Karkar 在整个研究过程中给予的宝贵帮助、富有洞见的讨论和持续支持。
在新标签页中打开相关论文
Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale
认识作者
Akshay Nambi
首席研究员
了解更多
Yash Pandya
高级研究工程师
了解更多
Sahil Gupta
研究实习生
了解更多
Sarthak Harne
研究员
微软研究院
了解更多
Archana Yadav
软件工程师 2
Kavyansh Chourasia
研究 SDE 2
了解更多
Yash Lara
高级 PM
了解更多
Ahmed Awadallah
合伙人研究经理
了解更多
Ece Kamar
AI Frontiers 实验室副总裁兼总监
研究方向
