← 文章 / AI视频与短剧
InfoQ 7小时前 · 2026-09-23 23:12:29 · 2 阅读

人人都在造世界模型,HappyWorld‑Bench 试着给出一张统一考卷

你有没有看过一个视频,里面有一个机器人在表演,机械夹爪伸向桌面,夹住托盘,向上抬起,它动作流畅,画面逼真,看起来没什么问题。

但如果暂停视频,仔细看托盘底部:你会发现托盘根本没有离开桌面。夹爪抬起来了,托盘也跟着“移动”了,两者之间该有的物理结果并没有发生。模型完成了一段视频,却没有完成这个动作,这是一个视频,但不是现实。

这正是世界模型今天面临的尴尬。大家已经很会“生成”一个“看起来像世界”的东西,但假的真不了。汽车撞上障碍物,应该停下或者变形;杯子被放进抽屉,关上抽屉后它不能凭空消失;把一辆黑车改成红车,旁边的楼不该跟着换颜色。现实世界里,这些事情不需要解释,因为世界有因果,世界是物理的。

但在生成模型中,每一件都可能出错,每一件都可能是幻觉,但带给大家更大的幻觉是,现在大家都说自己在做世界模型。

Google DeepMind 的 Genie 3 在生成可探索的视频世界,World Labs 的 Marble 尝试重建三维空间,具身智能公司则希望机器人先在模型里“想象”动作后果,再决定下一步怎么做 

一个像导演,一个像建筑师,还有一个像机器人教练。他们从不同角度构建世界模型,也共享着世界模型的概念

三类选手参加三种比赛,用三套规则,最后各自拿着成绩宣布领先。

世界模型行业有点像一所没有统考的学校:每个科目独立出题排名,但是否能被行业应用录取,最终需要综合成绩进行排名。

今年云栖大会上发布了 HappyWorld-Bench,它想把试卷统一起来。

急着造宇宙,托盘还没“抬”起来

HappyWorld-Bench 没有从“什么技术路线才算世界模型”开始争论,而是换了一个更实用的问法:一个模型,至少要会做什么,才说明它真的掌握了一部分世界规律?

  • 表征,是记住这个世界里有什么。桌上有一个杯子,门后有一把椅子,刚才有人把钥匙放进了抽屉。视角变了、物体被挡住了,但这些东西也绝对不能从模型的“记忆”里消失,这是物理;

  • 预测,是知道动作会带来什么后果。推箱子和抬箱子不一样,向左转和向右转也不一样。模型不能只是让画面动起来,而要让变化与动作对应,这是因果;

  • 交互,则是在事情发生之后更新状态。门已经打开,后面的世界就要建立在“门是开的”这个事实上继续运行。不能下一秒又假装什么都没发生,这是现实。

你以为做起来很简单?并不。

HappyWorld-Bench 把世界模型的能力分成 W1 到 W6 六级。

  • W1 先考“看见”:语义别错,空间别乱,短时间内保持连贯;

  • W2 开始考“动手”:智能体采取一个动作,物体和环境要给出合理反应;

  • W3 考记性。一个东西被遮住了,换个视角再回来,它还应该在那里;走过的房间、移动过的物体、已经发生的事件,都必须要继续留在世界状态中;

  • 到了 W4,用户可以主动修改世界。让晴天变成雨天,让黑车变成红车,甚至改变某种行为规则。改动要生效,但不能影响无关内容;

  • W5 更远。世界可以继续扩展,多个智能体生活在里面,互相通信、合作,也可能争抢资源;

  • W6 则是目前最接近“终极大题”的一级:生成、仿真、交互和规划被放进同一个系统,模型能够跨环境、跨任务、跨模态运行。

简单说,就是:看得见,推得动,记得住,改得了,扩得开。最后,才谈得上一个通用世界。

不过,这次公布的 1692 个评测案例主要覆盖 W1 到 W5。W6 已经写进能力框架,但还没有真正被这套数据充分测量。它更像试卷最后那道暂时没人能完整作答的题。托盘,还是不一定能“抬”起来。

“看得爽”说了不算

给语言模型判卷,很多时候还能找到一个标准答案。给世界模型判卷,麻烦得多。一段视频是否“好看”,人很容易判断。但它是否遵守物理规律、保存了历史状态、正确响应了操作,“看得爽”说了不算。

所以,HappyWorld-Bench 保留了视频、空间重建和具身三条赛道,同时用相同的能力层级去描述它们。

每个测试案例都要经过构造输入、匹配能力等级、人工复核和编写判据几个步骤。重点在最后一步:不能只写“机器人成功抬起托盘”,而要继续说明,画面的哪个区域、哪个时间点,应该出现什么结果。

托盘离开桌面后,底部应该出现间隙。

这才是判据。

类似地,把黑车改成红车,不只是检查车身颜色。评测还要看道路、背景建筑和其他车辆有没有被误改。模型如果完成了命令,却顺手重建了半条街,也不能算成功

目前,这套 Benchmark 设置了 29 个评测维度,涉及感知、状态保持、因果推演、可控交互和反事实等能力。它也没有强行把所有结果塞进一个总分。

一部分评测来自 HappyWorld-Arena 中的匿名。两两比较和 Elo 排名,回答“人更喜欢哪个”;另一部分来自针对具体能力的自动化指标,回答“模型究竟在哪一步出了错”。项目说明(Github 链接:https://github.com/LivingFutureLab/HappyWorldBench)也特意把总体偏好与能力分数分开。

因为好看和可靠,确实不是一回事。有些世界第一眼很惊艳,住进去可能处处穿帮。有些世界没那么华丽,但门能打开,路可以走,刚放下的东西不会消失。后者也许更有用。

排名出来了,但“第一名”没那么简单

HappyWorld-Bench 公布了三条赛道的结果。

现在,视频世界模型赛道中,HappyOyster 2.0 preview 整体领先,但 Genie 3 紧随其后,并在运动约束、镜像对应和开放交互等项目上表现突出。

重建赛道更像一场偏科生大赛。

  • GPT-6-Astra 擅长编辑和扩展,可以把黑车改成红车,把晴天变成雨雾,同时尽量不碰无关区域;

  • Marble 的基础场景构建更稳定,桌面支撑、物体接触等细节处理得更好;

  • HYWorld-2.0 则在物理连通性上领先,导航网格覆盖率达到 82.7%,Marble 为 53.6%。

假如只是想搭一个可以看的空间,答案可能是 Marble;如果智能体需要在里面走动,导航区域是否连通就更重要;如果需要频繁修改世界,又是另一个选择。

没有最强,只有特质。

具身赛道里,MiniMax-H3 取得领先,在单步操作、连续动作和成对反事实项目上表现较好。但即便如此,它在 W4 成对反事实任务上的得分也只有 88.62。

所谓成对反事实,是给模型相同的起点,只改变一个动作:一次向上抬,一次向左推。模 型需要生成两个不同结果,而且差异必须准确来自那个被改变的动作。 这比让物体动起来难得多。因为模型不能靠“生成一段合理运动”蒙混过关,它得知道为什么动,以及换一种动法之后会怎样,又回归了表征、预测、交互的链路。

世界模型没有真正的全能冠军

有人擅长造景,有人擅长改景,有人记性比较好,也有人已经开始摸到因果关系。

有点哲学,也有点玄学。

既是出题人,也是考生

和 HappyWorld-Bench 一起发布的,还有 HappyOyster 2.0 preview。

传统视频生成更像点外卖:写下 Prompt,提交,等待,最后拿到一段成片。不好吃就重新点一次。

HappyOyster 老想把这个过程改成现场做菜, 生成已经开始,用户仍可以继续输入指令,人物可以换动作,物体可以被移动,场景也可以改变,世界不在第一次生成后结束,而是顺着新的操作继续发展。

模型得记住前面发生过什么;刚移动的物体不能自动归位;已经打开的门不能莫名关上;人物、动作、声音和场景也不能各演各的;它需要维持一个不断更新的世界,而不是连续生成几段彼此相似的视频。

很振奋,很期待吧。但稍等等。

HappyOyster 2.0 preview 目前产品还没有面向 C 端开放,外部用户无法独立上手。咱们现阶段能够讨论的,还只有官方展示案例和 Benchmark 结果。

另外,还有一个绕不开的问题:阿里及合作团队参与发起 HappyWorld-Bench,阿里的 HappyOyster 同时又是参赛模型,并拿到了视频赛道第一。

啥?出题人也是考生。

开放和复现变得尤为重要。数据构造,判据制定,其他模型,第三方的相近结果,都需要放在阳光下。

目前,项目已公开代码仓库和技术报告,HappyWorld-Arena(https://skyeval.com/sla/arena/happyworld)也已开放。同时支持大家在线评估,希望大家可以在 arena 平台上选出自己喜欢的世界。

HappyWorld-Bench 真能把试卷统一起来?

HappyWorld-Bench 最有价值的地方,是它试图把原本各说各话的三类模型放进一套能力坐标。一套 Benchmark 发布出来,真正成为行业标准,还需要被不同团队使用、质疑、复现、修改。

但还有一些更难的问题,仍在试卷之外。

  • 世界模型应该预测未来的画面,还是预测画面背后的潜在状态?

  • 模型把未来猜对了,机器人就一定能更好地完成任务吗?

  • 加入世界模型之后,任务成功率提高多少,算力成本又增加多少?

  • 自动驾驶里的安全、意外情况和失败恢复,该怎样测?

  • 世界模型究竟是在生成一个越来越逼真的“世界视频”,还是已经开始帮助智能体做出更好的行动?

HappyWorld-Bench “定义了世界模型行业标准”?不,更准确的说法是,它提供了一种共同参与探讨世界模型的方法:我们不要只放 Demo,也不要只报总分,我们把状态、动作、后果一项项拆出来看,把所有问题都浮现在阳光下。

你说:

机器人抬起托盘时,托盘究竟有没有离开桌面?

感兴趣的朋友,可以看看 HappyWorld-Bench Report:https://arxiv.org/abs/2609.24308

原始来源: InfoQ

评论 (0)