朱军团队给世界模型定了五级台阶:Motus2 站在 L3,用 13 万小时第一视角学「动手前先想一遍」
朱军团队发布《General World Models from First-Principles》,把世界模型从名词变成 L1–L5 五级可检验路线;同场发布的 Motus2 用 13 万小时人类第一视角视频加 100 小时机器人数据,把策略、模拟器、评估器装进同一套参数。
- 论文框架:朱军及清华 TSAIL / 生数科技团队发布《General World Models from First-Principles》,将通用世界模型核心能力归纳为理解、想象、行动三环闭环,并给出 L1 生成世界 → L2 交互世界 → L3 在世界中行动 → L4 自主世界智能体 → L5 世界组织者五级路线。
- 论文判断:现有系统已触及前三层,L4、L5 仍是开放问题,缺口集中在因果与物理接地、持久记忆、在线学习、高效部署、安全控制。
- Motus2 三个接口:以一套共享参数的视频—动作模型同时暴露策略(提候选动作)、模拟器(预测后果)、评估器(判断好坏)三个控制接口,成功、次优、失败动作都能回流为学习依据。
- 训练数据:约 13 万小时人类第一视角视频 + 超过 100 小时机器人轨迹与人机对齐数据,另配独立轻量触觉专家预测接触后的力反馈,补「最后一厘米」。
- 判断:五级路线的最大价值不是分级本身,而是把「你的世界模型到第几级」变成一个可以逐条追问的问题——目前全行业都挤在 L3,且验证集中在特定本体与特定任务。
理解、想象、行动的三环闭环
「世界模型」是 2026 年 AI 圈最没有共识的词:连续生成的视频叫世界模型,实时变化的数字环境叫世界模型,潜空间里预测未来状态的系统、直接输出机器人动作的策略,都在用这个名字。机器之心 9 月 11 日的拆解开篇就把这个问题摆上台面——**画面可以足够逼真却违背物理规律,机器人能完成一次抓取也可能只熟悉实验室的机位和轨迹**,仅靠 Demo 无法回答一个系统学到的是视觉相关性、物理结构,还是行动与结果之间的关系。
朱军团队的论文给出了一个收敛框架:通用世界模型要形成三项核心能力的闭环——**理解**(把视觉、语言、声音、触觉或机器人传感器信息整合成对当前世界的内部判断)、**想象**(从当前状态推演多个可能未来,尤其是「如果我做动作 A 而不是 B,结果会怎样」)、**行动**(把预测变成对环境的干预,并用新观测检验修正模型)。视频生成只是这个闭环里「想象」的一部分,回答不了带行动条件的因果预测。
这个框架不是凭空来的:从 Kenneth Craik 1943 年「头脑中的小尺度模型」,到强化学习的 POMDP 建模,再到李飞飞 World Labs 的渲染器/模拟器/规划器分类与 LeCun 的 V-JEPA 潜空间路线,论文把中美两条技术脉络都纳入了坐标,然后给出自己的五级台阶。
L1 到 L5,每级都有可检验的问题
论文用一只被推到桌边的玻璃杯解释五级路线:**L1** 生成杯子滑落、撞击、碎裂的连续画面;**L2** 在用户改变视角、改变推动方向后继续演化这个世界;**L3** 判断杯子是否要掉、预测伸手是否来得及,并输出机器人真正可执行的抓取动作;**L4** 不再等人指令,主动发现风险、补充信息、失败后修正策略;**L5** 面对多主体协作——谁去抓杯子、谁去避障、谁来调配工具。
论文的判断很冷静:**现有系统已触及前三层级,L4 和 L5 仍是开放问题**,主要缺口包括因果与物理接地、持久记忆、在线学习、高效部署和安全控制。数据侧则给出金字塔结构:底层是互联网规模视频(世界知识先验),向上依次是领域视频、第一视角人类视频、带动作记录的人类示范,顶层是真实机器人交互数据——越往上越稀缺,但动作与任务的对应关系越清楚。
先心灵,再手巧
9 月 10 日下午的 2026 Inclusion·外滩大会「世界模型是 AI 走向物理世界的新大陆吗」见解论坛上,生数科技 CEO 骆怡航现场发布了面向灵巧操作的通用世界模型 **Motus2**。按机器之心的拆解,它的关键设计是**不做三套独立系统**:以一套共享参数的视频—动作模型,暴露三个控制接口——**策略**提出可执行的候选动作,**模拟器**预测这些动作在视觉世界中的后果,**评估器**判断哪种结果更接近任务目标并用于选择与改进。执行之后,成功、失败和不那么理想的结果都回流为下一轮建模与价值学习的证据。
数据路径是分层的:从单目第一视角视频扩展到同步双目第一视角数据,再用机器人数据完成本体适配——**约 13 万小时人类第一视角记录,加上超过 100 小时的机器人轨迹与人机对齐数据**。执行侧另配一个独立的**轻量触觉专家**,对即将执行的短动作做细化并预测接触后的力反馈:视觉看清物体在哪、世界怎么变,触觉补上压、碰、抓、旋的「最后一厘米」。此外引入记忆机制,应对遮挡、环境变化与连续操作中的状态保持。
架构底座是 **MoT(Mixture-of-Transformers)**:不同模态保留各自的专家参数,通过共享注意力机制交换上下文,避免海量视频数据压制稀缺的机器人信号。
分级是尺子,不是勋章
对比看,本站此前写过的光象 Phi-WM(训练完就退场的世界模型,80.3% 留在部署之外)与小米 U0(生成模型而非策略模型)分别在尺子的不同位置:Phi-WM 验证了「预测准 ≠ 部署可用」,U0 明确只做 L1 的场景生成。Motus2 的差异化在于把**评估器**和**触觉反馈**塞进闭环,向「从失败中学习」迈了一步——但它自己承认仍处在 L3 向 L4 延伸的阶段,验证集中在特定机器人与操作任务,自主目标形成、持久记忆、开放环境泛化都还是欠条。