小米把具身世界模型训练框架开源了:4B 与 34B 两套权重,能干什么、不能干什么
9 月 10 日小米开源了具身世界模型训练框架与 4B/34B 两套权重,Apache 2.0 许可,覆盖场景生成、场景编辑、单图生成、图像编辑、视频生成与图文交错序列生成。这篇把它能接进哪些真实环节、以及三条不该碰的边界一次说清。
- 开源内容:2026 年 9 月 10 日,小米技术宣布 Xiaomi-Robotics-U0 具身世界模型的训练框架与模型权重全面开源,同时提供配套的训练与推理框架。
- 两套权重:提供 4B 与 34B 两种规模;据 AGI Hunt 报道,该系列在 Hugging Face 上架,许可为 Apache 2.0,并包含 34B 的 any-to-any 版本(U0、U0-FlashAR)、4B 版本,以及用于建模连续交互的 Sequence 变体。
- 六类能力:具身场景生成、具身场景编辑、单图生成、图像编辑、视频生成、图文交错序列生成。
- 定位:官方表述为"面向世界模型、具身智能和机器人应用研究",目标是"降低技术门槛,加速世界模型技术在真实机器人场景中的探索与落地"。
- 三条边界:它是生成模型不是策略模型,不输出可执行的机器人动作;生成的视频是像素级未来,不是运动学可行的轨迹;官方公告未公布评测基准与对比数字,无法与其他世界模型横向比较。
- 未获确认项:训练数据规模与构成、评测基准、具体仓库路径与依赖版本,截至发稿未见官方公布。
框架 + 权重 + 两套尺寸
**2026 年 9 月 10 日**,小米技术发布公告:Xiaomi-Robotics-U0 具身世界模型的**训练框架与模型权重**已全面开源。
这条公告里能确认的四件事,逐条列清楚:
- 权重规模:提供 **4B** 与 **34B** 两种规模的模型权重。
- 配套代码:同时开源配套的**训练与推理框架**——这一点比只放权重重要,意味着可以基于自有数据继续训练,而不只是推理调用。
- 能力范围:支持具身场景生成、具身场景编辑、单图生成、图像编辑、视频生成、图文交错序列生成,共六类任务。
- 许可与平台:据 AGI Hunt 报道,模型在 Hugging Face 上架,许可为 **Apache 2.0**(二手转述,本文未直接核验页面)。Apache 2.0 是宽松许可,允许商用与修改,这对做产品集成的团队是关键前提。
官方对这次开源的定位表述是:面向世界模型、具身智能和机器人应用研究,"希望通过开放模型与代码,降低技术门槛,加速世界模型技术在真实机器人场景中的探索与落地"。
把六类能力映射成工程环节
以下映射为本文基于能力列表所作的推演,**不代表官方推荐用法**,标注为判断。之所以值得列,是因为"世界模型"这个词目前被视频生成、VLA、自动驾驶三类公司在同时使用,含义差别很大——先把它在机器人链路里落在哪一段说清楚,比讨论它强不强更重要。
| 官方能力 | 可接入的工程环节 | 输入 → 输出 | 适用条件 |
|---|---|---|---|
| 具身场景生成 | 训练场景批量扩充 | 条件描述 / 参考图 → 新场景 | 真机素材不足、需要扩充背景与光照多样性 |
| 具身场景编辑 | 难例构造 | 已有场景 + 修改指令 → 变体场景 | 已有场景库,需要针对性生成遮挡、位姿偏移等难例 |
| 视频生成 | 策略预演与演示 | 首帧 + 指令 → 未来帧序列 | 需要"看起来会怎样",而非精确物理仿真 |
| 图文交错序列生成 | 长程任务分解演示 | 图文交替输入 → 连续交互序列 | 多步任务的过程表达与标注辅助 |
选型不看参数,看你在哪一步
官方提供了 4B 与 34B 两档。据 AGI Hunt 的转述,34B 是 any-to-any 版本(含 U0 与 U0-FlashAR 两种),4B 是新增的小尺寸版本,另有用于建模连续交互的 Sequence 变体。
先用 4B 的场景:数据扩充、批量生成难例、交互式试跑。这类任务的瓶颈是**吞吐**而不是单次质量——一天要出几千张场景图时,小模型的单位成本优势远大于质量差距。团队没有专用算力集群时,4B 也是唯一能本地跑起来的选择。
再考虑 34B 的场景:需要长时序一致性、需要复杂指令遵循、或者要作为**教师模型**给小模型做蒸馏。34B 的价值在于上限更高,代价是推理成本与部署复杂度显著上升。
它不是什么,比它是什么更重要
其一,它是生成模型,不是策略模型。官方列出的六类能力全部是**生成类**(场景、图像、视频、图文序列),没有一项是"输出机器人可执行动作"。想用它直接驱动机械臂或人形机器人,链路里还缺动作解码与控制两层。**判断:**任何声称"接上世界模型机器人就会动了"的方案,中间一定还藏着一个没说清楚的 VLA 或策略网络。
其二,生成的视频是像素级未来,不是运动学可行的轨迹。视频里的动作看起来连贯,不等于它满足关节限位、力矩约束与碰撞约束。**判断:**把生成视频直接当作轨迹规划的输入,是这条路上最常见的坑。正确用法是把它当作**"目标长什么样"的示意**,再由规划器生成满足约束的实际轨迹。
其三,没有公开的评测基准,横向比较不成立。官方公告未公布评测基准、对比数字或失败案例。**判断:**这意味着"它比其他世界模型强/弱"这一类说法目前在公开信息层面**无法验证**。如果你在选型,唯一可靠的办法是建立自有评测集——这一点在第二节的第 3 步已经强调过,这里再重复一次,因为它决定了你能不能向上汇报一个站得住的结论。