# 小米把具身世界模型训练框架开源了：4B 与 34B 两套权重，能干什么、不能干什么

> 9 月 10 日小米开源了具身世界模型训练框架与 4B/34B 两套权重，Apache 2.0 许可，覆盖场景生成、场景编辑、单图生成、图像编辑、视频生成与图文交错序列生成。这篇把它能接进哪些真实环节、以及三条不该碰的边界一次说清。

### TLDR

- **开源内容**：**2026 年 9 月 10 日**，小米技术宣布 **Xiaomi-Robotics-U0** 具身世界模型的**训练框架与模型权重**全面开源，同时提供配套的**训练与推理框架**。
- **两套权重**：提供 **4B** 与 **34B** 两种规模；据 AGI Hunt 报道，该系列在 Hugging Face 上架，许可为 **Apache 2.0**，并包含 34B 的 any-to-any 版本（U0、U0-FlashAR）、4B 版本，以及用于建模连续交互的 **Sequence 变体**。
- **六类能力**：具身场景生成、具身场景编辑、单图生成、图像编辑、视频生成、图文交错序列生成。
- **定位**：官方表述为"面向世界模型、具身智能和机器人应用研究"，目标是"降低技术门槛，加速世界模型技术在真实机器人场景中的探索与落地"。
- **三条边界**：它是**生成模型不是策略模型**，不输出可执行的机器人动作；生成的视频是**像素级未来，不是运动学可行的轨迹**；官方公告**未公布评测基准与对比数字**，无法与其他世界模型横向比较。
- **未获确认项**：训练数据规模与构成、评测基准、具体仓库路径与依赖版本，截至发稿未见官方公布。

### SRC

本文事实来自 @小米技术 2026 年 9 月 10 日的官方微博公告（原文附短链 t.cn/AX0gGnRV），经和讯科技、长桥证券（援引金石数据）、群益期货等多家财经媒体同日转述，口径完全一致，可交叉核对；许可类型（Apache 2.0）、上架平台（Hugging Face）与模型系列构成（34B any-to-any 的 U0 与 U0-FlashAR、4B 版本、Sequence 变体）来自 AGI Hunt 的英文报道，属**二手转述，本文未直接核验 Hugging Face 页面**；FutureX · Physical AI Daily Issue 116（09/11）的 Open Source 栏目亦收录此条。官方公告**未公布训练数据规模、评测基准、具体仓库地址与依赖版本**，本文在涉及这些内容时一律标注为未获确认，不作推测。本文第四节起的用法推演与选型建议为作者判断，已逐条标注。解读时间 2026-09-11。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>先确认开源了什么</div>

<h2>框架 + 权重 + 两套尺寸</h2>

<p>**2026 年 9 月 10 日**，小米技术发布公告：Xiaomi-Robotics-U0 具身世界模型的**训练框架与模型权重**已全面开源。</p>

<p>这条公告里能确认的四件事，逐条列清楚：</p>

<ul>
<li><strong>权重规模</strong>：提供 **4B** 与 **34B** 两种规模的模型权重。</li>
<li><strong>配套代码</strong>：同时开源配套的**训练与推理框架**——这一点比只放权重重要，意味着可以基于自有数据继续训练，而不只是推理调用。</li>
<li><strong>能力范围</strong>：支持具身场景生成、具身场景编辑、单图生成、图像编辑、视频生成、图文交错序列生成，共六类任务。</li>
<li><strong>许可与平台</strong>：据 AGI Hunt 报道，模型在 Hugging Face 上架，许可为 **Apache 2.0**（二手转述，本文未直接核验页面）。Apache 2.0 是宽松许可，允许商用与修改，这对做产品集成的团队是关键前提。</li>
</ul>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">具身场景生成</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#0a749a"></div></div><div class="jx-bar-val">官方列首位</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">具身场景编辑</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#00a6d6"></div></div><div class="jx-bar-val">官方列第二</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">单图生成 / 图像编辑</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:70%;background:#4b5f8a"></div></div><div class="jx-bar-val">通用图像能力</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">视频生成</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:70%;background:#0d8a5f"></div></div><div class="jx-bar-val">时序预测基础</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">图文交错序列生成</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:85%;background:#b85c0a"></div></div><div class="jx-bar-val">连续交互建模</div></div>
<div class="jx-legend"><div class="jx-lg">官方公告列出的六类支持任务，按公告中的表述顺序与性质分组；条形长度仅表示本文对"与具身任务相关度"的定性判断，非官方量化指标</div></div>
</div>

<p>官方对这次开源的定位表述是：面向世界模型、具身智能和机器人应用研究，"希望通过开放模型与代码，降低技术门槛，加速世界模型技术在真实机器人场景中的探索与落地"。</p>

<div class="keypoint">
<strong>判断：</strong>"训练框架也开源"是这批开源里真正值钱的部分。只放权重，你能做的是调用；放了训练框架，你能做的是**把你自己的场景数据灌进去**。对有大量真实场景数据、但缺基础模型的团队（比如做工业质检、做特定作业流程的），可训练性比参数规模重要得多。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>四类能立刻接进去的用法</div>

<h2>把六类能力映射成工程环节</h2>

<p>以下映射为本文基于能力列表所作的推演，**不代表官方推荐用法**，标注为判断。之所以值得列，是因为"世界模型"这个词目前被视频生成、VLA、自动驾驶三类公司在同时使用，含义差别很大——先把它在机器人链路里落在哪一段说清楚，比讨论它强不强更重要。</p>

<div class="tbl-wrap">
<table>
<thead><tr><th>官方能力</th><th>可接入的工程环节</th><th>输入 → 输出</th><th>适用条件</th></tr></thead>
<tbody>
<tr><td>具身场景生成</td><td>训练场景批量扩充</td><td>条件描述 / 参考图 → 新场景</td><td>真机素材不足、需要扩充背景与光照多样性</td></tr>
<tr><td>具身场景编辑</td><td>难例构造</td><td>已有场景 + 修改指令 → 变体场景</td><td>已有场景库，需要针对性生成遮挡、位姿偏移等难例</td></tr>
<tr><td>视频生成</td><td>策略预演与演示</td><td>首帧 + 指令 → 未来帧序列</td><td>需要"看起来会怎样"，而非精确物理仿真</td></tr>
<tr><td>图文交错序列生成</td><td>长程任务分解演示</td><td>图文交替输入 → 连续交互序列</td><td>多步任务的过程表达与标注辅助</td></tr>
</tbody>
</table>
<div class="cap">表注：表格右两列为本文推演判断，非官方内容。官方公告仅列出六类能力名称，未给出各能力的输入输出规格、分辨率与时长上限。</div>
</div>

<div class="jx-steps">
<div class="jx-step">
<div class="jx-step-l">第 1 步 · 明确它在链路里的位置</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:100%">数据侧，不是控制侧</div></div>
<div class="jx-step-ax">世界模型产出的是"未来长什么样"，不是"下一步该发什么指令"</div>
</div>
<div class="jx-step">
<div class="jx-step-l">第 2 步 · 先做数据扩充，别先做控制</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:80%">用场景生成 / 编辑补训练集</div></div>
<div class="jx-step-ax">这是风险最低、见效最快的一环，失败也不影响线上系统</div>
</div>
<div class="jx-step">
<div class="jx-step-l">第 3 步 · 再做评测，不要直接上机</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:60%">建立自有评测集再谈替换</div></div>
<div class="jx-step-ax">官方未公布评测基准，横向比较必须由使用方自己建立</div>
</div>
<div class="jx-step">
<div class="jx-step-l">第 4 步 · 最后才考虑训练</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:40%">自有数据微调</div></div>
<div class="jx-step-ax">需要训练框架与算力，且要确认许可对衍生权重的要求</div>
</div>
</div>

<div class="keypoint">
<strong>判断：</strong>上表的四步顺序是刻意排的。很多团队拿到开源模型的第一反应是"接到控制链路里"，这是**失败率最高的路径**——因为生成模型的误差会直接进到动作里。正确顺序是**先在离线数据环节用起来**（生成难例、扩充场景），等自有评测集跑通、知道了它的失败模式，再谈往控制侧靠。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>4B 还是 34B</div>

<h2>选型不看参数，看你在哪一步</h2>

<p>官方提供了 4B 与 34B 两档。据 AGI Hunt 的转述，34B 是 any-to-any 版本（含 U0 与 U0-FlashAR 两种），4B 是新增的小尺寸版本，另有用于建模连续交互的 Sequence 变体。</p>

<div class="jx-split">
<div style="flex:48">
<p><strong>先用 4B 的场景</strong>：数据扩充、批量生成难例、交互式试跑。这类任务的瓶颈是**吞吐**而不是单次质量——一天要出几千张场景图时，小模型的单位成本优势远大于质量差距。团队没有专用算力集群时，4B 也是唯一能本地跑起来的选择。</p>
</div>
<div style="flex:46">
<p><strong>再考虑 34B 的场景</strong>：需要长时序一致性、需要复杂指令遵循、或者要作为**教师模型**给小模型做蒸馏。34B 的价值在于上限更高，代价是推理成本与部署复杂度显著上升。</p>
</div>
</div>

<div class="jx-note">
<strong>选型判断（作者推演，非官方数据）：</strong>两档之间的实际差距，官方**未公布任何评测数字**，因此无法从公开信息比较。建议做法是：**用同一批自有提示词在两档上各跑一次，按你自己的任务指标打分**，而不是参考任何第三方跑分。另外，具体显存占用、推理速度、依赖版本**以官方仓库 README 与配置文件为准**——本文不给出未经核验的数字。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>三条不该碰的边界</div>

<h2>它不是什么，比它是什么更重要</h2>

<p><strong>其一，它是生成模型，不是策略模型。</strong>官方列出的六类能力全部是**生成类**（场景、图像、视频、图文序列），没有一项是"输出机器人可执行动作"。想用它直接驱动机械臂或人形机器人，链路里还缺动作解码与控制两层。**判断：**任何声称"接上世界模型机器人就会动了"的方案，中间一定还藏着一个没说清楚的 VLA 或策略网络。</p>

<p><strong>其二，生成的视频是像素级未来，不是运动学可行的轨迹。</strong>视频里的动作看起来连贯，不等于它满足关节限位、力矩约束与碰撞约束。**判断：**把生成视频直接当作轨迹规划的输入，是这条路上最常见的坑。正确用法是把它当作**"目标长什么样"的示意**，再由规划器生成满足约束的实际轨迹。</p>

<p><strong>其三，没有公开的评测基准，横向比较不成立。</strong>官方公告未公布评测基准、对比数字或失败案例。**判断：**这意味着"它比其他世界模型强/弱"这一类说法目前在公开信息层面**无法验证**。如果你在选型，唯一可靠的办法是建立自有评测集——这一点在第二节的第 3 步已经强调过，这里再重复一次，因为它决定了你能不能向上汇报一个站得住的结论。</p>

<div class="keypoint">
<strong>判断：</strong>小米这次开源最实在的贡献不是"又一个世界模型"，而是**把 Apache 2.0 的训练框架放出来了**。在同一周行业里大量讨论融资、上市与认证门槛的时候，这类可自由商用的基础工具，才是中小企业真正能拿到手的东西。**判断一个开源项目对你有没有用，标准只有一条：你手上有没有它能吃进去的数据。有数据，它是杠杆；没数据，它只是又一个 demo。**
</div>

<div class="jx-note">
<strong>待核验项：</strong>① Apache 2.0 许可与 Hugging Face 上架信息来自 AGI Hunt 二手转述，本文未直接核验页面；② 官方公告未公布训练数据规模、数据来源与清洗方法；③ 未公布评测基准、分辨率上限、视频时长上限与推理速度；④ 具体仓库地址、依赖版本与启动命令未在公告中给出（原文为短链），需以官方仓库 README 为准；⑤ Sequence 变体的具体规格与用途未见详细说明；⑥ 4B 与 34B 的质量差距无官方量化对比。
</div>

<div class="srcline">来源：@小米技术 官方微博 2026-09-10（t.cn/AX0gGnRV）；和讯科技、长桥证券、群益期货 2026-09-10 同日转述；AGI Hunt（许可与平台信息，二手转述）；FutureX · Physical AI Daily Issue 116（09/11）。官方未公布训练数据规模、评测基准与仓库细节，本文未作推测，逐项列为待核验。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/xiaomi-robotics-u0-open-world-model/*
