# 15.4 小时导航数据换 8.39 个百分点：具脑磐石 Cog-WM 1.0 真正值得看的是 SR 与 SPL 的背离

> 具脑磐石在浦江创新论坛发布类脑认知世界模型 Cog-WM 1.0，用约 15.4 小时导航数据把成功率从 78.50% 提到 86.89%。但同期路径效率只涨了 0.65——「找到了」和「走得近」之间的这道缝，才是这份成绩单里最该被读的东西。

### TLDR

- **发布**：2026-09-14 在浦江创新论坛类脑具身智能分论坛，上海具脑磐石发布**类脑认知世界模型 Cog-WM 1.0**，分 Nav（导航）与 Manip（操作）两个方向，方法均通过 arXiv 论文公开。
- **导航**：HM3D-ObjectNav 子集上成功率（SR）由基线 BSC-Nav 的 **78.50% 提升至 86.89%**，绝对提升 **8.39 个百分点**、相对提升 **10.69%**；路径效率（SPL）由 **47.70 升至 48.35**。
- **数据**：导航侧使用 **145 个场景、577 条轨迹、约 15.4 小时**任务数据，模型参数约 **1B**，任务数据量约为对标方法的**十分之一**。
- **操作**：LIBERO **98.2%**（π0.5 为 96.9%）、LIBERO-Plus **84.6%**（π0.5 为 84.5%）；消融从纯策略 **80.0%** 逐级到完整方法 **84.6%**。
- **部署**：已在四足机器人上完成部署并用于巡检/巡逻客户现场，此前在多款轮式人形本体完成验证。
- **判断**：SPL 只涨 0.65 说明这套机制解决的是「找不找得到」，不是「绕不绕得远」；把 15.4 小时当成具身数据问题的解法是误读——它不含视觉编码器预训练。

### SRC

本篇素材时间窗为前一日 18:00 → 当日 09:00。核心事实来自界面新闻 2026-09-14 18:24 发布的稿件（新浪新闻转载，落在本窗口内）与腾讯新闻 2026-09-14 的深度报道；事件本体（2026 浦江创新论坛类脑具身智能分论坛，论坛会期为 9 月 11 日至 14 日）发生在窗口外，窗口内的增量是<strong>界面新闻于 18:24 首次对外披露该模型的完整基准数据与数据规模</strong>，此前公开报道仅有定性描述。需要明确的边界：所有基准数字（78.50%、86.89%、47.70、48.35、98.2%、84.6%、消融四级）均为<strong>企业与算法团队自述口径</strong>，虽称已通过 arXiv 论文公开方法，但本篇未逐项比对 arXiv 原文数值；「全球首个」「超越 SOTA」为企业与论文表述。数据规模的两个关键限定来自腾讯新闻稿：15.4 小时<strong>仅指导航任务数据，不含视觉编码器预训练数据</strong>；「约为对标方法十分之一」为企业自述比较口径，未说明对标方法的具体构成。判断段落均以「判断：」开头，为作者观点。

### BODY

<div class="sec">
<div class="eyebrow">先把这组数字摆正</div>
<h2>8.39 个百分点与 0.65 的背离</h2>
<p>具身导航有两个常用指标：<strong>SR（Success Rate）</strong>衡量「最后有没有找到目标、任务有没有完成」；<strong>SPL（Success weighted by Path Length）</strong>在此基础上再按路径效率打折——走冤枉路越多，得分越低。</p>
<p>Cog-WM Nav 1.0 在 HM3D-ObjectNav 子集上的成绩是：SR 从基线 BSC-Nav 的 <strong>78.50% 提到 86.89%</strong>，绝对提升 8.39 个百分点；SPL 从 <strong>47.70 提到 48.35</strong>，只涨了 0.65。</p>
<p>这两个数字放在一起读，比单看「提升超 10%」有意义得多。<strong>成功率的涨幅远大于路径效率的涨幅，说明这套机制真正改善的是「能不能找到」，而不是「走的路够不够短」。</strong>换句话说，机器人变得更擅长做对决策——在没有线索时判断该往哪个方向探索——而不是更擅长规划一条最优路径。</p>
<div class="jx">
<div class="jx-h"><span>Cog-WM Nav 1.0 与 BSC-Nav 基线对比</span><span class="jx-note">HM3D-ObjectNav 子集，企业自述口径</span></div>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">BSC-Nav 成功率 SR</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:79%;background:#566781"></div></div><div class="jx-bar-val">78.50%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Cog-WM 成功率 SR</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:87%;background:#0a749a"></div></div><div class="jx-bar-val">86.89%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">BSC-Nav 路径效率 SPL</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:48%;background:#566781"></div></div><div class="jx-bar-val">47.70</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Cog-WM 路径效率 SPL</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:48%;background:#00a6d6"></div></div><div class="jx-bar-val">48.35</div></div>
</div>
<div class="jx-legend"><div class="jx-lg">SR 提升 8.39 个百分点；SPL 仅提升 0.65</div></div>
<div class="cap">图注：基数为 Nature Communications 上的 BSC-Nav（Ruan et al., 2026）。数据经界面新闻 2026-09-14 18:24 与腾讯新闻 2026-09-14 报道转述，两处口径一致。</div>
</div>
</div>

<div class="sec">
<div class="eyebrow">这个类比值得记住</div>
<h2>SR 是「有没有找到」，SPL 是「绕没绕远」</h2>
<p>用一个日常场景翻译这个背离：让你在一个陌生商场里找一家奶茶店。SR 衡量的是你最终有没有站在那家店门口；SPL 还要再问一句——你是一路直奔，还是先绕了三圈才摸过去。</p>
<p>Cog-WM 的改进明显落在前者。它的做法是把空间记忆与前瞻预测绑在一起：在记忆的隐空间里，结合任务目标与既有环境记忆预测后续的空间表征与探索子目标，再综合目标语义与路径代价选择下一步行动。<strong>当视野里没有目标时，它比基线更早判断出「该往哪探」——这正是 SR 提升的来源。</strong></p>
<p>但一旦它决定往某处走，走得好不好、会不会折返，SPL 几乎没有变化，说明<strong>局部路径规划与运动执行这一段并没有被这套机制显著改善</strong>。对一个要真正上岗的巡检机器人来说，这意味着：它更不容易「找不到」，但一趟巡检的耗时未必明显下降。</p>
<div class="keypoint"><strong>判断：</strong>把 SR 涨、SPL 不涨当成负面结论是错的——先解决「找到」再解决「走近」，本来就是合理的工程次序。但反过来，把「成功率提升超 10%」直接翻译成「巡检效率提升 10%」则是误读。对采购方而言，这两句话对应的是完全不同的验收指标：前者是任务完成率，后者是单趟工时。</div>
</div>

<div class="sec">
<div class="eyebrow">被反复引用的那个数字</div>
<h2>15.4 小时的边界在哪里</h2>
<p>这次传播最广的一个说法是「用约十分之一的数据取得了相近甚至更好的表现」。支撑它的具体数字是：<strong>145 个场景、577 条轨迹、约 15.4 小时导航任务数据，模型参数约 1B</strong>。</p>
<p>但这个数字有两个必须同时说清的限定。第一，<strong>15.4 小时指的是导航任务数据，不包含视觉编码器的预训练数据</strong>。视觉编码器本身见过的数据量没有披露，这部分才是通常意义上的「海量」所在。第二，「约为对标方法十分之一」是企业自述的比较口径，没有说明对标方法的具体数据构成与筛选条件。</p>
<p>把这两条去掉，结论就会从「15.4 小时解决了具身数据问题」滑向一个站不住的说法。准确的表述应该是：<strong>在导航这一特定任务域内，通过改变模型对信息的组织与预测方式，有可能显著降低任务数据需求。</strong>腾讯新闻的那篇稿子用了「重要、但仍需要克制的结论」来形容，这个措辞是准确的。</p>
<div class="jx-split">
<div style="flex:50">
<div class="eyebrow">可以说的</div>
<p>在 HM3D-ObjectNav 子集上，用约 15.4 小时导航任务数据，取得了高于基线 BSC-Nav 的成功率；机制上走的是隐空间预测 + 时空记忆，而非像素级重建。</p>
</div>
<div style="flex:50">
<div class="eyebrow">不能说的</div>
<p>15.4 小时解决了具身智能的数据问题。它不含视觉编码器预训练数据，且仅限导航任务域，未覆盖操作侧的数据规模披露。</p>
</div>
</div>
</div>

<div class="sec">
<div class="eyebrow">操作侧的消融</div>
<h2>84.6% 是一层层叠出来的</h2>
<p>操作分支 Cog-WM Manip 1.0 走的是多时间尺度预测加价值引导的经验学习：让模型在训练中同时学习近期动作后果与后续任务状态，建立「当前动作」与「任务进展」的联系；再利用有效执行轨迹学习环境变化，根据动作片段对任务推进的贡献引导策略改进。</p>
<p>公开的两个基准数字是：LIBERO <strong>98.2%</strong>（π0.5 为 96.9%），LIBERO-Plus <strong>84.6%</strong>（π0.5 为 84.5%）。前者高出 1.3 个百分点，后者只高出 0.1 个百分点——<strong>难度更高的基准上，优势几乎被抹平</strong>。</p>
<p>比分数更有信息量的是消融实验，它把能力拆解成了四级：</p>
<div class="jx-steps">
<div class="jx-step"><div class="jx-step-l">纯策略</div><div class="jx-step-bar"></div><div class="jx-step-v">80.0%</div><div class="jx-step-ax">基线</div></div>
<div class="jx-step"><div class="jx-step-l">加局部预测</div><div class="jx-step-bar"></div><div class="jx-step-v">81.6%</div><div class="jx-step-ax">+1.6</div></div>
<div class="jx-step"><div class="jx-step-l">加多时域预测</div><div class="jx-step-bar"></div><div class="jx-step-v">82.0%</div><div class="jx-step-ax">+0.4</div></div>
<div class="jx-step"><div class="jx-step-l">完整方法</div><div class="jx-step-bar"></div><div class="jx-step-v">84.6%</div><div class="jx-step-ax">+2.6</div></div>
</div>
<div class="cap">图注：LIBERO-Plus 上的消融结果，企业自述口径。四级的递进关系说明每一档提升都对应一个明确机制，但最后一档（+2.6）的来源未在公开材料中单独拆解。</div>
<p>值得注意的是，前两档各带来 1.6 和 0.4 个百分点，最后一档一次性给了 2.6——<strong>贡献最大的那一步，恰恰是公开材料描述最模糊的一步</strong>。这是复现时最需要盯的地方。</p>
</div>

<div class="sec">
<div class="eyebrow">对落地方的参考</div>
<h2>「低数据依赖」到底省下了什么</h2>
<p>如果这套机制真的能把任务数据需求降一个数量级，它对产业的价值不在榜单，而在<strong>长尾场景的部署成本</strong>。陌生车间、非标工位这类场景的共同特点是：没法预先采一轮数据、也没法建一张高精地图。传统方案在这里的边际成本极高，而「无需预置地图先验」正是 Cog-WM Nav 1.0 强调的部署条件。</p>
<p>公司称该模型已在四足机器人上完成部署并应用于巡检/巡逻场景的客户现场，此前也在多款轮式人形本体完成验证。这一条比任何基准分数都关键——<strong>它把论文指标和真实现场第一次接上了</strong>。但公开材料没有给出现场运行的具体指标（运行时长、成功率、人工接管率），这几项才是判断「开箱即用」是否成立的依据。</p>
<div class="keypoint"><strong>判断：</strong>类脑机制在具身智能里的价值，目前能确证的是「可归因性」——消融实验能把每一档提升对应到一个明确机制，这比端到端黑箱的「又涨了两个点」更容易做工程调试。但它还没有被证明是「数据效率的一般解」：15.4 小时的口径限定、LIBERO-Plus 上 0.1 个百分点的微弱优势、以及最后一级消融的模糊来源，都是这个结论目前的边界。建议的观察点很具体：看它在非巡检类场景（比如开放世界的物品递送）能否复现同样的低数据表现。</div>
</div>

<div class="srcline">信源：界面新闻 2026-09-14 18:24（新浪新闻转载）、腾讯新闻 2026-09-14 深度稿；发布场合为 2026 浦江创新论坛类脑具身智能分论坛（会期 9 月 11 日至 14 日）。所有基准数字为企业与算法团队自述口径，本篇未逐项比对 arXiv 原文；15.4 小时不含视觉编码器预训练数据；消融四级数据的最后一档来源未在公开材料中拆解。核查时间 2026-09-15，素材时间窗 2026-09-14 18:00 → 2026-09-15 09:00。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/cogwm-15-hours-data-efficiency-sr-spl-gap/*
