15.4 小时导航数据换 8.39 个百分点:具脑磐石 Cog-WM 1.0 真正值得看的是 SR 与 SPL 的背离
具脑磐石在浦江创新论坛发布类脑认知世界模型 Cog-WM 1.0,用约 15.4 小时导航数据把成功率从 78.50% 提到 86.89%。但同期路径效率只涨了 0.65——「找到了」和「走得近」之间的这道缝,才是这份成绩单里最该被读的东西。
- 发布:2026-09-14 在浦江创新论坛类脑具身智能分论坛,上海具脑磐石发布类脑认知世界模型 Cog-WM 1.0,分 Nav(导航)与 Manip(操作)两个方向,方法均通过 arXiv 论文公开。
- 导航:HM3D-ObjectNav 子集上成功率(SR)由基线 BSC-Nav 的 78.50% 提升至 86.89%,绝对提升 8.39 个百分点、相对提升 10.69%;路径效率(SPL)由 47.70 升至 48.35。
- 数据:导航侧使用 145 个场景、577 条轨迹、约 15.4 小时任务数据,模型参数约 1B,任务数据量约为对标方法的十分之一。
- 操作:LIBERO 98.2%(π0.5 为 96.9%)、LIBERO-Plus 84.6%(π0.5 为 84.5%);消融从纯策略 80.0% 逐级到完整方法 84.6%。
- 部署:已在四足机器人上完成部署并用于巡检/巡逻客户现场,此前在多款轮式人形本体完成验证。
- 判断:SPL 只涨 0.65 说明这套机制解决的是「找不找得到」,不是「绕不绕得远」;把 15.4 小时当成具身数据问题的解法是误读——它不含视觉编码器预训练。
8.39 个百分点与 0.65 的背离
具身导航有两个常用指标:SR(Success Rate)衡量「最后有没有找到目标、任务有没有完成」;SPL(Success weighted by Path Length)在此基础上再按路径效率打折——走冤枉路越多,得分越低。
Cog-WM Nav 1.0 在 HM3D-ObjectNav 子集上的成绩是:SR 从基线 BSC-Nav 的 78.50% 提到 86.89%,绝对提升 8.39 个百分点;SPL 从 47.70 提到 48.35,只涨了 0.65。
这两个数字放在一起读,比单看「提升超 10%」有意义得多。成功率的涨幅远大于路径效率的涨幅,说明这套机制真正改善的是「能不能找到」,而不是「走的路够不够短」。换句话说,机器人变得更擅长做对决策——在没有线索时判断该往哪个方向探索——而不是更擅长规划一条最优路径。
SR 是「有没有找到」,SPL 是「绕没绕远」
用一个日常场景翻译这个背离:让你在一个陌生商场里找一家奶茶店。SR 衡量的是你最终有没有站在那家店门口;SPL 还要再问一句——你是一路直奔,还是先绕了三圈才摸过去。
Cog-WM 的改进明显落在前者。它的做法是把空间记忆与前瞻预测绑在一起:在记忆的隐空间里,结合任务目标与既有环境记忆预测后续的空间表征与探索子目标,再综合目标语义与路径代价选择下一步行动。当视野里没有目标时,它比基线更早判断出「该往哪探」——这正是 SR 提升的来源。
但一旦它决定往某处走,走得好不好、会不会折返,SPL 几乎没有变化,说明局部路径规划与运动执行这一段并没有被这套机制显著改善。对一个要真正上岗的巡检机器人来说,这意味着:它更不容易「找不到」,但一趟巡检的耗时未必明显下降。
15.4 小时的边界在哪里
这次传播最广的一个说法是「用约十分之一的数据取得了相近甚至更好的表现」。支撑它的具体数字是:145 个场景、577 条轨迹、约 15.4 小时导航任务数据,模型参数约 1B。
但这个数字有两个必须同时说清的限定。第一,15.4 小时指的是导航任务数据,不包含视觉编码器的预训练数据。视觉编码器本身见过的数据量没有披露,这部分才是通常意义上的「海量」所在。第二,「约为对标方法十分之一」是企业自述的比较口径,没有说明对标方法的具体数据构成与筛选条件。
把这两条去掉,结论就会从「15.4 小时解决了具身数据问题」滑向一个站不住的说法。准确的表述应该是:在导航这一特定任务域内,通过改变模型对信息的组织与预测方式,有可能显著降低任务数据需求。腾讯新闻的那篇稿子用了「重要、但仍需要克制的结论」来形容,这个措辞是准确的。
在 HM3D-ObjectNav 子集上,用约 15.4 小时导航任务数据,取得了高于基线 BSC-Nav 的成功率;机制上走的是隐空间预测 + 时空记忆,而非像素级重建。
15.4 小时解决了具身智能的数据问题。它不含视觉编码器预训练数据,且仅限导航任务域,未覆盖操作侧的数据规模披露。
84.6% 是一层层叠出来的
操作分支 Cog-WM Manip 1.0 走的是多时间尺度预测加价值引导的经验学习:让模型在训练中同时学习近期动作后果与后续任务状态,建立「当前动作」与「任务进展」的联系;再利用有效执行轨迹学习环境变化,根据动作片段对任务推进的贡献引导策略改进。
公开的两个基准数字是:LIBERO 98.2%(π0.5 为 96.9%),LIBERO-Plus 84.6%(π0.5 为 84.5%)。前者高出 1.3 个百分点,后者只高出 0.1 个百分点——难度更高的基准上,优势几乎被抹平。
比分数更有信息量的是消融实验,它把能力拆解成了四级:
值得注意的是,前两档各带来 1.6 和 0.4 个百分点,最后一档一次性给了 2.6——贡献最大的那一步,恰恰是公开材料描述最模糊的一步。这是复现时最需要盯的地方。
「低数据依赖」到底省下了什么
如果这套机制真的能把任务数据需求降一个数量级,它对产业的价值不在榜单,而在长尾场景的部署成本。陌生车间、非标工位这类场景的共同特点是:没法预先采一轮数据、也没法建一张高精地图。传统方案在这里的边际成本极高,而「无需预置地图先验」正是 Cog-WM Nav 1.0 强调的部署条件。
公司称该模型已在四足机器人上完成部署并应用于巡检/巡逻场景的客户现场,此前也在多款轮式人形本体完成验证。这一条比任何基准分数都关键——它把论文指标和真实现场第一次接上了。但公开材料没有给出现场运行的具体指标(运行时长、成功率、人工接管率),这几项才是判断「开箱即用」是否成立的依据。