不建地图、不用相机:单杠这道几何题,人形机器人靠原始点云过了
一根悬在半空、几何稀疏的细杆,会把感知和全身控制一起卡死。苏黎世联邦理工让一台众擎 PM-01 跳上单杠、双手交替摆荡、再落地,15 次试验成功 14 次。真正值得记的不是这个动作本身,而是它证明了「不建地形图」这条路在非结构化场景里更对。
- 结果:EngineAI PM-01 完成「跳上—摆荡—落地」全流程,15 次硬件试验成功 14 次,覆盖三种不同的单杠配置。
- 几何条件:杆高 1.69–1.75 米,杆间距 0.26–0.33 米,峰值摆动速度 0.5 m/s;其中一次试验支架本身还在晃。
- 感知方案:头部 RoboSense E1R 固态激光雷达的原始点云直接喂给控制器,不建地形图、不做重建。视场 120°×90°、10 Hz、192×144 分辨率。
- 为什么不建图:高度场(heightfield)会丢掉的恰恰是「细的、悬空的、上下都是空气的杆」;体素网格又太吃内存。这是本文最值得记住的一条工程经验。
- 判断:这条路线对「临时结构、非标场景」的价值远高于结构化产线——工地、巡检、演出布景里到处都是细杆、线缆、栏杆,而这些恰恰是 elevation map 会直接抹掉的东西。
一个专门用来卡死机器人的场景
单杠看起来是个 playground 玩具,但在机器人眼里它是个相当刁钻的几何题:
杆子细、悬空、上下都是空气。它不属于「地面」这个概念的任何一部分。
跳上要准、摆荡要连续换手、落地要稳,三个阶段是三个不同的动力学问题,还得无缝接上。
苏黎世联邦理工(ETH Zürich)机器人系统实验室让一台 EngineAI PM-01(众擎机器人)完成了整套动作:跳上第一根杆、双手交替摆荡前进、再干净地落到地面,全程不中断。
0.5 m/s 这个速度,报道里说和人类玩同样器械时观察到的量级相当。更值得一提的是那次「架子还在晃」的试验——它说明这套控制不是靠精确已知的世界模型硬算出来的,而是对扰动有一定容忍度。
不建地形图,直接吃原始点云
这是整篇工作最有价值的一点,也是最容易被动作本身的视觉效果盖过去的一点。
腿足机器人的常规做法是先建地形图:把传感器数据压成高度场(heightfield / elevation map),控制器在这个图上规划落脚点。这个做法在野外、楼梯、碎石地上非常好用。
但它有一个致命的副作用:高度场只保留「每个 (x, y) 位置的最高点」。一根悬空的杆,在高度场里要么被记成「那个位置有 1.7 米高的东西」(于是机器人以为面前有堵墙),要么因为分辨率不够直接被抹掉。无论哪种,都跟「可以抓的横杆」这个语义完全对不上。
那为什么不用体素网格(voxel grid)保留三维信息?报道给出的理由是内存开销太大,跟不上实时控制。
ETH 的做法是跳过重建这一步:头部 RoboSense E1R 固态激光雷达的原始扫描直接进控制器。按 TechEBlog 的描述(此段细节仅见于该篇,未获第二来源印证),雷达视场 120°×90°、10 Hz、生成 192×144 的点阵;一个名为 AME-2 的注意力编码器先在这些点上铺 2D 网格、池化出全局图景,再聚焦到下一步真正重要的局部特征;GRU 记忆模块负责在目标杆移出视野后仍然记得它在哪;控制器输出 50 Hz 的关节位置指令给机载 PD 环。另有一个辅助头去预测梯子的中心线,作为额外训练信号。
三个专家,蒸馏成一个学生
训练在 Isaac Lab 中完成,域随机化的清单拉得很长(此段细节仅见于 TechEBlog):杆半径、宽度、倾斜、摩擦、质量、电池电压跌落、执行器热限制,还有一个相当细致的激光雷达噪声模型——测距误差、边缘渗光、丢点、帧冻结。
硬件侧还有个巧妙的简化(同样仅见于 TechEBlog):机器人末端装的不是手,而是不锈钢被动钩,开口 60mm 圆环。它靠腕关节扭转就能脱钩,对微小的接触误差不敏感;接触几何用简单形状搭建,仿真里的接触计算因此很轻。钩子的对称设计还允许机器人必要时反向摆荡。
同一套控制器,钻过了 2 厘米余量的窄缝
更有说服力的是后续测试:同一个控制系统下,另一个独立训练的策略让机器人蹲着钻过头顶仅余 2 厘米的窄缝,然后恢复到稳定姿态。
这跟单杠是同一个几何难题的镜像版本——不是「上面悬着一根细杆」,而是「上面压下来一块板,只留两指宽的缝」。两者共同要求的都是:对稀疏悬空几何的精确感知 + 全身姿态的精细控制。
报道还提到,注意力图在仿真和真机上「照亮的位置完全一致」——下一次落脚的杆、以及地面,出现的时机也恰好对得上。这说明学到的表征确实在跨 sim-real 迁移,而不是靠过拟合仿真里的某个伪影。
这篇工作没说的事
| 缺口 | 具体情况 | 对判断的影响 |
|---|---|---|
| 论文原文未获取 | 本文所有细节来自 TechEBlog / AGI Hunt / FutureX 的二手转述,未见 arXiv 编号与原文 | 雷达参数、AME-2 结构、域随机化清单等细节无法逐条核对 |
| 失败样本只有 1 个 | 15 次中 1 次失败,失败原因未披露 | 93% 的成功率在小样本下置信区间很宽,不宜直接外推到批量部署 |
| 场景是受控的 | 三种杆的几何都在很窄的范围内,光照、地面条件未说明变化 | 「泛化」指的是杆几何泛化,不是环境泛化 |
| 无负载、无任务 | 只做位移动作,不涉及携带物体或操作 | 距离「能干活」还有明显距离 |
| 本体是 PM-01 | 小型人形(约 1.2 米级、24 自由度),不是全尺寸 | 结论能否迁移到全尺寸人形未经验证 |
把这些保留意见摆出来,不是要否定这项工作。恰恰相反:一篇能让你准确说出「它还没证明什么」的报道,通常比一篇全是惊叹号的更值得读。14/15 的硬件成功率、三种几何配置、一个跨任务复用的控制器,这三项已经足够说明技术方向是对的;至于它能走多远,要看后续有没有团队在非 ETH 的硬件上复现出来。