# 不建地图、不用相机：单杠这道几何题，人形机器人靠原始点云过了

> 一根悬在半空、几何稀疏的细杆，会把感知和全身控制一起卡死。苏黎世联邦理工让一台众擎 PM-01 跳上单杠、双手交替摆荡、再落地，15 次试验成功 14 次。真正值得记的不是这个动作本身，而是它证明了「不建地形图」这条路在非结构化场景里更对。

### TLDR

- **结果**：EngineAI **PM-01** 完成「跳上—摆荡—落地」全流程，**15 次**硬件试验成功 **14 次**，覆盖**三种**不同的单杠配置。
- **几何条件**：杆高 **1.69–1.75 米**，杆间距 **0.26–0.33 米**，峰值摆动速度 **0.5 m/s**；其中一次试验**支架本身还在晃**。
- **感知方案**：头部 **RoboSense E1R** 固态激光雷达的**原始点云直接喂给控制器**，不建地形图、不做重建。视场 **120°×90°**、**10 Hz**、**192×144** 分辨率。
- **为什么不建图**：高度场（heightfield）会丢掉的恰恰是「细的、悬空的、上下都是空气的杆」；体素网格又太吃内存。这是本文最值得记住的一条工程经验。
- **判断：这条路线对「临时结构、非标场景」的价值远高于结构化产线**——工地、巡检、演出布景里到处都是细杆、线缆、栏杆，而这些恰恰是 elevation map 会直接抹掉的东西。

### SRC

本文事实以 **TechEBlog（2026-09-12）**对 ETH Zürich Robotic Systems Lab 成果的报道为主，交叉 **AGI Hunt** 的转述与 **FutureX Physical AI Daily Issue 118（09/13）**的 Paper Progress 条目。**论文题为《Learning Agile Perceptive Traversal of Sparse 3D Structures for Humanoids》**，三方对**成功率 14/15、杆高 1.69–1.75m、间距 0.26–0.33m、峰值 0.5 m/s、E1R 激光雷达、GRU 记忆、两阶段（专家→蒸馏）训练**的口径一致。**本文未获取到 arXiv 编号与论文原文**，所有技术细节均来自上述二手报道，**属单一信源的转述链条**；雷达参数（120°×90°、10Hz、192×144）、AME-2 编码器、50Hz 关节位置指令、60mm 钩口、Isaac Lab 域随机化清单等细节仅见于 TechEBlog 一篇，未获第二来源印证，已在正文标注。**素材时间窗为 2026-09-12 18:00 → 2026-09-13 09:00**：FutureX Issue 118（09/13）在窗口内收录该成果并给出中文口径，构成本批纳入依据。「首个」「first reported」等表述为**原报道方说法**，本文不作独立认定。所有判断均已用「判断：」标注。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>为什么是单杠</div>

<h2>一个专门用来卡死机器人的场景</h2>

<p>单杠看起来是个 playground 玩具，但在机器人眼里它是个相当刁钻的几何题：</p>

<div class="jx-split">
<div style="flex:50">
<div class="eyebrow">几何上</div>
<p>杆子<b>细</b>、<b>悬空</b>、<b>上下都是空气</b>。它不属于「地面」这个概念的任何一部分。</p>
</div>
<div style="flex:50">
<div class="eyebrow">控制上</div>
<p>跳上要准、摆荡要连续换手、落地要稳，三个阶段是三个不同的动力学问题，还得无缝接上。</p>
</div>
</div>

<p>苏黎世联邦理工（ETH Zürich）机器人系统实验室让一台 <b>EngineAI PM-01</b>（众擎机器人）完成了整套动作：跳上第一根杆、双手交替摆荡前进、再干净地落到地面，全程不中断。</p>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">硬件试验成功率</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:93%;background:#0a749a"></div></div><div class="jx-bar-val">14 / 15</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">覆盖单杠配置</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:60%;background:#00a6d6"></div></div><div class="jx-bar-val">3 种</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">峰值摆动速度</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:35%;background:#0d8a5f"></div></div><div class="jx-bar-val">0.5 m/s</div></div>
<div class="jx-legend"><div class="jx-lg">杆高 1.69–1.75 m，杆间距 0.26–0.33 m；其中一次试验支架本身在晃动</div></div>
</div>

<p>0.5 m/s 这个速度，报道里说和人类玩同样器械时观察到的量级相当。更值得一提的是那次<b>「架子还在晃」</b>的试验——它说明这套控制不是靠精确已知的世界模型硬算出来的，而是对扰动有一定容忍度。</p>

</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>关键选择</div>

<h2>不建地形图，直接吃原始点云</h2>

<p>这是整篇工作最有价值的一点，也是最容易被动作本身的视觉效果盖过去的一点。</p>

<p>腿足机器人的常规做法是<b>先建地形图</b>：把传感器数据压成高度场（heightfield / elevation map），控制器在这个图上规划落脚点。这个做法在野外、楼梯、碎石地上非常好用。</p>

<p>但它有一个致命的副作用：<b>高度场只保留「每个 (x, y) 位置的最高点」</b>。一根悬空的杆，在高度场里要么被记成「那个位置有 1.7 米高的东西」（于是机器人以为面前有堵墙），要么因为分辨率不够直接被抹掉。无论哪种，都跟「可以抓的横杆」这个语义完全对不上。</p>

<div class="keypoint">判断：这条经验可以直接迁移到工程现场。<b>任何「悬空、细长、非承重面」的结构——线缆、护栏、脚手架横杆、吊装带、演出桁架——在高度场里都会失真。</b>而这些恰恰是巡检、施工、演出场景里最常见的东西。如果一套移动操作方案默认依赖 elevation map，它在这些场景里的失败会非常突然且难以归因。</div>

<p>那为什么不用体素网格（voxel grid）保留三维信息？报道给出的理由是<b>内存开销太大</b>，跟不上实时控制。</p>

<p>ETH 的做法是<b>跳过重建这一步</b>：头部 RoboSense E1R 固态激光雷达的原始扫描直接进控制器。按 TechEBlog 的描述（此段细节仅见于该篇，未获第二来源印证），雷达视场 120°×90°、10 Hz、生成 192×144 的点阵；一个名为 <b>AME-2</b> 的注意力编码器先在这些点上铺 2D 网格、池化出全局图景，再聚焦到下一步真正重要的局部特征；<b>GRU</b> 记忆模块负责在目标杆移出视野后仍然记得它在哪；控制器输出 50 Hz 的关节位置指令给机载 PD 环。另有一个辅助头去预测梯子的中心线，作为额外训练信号。</p>

<div class="jx-note">「杆子移出视野了还知道它在哪」这件事，是摆荡动作能连续的前提——换手瞬间头部必然朝下或朝前，目标杆会离开视场。没有这段记忆，每次换手就等于重新找目标。</div>

</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>怎么训出来的</div>

<h2>三个专家，蒸馏成一个学生</h2>

<div class="jx-tl">
<div class="jx-tl-row"><div class="jx-tl-t">阶段一</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">分别训练三个「专家」策略：跳上第一根杆、摆荡、落地。每个专家拥有完整特权信息（知道杆端在哪），各有自己的课程</div></div></div>
<div class="jx-tl-row"><div class="jx-tl-t">阶段二</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#00a6d6">用相位调度器在三个专家之间交接控制权，跑通完整序列</div></div></div>
<div class="jx-tl-row"><div class="jx-tl-t">阶段三</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">蒸馏成单一学生策略，学生只能看到自己传感到的东西（没有特权信息）</div></div></div>
<div class="jx-tl-row"><div class="jx-tl-t">阶段四</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">PPO 精调，把模仿学习融入任务奖励，并逐步关掉模仿信号</div></div></div>
</div>

<p>训练在 <b>Isaac Lab</b> 中完成，域随机化的清单拉得很长（此段细节仅见于 TechEBlog）：杆半径、宽度、倾斜、摩擦、质量、<b>电池电压跌落</b>、<b>执行器热限制</b>，还有一个相当细致的激光雷达噪声模型——测距误差、<b>边缘渗光</b>、丢点、<b>帧冻结</b>。</p>

<div class="keypoint">判断：这份随机化清单里最见功力的是「电池压降」和「执行器热限」。这两项都是<b>真实硬件上才会出现、仿真里最容易漏掉</b>的因素——机器人连续摆荡十几秒，电压会掉、电机会热，力矩输出跟着衰减。把它们提前放进随机化，是 sim-to-real 能一次过（14/15）的主要原因之一。这是任何做真机强化学习的团队都该抄的一条。</div>

<p>硬件侧还有个巧妙的简化（同样仅见于 TechEBlog）：机器人末端装的不是手，而是<b>不锈钢被动钩</b>，开口 60mm 圆环。它靠腕关节扭转就能脱钩，对微小的接触误差不敏感；接触几何用简单形状搭建，仿真里的接触计算因此很轻。钩子的对称设计还允许机器人必要时反向摆荡。</p>

</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>泛化信号</div>

<h2>同一套控制器，钻过了 2 厘米余量的窄缝</h2>

<p>更有说服力的是后续测试：同一个控制系统下，另一个独立训练的策略让机器人<b>蹲着钻过头顶仅余 2 厘米</b>的窄缝，然后恢复到稳定姿态。</p>

<p>这跟单杠是同一个几何难题的镜像版本——不是「上面悬着一根细杆」，而是「上面压下来一块板，只留两指宽的缝」。两者共同要求的都是：<b>对稀疏悬空几何的精确感知 + 全身姿态的精细控制</b>。</p>

<p>报道还提到，注意力图在仿真和真机上「照亮的位置完全一致」——下一次落脚的杆、以及地面，出现的时机也恰好对得上。这说明学到的表征确实在跨 sim-real 迁移，而不是靠过拟合仿真里的某个伪影。</p>

<div class="keypoint">判断：如果这套「点云直连 + GRU 记忆」的范式在「细杆」和「窄缝」两类几何上都成立，那它的适用边界大概率不是「体育器械」，而是<b>所有高度场会失真的非结构化空间</b>。对做巡检和特种作业的团队，这意味着一条比「先建图再规划」更轻的技术路线——它省掉的重建步骤，在算力受限的机载平台上是很实在的收益。</div>

</div>

<div class="sec"><div class="eyebrow"><span class="num">5</span>要保留的怀疑</div>

<h2>这篇工作没说的事</h2>

<table class="jx-mx">
<tr><th>缺口</th><th>具体情况</th><th>对判断的影响</th></tr>
<tr><th>论文原文未获取</th><td>本文所有细节来自 TechEBlog / AGI Hunt / FutureX 的二手转述，未见 arXiv 编号与原文</td><td>雷达参数、AME-2 结构、域随机化清单等细节无法逐条核对</td></tr>
<tr><th>失败样本只有 1 个</th><td>15 次中 1 次失败，失败原因未披露</td><td>93% 的成功率在小样本下置信区间很宽，不宜直接外推到批量部署</td></tr>
<tr><th>场景是受控的</th><td>三种杆的几何都在很窄的范围内，光照、地面条件未说明变化</td><td>「泛化」指的是杆几何泛化，不是环境泛化</td></tr>
<tr><th>无负载、无任务</th><td>只做位移动作，不涉及携带物体或操作</td><td>距离「能干活」还有明显距离</td></tr>
<tr><th>本体是 PM-01</th><td>小型人形（约 1.2 米级、24 自由度），不是全尺寸</td><td>结论能否迁移到全尺寸人形未经验证</td></tr>
</table>

<div class="jx-note">报道称这是「首个」用自身激光雷达完成整套跳—荡—落序列的通用人形机器人。此前确有能摆荡的机器，但多数<b>假设杆的位置已知</b>——这个差别很大，一个是感知问题，一个只是控制问题。</div>

<p>把这些保留意见摆出来，不是要否定这项工作。<b>恰恰相反：一篇能让你准确说出「它还没证明什么」的报道，通常比一篇全是惊叹号的更值得读。</b>14/15 的硬件成功率、三种几何配置、一个跨任务复用的控制器，这三项已经足够说明技术方向是对的；至于它能走多远，要看后续有没有团队在非 ETH 的硬件上复现出来。</p>

<div class="srcline">来源：ETH Zürich Robotic Systems Lab（Learning Agile Perceptive Traversal of Sparse 3D Structures for Humanoids）· TechEBlog（2026-09-12）· AGI Hunt · FutureX Physical AI Daily Issue 118（09/13）</div>

</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/eth-pm01-monkey-bars-raw-lidar/*
