# 亮源新创一个月三连发：把大模型后训练那套流程，原样搬进机器人全身

> 跑酷、导航、抗摔三件看似不相关的事，拼起来是一条完整的路线：中期训练、SFT、在线 RL 的后训练三段式，加上把偏好对齐做进全身控制——创始人姜旭来自 OpenAI RLHF 团队，这套打法是他履历的具身复刻。

### TLDR

- **三连发**：过去一个多月，亮源新创接连发布 **LightParkour**（跑酷技能扩展）、**LightNav-0**（通用导航，**9 月 1 日开源**）、**Light REACT**（抗扰韧性控制）三项技术，分别对应技能、导航、全身控制三个方向。
- **数据引擎**：LightNav-0 基于 Real2Sim2Real，把 **2000+** 个互联网来源的真实场景转成可反复使用的仿真环境，合成 **4000+** 小时视觉-语言-动作经验用于导航后训练——不走遥操作采集。
- **零样本跨本体**：同一套模型权重，零样本部署到**人形、四足、轮式、飞行**四类机器人本体；基座是 **Qwen3-VL-4B-Instruct**，只扩展词表、不加导航专用头。
- **反直觉细节**：仅用单目 RGB、不依赖深度与里程计，在动态跟踪基准上**反超使用全景与多相机的系统**；在 **10 项**公开仿真评测中取得领先（团队口径）。
- **判断：这不是三篇孤立的论文，是大模型「预训练—后训练—对齐」范式的具身复刻**——Light REACT 干脆把「能站着走就别爬」的人类偏好做进了强化学习目标。

### SRC

本文事实以**量子位 2026-09-13 发布的报道**（微信公众号文章，微博转载）为唯一信源，**素材时间窗为 2026-09-13 09:00 → 19:00**。核查方式与不确定边界：① 「10 项公开仿真评测取得领先」「动态跟踪基准反超多相机系统」等指标均转述自亮源新创技术报告与团队口径，**未在第三方环境独立复现，属单一信源**；② Light REACT 的训练细节（监督学习整合起身、行走和爬行技能，再用 RL 对齐「能站着走就别爬」偏好）来自量子位报道转述；③ 创始人姜旭的 OpenAI RLHF 履历为报道表述，未做独立背景核查；④ LightNav-0 于 9 月 1 日开源的日期为报道明确给出。与 09-13 上午批存量稿《不建地图、不用相机》（ETH 单杠/原始点云）的差异：那篇讲感知降级下的全身控制单点突破，本篇讲一家公司三条技术线的整体路线与 Scaling 方法论，互不重叠。所有判断均已用「判断：」标注。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>评价标准在变</div>

<h2>「会做」和「稳定做成」，是两回事</h2>

<p>量子位这篇报道开头点出了一个正在行业里扩散的共识：机器人「会做」一件事，和它能在开放环境里长期、稳定、泛化地把事情做成，是两回事。能跨过固定高度的障碍，不代表换一种障碍还行；能在一个房间导航，不代表换一个场景、换一种本体仍然有效；正常状态能稳定行走，不代表被撞了一下、摔了一跤、关节损伤之后还能继续工作。</p>

<p>所以行业的评价标准正在从「会多少技能」转向「能力能不能持续规模化扩展」——这里的 Scaling 不只是参数量，也不只是数据量，而是<b>更多环境、更多任务、更多本体，以及进入物理世界后对没见过的状态的适应</b>。</p>

<div class="keypoint">判断：这个转向和本站此前对智元 GE-Act 2.0 的解读一脉相承——具身模型行业正在进入「Scaling 可验证」阶段。区别在于切面：GE-Act 2.0 给出的是<b>任务数据量</b>的 Scaling 曲线（300 小时到 3 万小时），亮源新创三连发给出的是<b>环境、本体、韧性</b>三个维度的扩展框架。两篇合起来看，才是 2026 年具身 Scaling 叙事的完整切面。</div>

</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>三项技术</div>

<h2>跑酷、认路、摔了再站起来</h2>

<p>三项技术各自解决一个问题：</p>

<div class="jx-split">
<div style="flex:33">
<div class="eyebrow">LightParkour</div>
<p>从<b>简短的人类动作片段</b>出发，通过物理仿真与课程学习扩展出复杂接触技能——人类示范只需要几秒钟，剩下靠仿真里练。</p>
</div>
<div style="flex:33">
<div class="eyebrow">LightNav-0</div>
<p>通用导航。以开源视觉语言模型为基座，不添加任何导航专用模块，同一套权重<b>零样本</b>部署到人形、四足、轮式乃至飞行机器人上，听自然语言指令自己找路。</p>
</div>
<div style="flex:33">
<div class="eyebrow">Light REACT</div>
<p>面向<b>外力扰动、跌倒、硬件损伤</b>条件的全身韧性控制，研究机器人如何依据自身交互历史调整运动方式。</p>
</div>
</div>

<p>看起来是三个不相关的方向，但报道点破了它们的公共结构：三项技术都在回答同一个问题——Physical AI 如何从单点能力走向可以规模化训练、规模化对齐、规模化部署的基础模型体系。</p>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">互联网真实场景转仿真环境</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:40%;background:#0a749a"></div></div><div class="jx-bar-val">2000+</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">合成视觉-语言-动作训练数据</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:80%;background:#00a6d6"></div></div><div class="jx-bar-val">4000+ 小时</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">零样本迁移的机器人本体类别</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:16%;background:#0d8a5f"></div></div><div class="jx-bar-val">4 类</div></div>
<div class="jx-legend"><div class="jx-lg">LightNav-0 数据引擎三要素，均来自团队技术报告口径</div></div>
</div>

</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>两个值得记的细节</div>

<h2>传感器降级反超，和按遗忘曲线分配的注意力</h2>

<p>第一个细节是<b>传感器降级、成绩反超</b>。LightNav-0 只用单目 RGB，不依赖深度相机和里程计——在动态跟踪基准上的成绩超过了使用全景与多相机的系统。这类「配置降级、指标反超」的反直觉结果，往往比单纯的 SOTA 更能说明方法本身的含金量：它赢的不是传感器堆料，是训练范式。</p>

<p>第二个细节是记忆设计。为了让模型「记住来路」又不被历史观测撑爆，团队<b>按人类记忆的遗忘曲线分配注意力</b>：越久远的画面保留得越粗略，眼前的画面保留最高精度。工程上，数据没有走遥操作采集，而是把 2000 余个真实场景转成仿真资产、在仿真里合成 4000 余小时训练数据——<b>真实世界负责定义数据分布的边界，仿真负责在边界内规模化</b>，具身后训练由此跨过了最贵的冷启动门槛。</p>

<p>训练流程的复刻则更直白：LightNav-0 的后训练严格按「中期训练—SFT—在线 RL」三阶段展开，几乎是大模型后训练流程的具身翻版；Light REACT 更进一步，先通过监督学习整合起身、行走和爬行技能，再用强化学习对齐<b>「能站着走，就别爬」</b>的人类偏好——把偏好对齐做进了机器人全身控制。</p>

<div class="keypoint">判断：这条路线的出处写在创始人履历里。姜旭在 OpenAI 从事过 RLHF 研究——当很多团队还在讨论具身范式的理论框架时，他属于<b>亲眼见过「对齐」如何把一个只会补全的模型变成产品的</b>那批人。亮源新创的技术选择之所以透着一股罕见的笃定，原因大概在此。<b>判断：未来一年判断具身公司成色的试金石，不再是「发布了什么模型」，而是「后训练流程里有没有一条可审计的对齐链路」。</b></div>

</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>冷静一下</div>

<h2>仿真评测领先，不等于真机领先</h2>

<p>需要泼的冷水：所有亮眼指标都来自<b>仿真评测</b>（10 项公开仿真基准）。导航任务从仿真到真机的落差集中在动态障碍、光照变化和长时程记忆上，而这些恰恰是仿真环境最难保真的部分。4000 小时合成数据的分布边界由那 2000 个真实场景定义——真实世界里没被这 2000 个场景覆盖的东西，模型依然要靠在线学习兜底。</p>

<div class="keypoint">判断：对采购方（包括做机器人租赁与运营的团队）的实际启示是：<b>零样本跨本体意味着换硬件不用重新训练导航模块</b>，这会直接改变机器人机队的混合采购逻辑——导航能力可以成为独立于本体的选型项。但下单前应该要求供应商提供真机环境下的连续运行数据，而不是仿真基准截图。</div>

<div class="srcline">来源：量子位《2000+ 真实场景搬进仿真！一个导航模型零样本「通吃」四种机器人本体》（2026-09-13）。技术指标为团队口径，未经第三方复现。</div>

</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/liangyuan-lightnav-scaling-trilogy/*
