亮源新创一个月三连发:把大模型后训练那套流程,原样搬进机器人全身
跑酷、导航、抗摔三件看似不相关的事,拼起来是一条完整的路线:中期训练、SFT、在线 RL 的后训练三段式,加上把偏好对齐做进全身控制——创始人姜旭来自 OpenAI RLHF 团队,这套打法是他履历的具身复刻。
- 三连发:过去一个多月,亮源新创接连发布 LightParkour(跑酷技能扩展)、LightNav-0(通用导航,9 月 1 日开源)、Light REACT(抗扰韧性控制)三项技术,分别对应技能、导航、全身控制三个方向。
- 数据引擎:LightNav-0 基于 Real2Sim2Real,把 2000+ 个互联网来源的真实场景转成可反复使用的仿真环境,合成 4000+ 小时视觉-语言-动作经验用于导航后训练——不走遥操作采集。
- 零样本跨本体:同一套模型权重,零样本部署到人形、四足、轮式、飞行四类机器人本体;基座是 Qwen3-VL-4B-Instruct,只扩展词表、不加导航专用头。
- 反直觉细节:仅用单目 RGB、不依赖深度与里程计,在动态跟踪基准上反超使用全景与多相机的系统;在 10 项公开仿真评测中取得领先(团队口径)。
- 判断:这不是三篇孤立的论文,是大模型「预训练—后训练—对齐」范式的具身复刻——Light REACT 干脆把「能站着走就别爬」的人类偏好做进了强化学习目标。
「会做」和「稳定做成」,是两回事
量子位这篇报道开头点出了一个正在行业里扩散的共识:机器人「会做」一件事,和它能在开放环境里长期、稳定、泛化地把事情做成,是两回事。能跨过固定高度的障碍,不代表换一种障碍还行;能在一个房间导航,不代表换一个场景、换一种本体仍然有效;正常状态能稳定行走,不代表被撞了一下、摔了一跤、关节损伤之后还能继续工作。
所以行业的评价标准正在从「会多少技能」转向「能力能不能持续规模化扩展」——这里的 Scaling 不只是参数量,也不只是数据量,而是更多环境、更多任务、更多本体,以及进入物理世界后对没见过的状态的适应。
跑酷、认路、摔了再站起来
三项技术各自解决一个问题:
从简短的人类动作片段出发,通过物理仿真与课程学习扩展出复杂接触技能——人类示范只需要几秒钟,剩下靠仿真里练。
通用导航。以开源视觉语言模型为基座,不添加任何导航专用模块,同一套权重零样本部署到人形、四足、轮式乃至飞行机器人上,听自然语言指令自己找路。
面向外力扰动、跌倒、硬件损伤条件的全身韧性控制,研究机器人如何依据自身交互历史调整运动方式。
看起来是三个不相关的方向,但报道点破了它们的公共结构:三项技术都在回答同一个问题——Physical AI 如何从单点能力走向可以规模化训练、规模化对齐、规模化部署的基础模型体系。
传感器降级反超,和按遗忘曲线分配的注意力
第一个细节是传感器降级、成绩反超。LightNav-0 只用单目 RGB,不依赖深度相机和里程计——在动态跟踪基准上的成绩超过了使用全景与多相机的系统。这类「配置降级、指标反超」的反直觉结果,往往比单纯的 SOTA 更能说明方法本身的含金量:它赢的不是传感器堆料,是训练范式。
第二个细节是记忆设计。为了让模型「记住来路」又不被历史观测撑爆,团队按人类记忆的遗忘曲线分配注意力:越久远的画面保留得越粗略,眼前的画面保留最高精度。工程上,数据没有走遥操作采集,而是把 2000 余个真实场景转成仿真资产、在仿真里合成 4000 余小时训练数据——真实世界负责定义数据分布的边界,仿真负责在边界内规模化,具身后训练由此跨过了最贵的冷启动门槛。
训练流程的复刻则更直白:LightNav-0 的后训练严格按「中期训练—SFT—在线 RL」三阶段展开,几乎是大模型后训练流程的具身翻版;Light REACT 更进一步,先通过监督学习整合起身、行走和爬行技能,再用强化学习对齐「能站着走,就别爬」的人类偏好——把偏好对齐做进了机器人全身控制。
仿真评测领先,不等于真机领先
需要泼的冷水:所有亮眼指标都来自仿真评测(10 项公开仿真基准)。导航任务从仿真到真机的落差集中在动态障碍、光照变化和长时程记忆上,而这些恰恰是仿真环境最难保真的部分。4000 小时合成数据的分布边界由那 2000 个真实场景定义——真实世界里没被这 2000 个场景覆盖的东西,模型依然要靠在线学习兜底。