研究解读 · 神机百见-具身解读

纸杯被人为拆掉还能接着摞:清华 EMERGE-Policy 把「抗干扰」从 40% 提到 85% 以上的系统办法

一个主智能体加三类子智能体,用图结构调度 VLA 和世界模型,再用三个 Markdown 文件管记忆——清华团队的 EMERGE-Policy 在真机纸杯实验里扛住了人为拆毁和尺寸扰动,成功率保持 85% 到 94%。这可能是「系统编排」第一次在具身智能里正面击败「单个大模型」。

一分钟速览
  1. 架构:清华深圳国际研究生院李秀团队联合多所高校发布 EMERGE-Policy,把 VLA(π0.5)、世界模型(Cosmos Policy)、验证器解耦为统一技能库,由 1 个主智能体加感知、验证、监控 3 类子智能体做图结构调度。
  2. 基准:Standard LIBERO 平均成功率 99.2%;LIBERO-Plus 扰动测试 93.9%,较单一底座提升 11.7 个百分点
  3. 真机:多层纸杯叠放 100 次实验中,在人为拆毁、纸杯尺寸变化 5% 到 15%、颜色与相机视角变动等干扰下,成功率保持 85% 到 94%
  4. 记忆:用 PLAN.md / HISTORY.md / MEMORY.md 三层文件管理长程状态——用工程师最熟悉的文件格式替代隐式向量状态。
  5. 判断:论文、代码、项目主页全公开,复现门槛低;但它证明的是「编排层的价值」,不是某个单一模型的能力上限,两条路线不该混为一谈。
数据来源与边界
本篇素材时间窗为当日 09:00 → 19:00,采用「窗口外论文 + 近 3 日报道跟进」处理:论文为 arXiv 2608.29896v2,中文聚合源「具身机器人-每日速递」于 9 月 13 日(窗口外一天、近 3 日内)跟进报道,本篇在窗口内完成核查与解读,SRC 写明与既有稿件差异:055 号稿(VLA corrector)写的是「外挂纠偏器」,093 号稿(ReactHuman)写的是「多模态大模型当大脑的失败率」,本篇写的是「多智能体调度架构」——三者同属可靠性主题,但介入层级分别是动作层、感知层、编排层,结论不重复。核查边界:全部数字(99.2%、93.9%、+11.7%、100 次真机、85%–94%)来自聚合日报对论文的转述,属二手口径,「单一聚合信源」,原论文数值未逐项复核;论文、代码与项目主页已公开可供验证。判断均为作者观点。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先说清楚它解决的是什么问题

具身智能的演示视频有个通病:环境永远配合。纸杯摆在该摆的位置、光照正常、没人捣乱。可真实部署里,最贵的故障往往来自「计划外」——人碰了一下半成品、物料尺寸变了 10%、相机被人挪了角度。行业里管这叫抗干扰能力,而目前主流的单体端到端模型在这里的表现普遍难看:环境一动,成功率断崖。

清华深圳国际研究生院李秀教授团队联合多所高校发布的 EMERGE-Policy,给出的是一套系统层答案。它不做一个新的「超级模型」,而是把现成的组件拆开重排:VLA 模型(π0.5)负责动作生成,世界模型(Cosmos Policy)负责推演,验证器负责把关,三者被解耦成统一技能库;之上由一个主智能体加感知、验证、监控三类子智能体,以图结构做异步并发调度。哪个组件在什么时刻被调用、结果由谁复核、异常由谁兜底,全部显式化。

感知
子智能体持续比对环境状态与任务预期
调度
主智能体按图结构编排 VLA 与世界模型的调用时序
验证
验证器对每步结果把关,不达标触发回退与重试
记忆
PLAN / HISTORY / MEMORY 三层文件管理长程任务状态
数字怎么说

基准层面,Standard LIBERO 平均成功率 99.2%;更难的 LIBERO-Plus 扰动测试拿到 93.9%,比单一底座高出 11.7 个百分点——这 11.7 个点基本就是「编排层」卖的东西。真机层面的实验设计更值得细看:多层纸杯叠放,连做 100 次,期间人为拆毁已叠好的部分、把纸杯尺寸做 5% 到 15% 的变化、改变颜色和相机视角,成功率仍保持在 85% 到 94% 区间。换句话说,系统不是靠「环境不变」活着,而是靠「环境变了能发现、能重规划、能回退」活着。

还有一个工程细节容易被略过:三层文件记忆。用 PLAN.md 存任务计划、HISTORY.md 存执行历史、MEMORY.md 存长期状态——这套命名对写过代码的人一目了然。它把长程任务的状态管理从黑箱向量搬进了可读、可改、可审计的文件里。判断:这个设计选择透露了团队的工程价值观——真实工位要的不是玄学,是出了问题能翻日志。

和两条既有路线摆在一起看

库内此前写过两篇同主题稿件,恰好可以拼出一张可靠性地图。055 号稿写的 VLA corrector 是动作层的方案:给 VLA 外挂一个 4000 万参数的纠偏器,扰动恢复率从 40% 提到 68.3%;093 号稿写的 ReactHuman 是感知层的警示:让 7 个多模态大模型直接当人形机器人的大脑,每三个突发危险就有一个判错。而 EMERGE-Policy 站在编排层:它不假设任何一个模型足够聪明,而是假设每个模型都会出错,用调度和验证把单点故障隔离开。三层方案并不互斥——真机系统最终可能三层都要。

判断:「一个模型打天下」和「一群模型互相盯梢」的路线之争,正在从学术分歧变成工程分水岭。EMERGE-Policy 的 85%–94% 说明在干扰密集的场景里,编排层的收益大于堆模型参数;但它也有代价——多组件系统的延迟、组件间接口的维护成本、以及「验证器自己错了怎么办」的递归问题,论文没有给出完整答案。
对产业侧的三个落地提示

第一,论文、代码与项目主页均已公开,是国内团队里少见的「全裸开源」姿态,复现门槛低,做集成交付的团队一周内就能判断它对自家场景是否可用。第二,它的架构假设——组件可替换——恰好契合国内多模型并存的现实:底座模型换血时,编排层不需要推倒重来。第三,给集成商的提醒:99.2% 的 LIBERO 成绩和 85%–94% 的真机抗干扰成绩是两回事,前者是理想基准,后者才是部署口径;评估任何「高成功率」宣传时,先问是哪一种。

论文:arXiv 2608.29896v2(清华深圳国际研究生院李秀团队等,代码与项目主页已公开);中文报道:具身机器人-每日速递 2026-09-13 期。数字为聚合源转述的二手口径,未逐项复核原论文。