28 项基准拿下开源第一的 PhysBrain 1.5:那 0.8 分的差距,测的到底是不是动手能力
深度机智 PhysBrain 1.5 的 8B 版在 28 项具身基准上拿 72.5 分,与 GPT-6 Astra 只差 0.8 分。但把 28 个基准名字逐个摊开会发现:它们测的都是「看图答题」的空间理解与规划,没有一项是真机操作成功率。这不是泼冷水,是搞清楚这个分数能兑换什么。
- 成绩:9 月 9 日发布的 PhysBrain 1.5,8B 版在 28 项具身空间智能与规划公开基准上取得 72.5 综合均分,其中 14 项开源最佳、10 项开源第二;3 天下载量超 3000。
- 闭源对照:同表 GPT-6 Astra 73.3、Gemini 3.6 Flash 73.0——差距收窄到 1 分以内;最强开源对手 Hy-Embodied-VLM-1.0(30A3B)为 66.0,落后 6.5 分。
- 小版本更值得看:2B 版拿 66.6 分(官方规则不参与排名),数值上仍高于所有其他非 PhysBrain 开源参评模型——参数砍到四分之一,只掉 5.9 分。
- 动作维度的证据:团队内部实验称动作预测能力从 24% 提升至 54%;Human-as-Humanoid 原始示范吞吐量达遥操作的 4.8—7.2 倍。
- 判断:这 28 张卷子考的是「看懂物理世界」,不是「在物理世界里动手」——把 BLINK、CV-Bench、MMSI-Bench 这类基准的高分,直接读成操作能力强,是这轮叙事里最大的一次口径滑移。
9 月 9 日,北京海淀的深度机智(DeepCybo)发布物理基座模型 PhysBrain 1.5,同时开源技术报告、2B 与 8B 两档权重,以及一套评测工具包。核心成绩一句话:8B 版在 28 项具身空间智能与规划基准上拿到 72.5 的综合均分,居参评开源模型首位。
有两个数字值得单独说。第一个是 0.8 分——72.5 与闭源最强的 GPT-6 Astra(73.3)之间的差距。放在两年前,开源具身模型与闭源前沿之间还是两位数的分差,现在被压到 1 分以内。
第二个是 2B 版的 66.6 分。按官方评测规则,2B 版本仅作参考、不参与开源排名。但只比数值的话,它已经超过表中所有其他非 PhysBrain 的开源参评模型,包括 30A3B 的 Hy-Embodied-VLM-1.0(66.0)、8B 的 Embodied-R1.5(64.9)和 9B 的 RynnBrain 1.1(63.1)。参数从 8B 砍到 2B,只掉 5.9 分,却仍站在所有对手之上——这说明 2B 版不是 8B 的「展示性缩小版」,而是同一技术路线同时覆盖了性能上限和轻量部署两个方向。对开发者而言,后者的意义可能更大:一个能在边缘设备上跑起来的具身理解底座,比一个只能放在服务器上的榜单冠军有用得多。
现在做一件很少有人做的事:把这 28 个基准的名字摊开看,它们到底在考什么。
| 能力维度 | 代表性基准 | 它实际在考什么 |
|---|---|---|
| 基础视空感知 | BLINK、CV-Bench、3DSRBench | 看图判断深度、尺寸、空间关系 |
| 空间与多视角理解 | EmbSpatial-Bench、MindCube、MMSI-Bench、VSI-Bench | 跨视角推理、空间想象、多图一致性 |
| 具身认知与规划 | EgoPlan-Bench2、ERQA、RoboVQA、VLABench | 给定第一视角画面,回答「下一步该做什么」 |
| 空间指向与可供性 | Part-Affordance、RoboAfford、Where2Place、RoboRefit | 指出「哪里可以抓、放在哪」 |
| 视觉轨迹推理 | ShareRobot-Traj、VABench-V-Trace | 根据画面判断轨迹是否合理 |
看出来了吗?这 28 项全部是「给模型看一张图或一段视频,让它输出一个答案」的评测——输出的是坐标、选项、轨迹描述或语言回答,不是发给电机的控制指令。BLINK 考相对深度判断,MMSI-Bench 考多图空间一致性,RoboVQA 考视频问答,Part-Affordance 考「这个物体的哪个部位可以操作」。
这些能力重要吗?极其重要。一个连「杯子把手在哪里可以抓」都判断不对的模型,不可能完成任何操作任务。Part-Affordance 84.0 分、RoboRefit 89.8 分,说明的是模型对物理世界的理解水位确实上来了。
要理解「理解」与「操作」的落差有多大,可以借一个第三方的对照实验。Robocurve 把 GPT-6 Astra 直接部署到真实机械臂上,做了两类任务:
GPT-6 Astra 成功 19 次,成功率 95%;对照组 Claude Fable 5.1 完成 8 次。
模型读取摄像头画面与机器人自身状态,输出末端位姿与夹爪指令,并靠实时视觉反馈迭代调整。
同一套测试,GPT-6 Astra 成功率从 95% 掉到 10%。
毫米级精细装配任务,需要精确的接触判断与力反馈,通用理解能力在这里几乎帮不上忙。
这组对照把问题说得非常清楚:通用多模态理解可以跨越「看懂」到「粗动作」的鸿沟,却在「精细接触、精准插入」面前止步。而 PhysBrain 1.5 的 72.5 分,测的是前一半能力;后一半能力,在这张榜单里没有对应的格子。
那么深度机智在「动作」这一侧到底有什么公开证据?有两条,都需要标注口径:
其一是动作预测能力从 24% 提升至 54%——这是团队内部实验的数字,未公开评测协议、样本量与失败定义。其二是 Human-as-Humanoid 研究:把同步采集的第一视角与外部视角人类视频,转化为适配 Prime U(60 自由度拟人本体)的动作训练数据,原始示范吞吐量达到遥操作的 4.8—7.2 倍,部分任务无需目标机器人本体示范即可实现零样本迁移。
把上面几层叠起来,可以得到一个相对公平的读法。
站得住的部分:在「空间理解与可供性判断」这个明确的能力切面上,一个 8B 的开源模型确实追到了闭源前沿 1 分以内,而且 2B 版本仍高于所有其他开源参评模型。技术报告、两档权重、评测工具包全部开放,社区可以自行复现——这一点本身就比多数只发公关稿的发布要扎实。
需要打折的部分:全部分数为厂商自报,FutureX 与 AI Market Watch 都明确给了 vendor-reported / company-reported 的标注,未见第三方独立复现;闭源对照分数是项目方引用的对比值,不是同一评测运行下的结果;而「动作预测 24% → 54%」这条唯一的动作侧指标,是未公开协议的内部实验。
顺带记一笔公司侧的信息:第三方数据库 AI Market Watch 的档案显示,深度机智成立于 2025 年、累计融资约 5000 万美元。这与公开材料中「2025 年 10 月 10 日发布《源于人,超越人》发展战略」的时间线大致对得上,但成立时间与融资额均来自第三方数据库,未经公司方面确认。一家成立不到两年的公司,把 28 项基准的开源第一和两档权重一起放出来,节奏本身是值得观察的样本。