# 28 项基准拿下开源第一的 PhysBrain 1.5：那 0.8 分的差距，测的到底是不是动手能力

> 深度机智 PhysBrain 1.5 的 8B 版在 28 项具身基准上拿 72.5 分，与 GPT-6 Astra 只差 0.8 分。但把 28 个基准名字逐个摊开会发现：它们测的都是「看图答题」的空间理解与规划，没有一项是真机操作成功率。这不是泼冷水，是搞清楚这个分数能兑换什么。

### TLDR

- **成绩**：9 月 9 日发布的 PhysBrain 1.5，8B 版在 **28 项**具身空间智能与规划公开基准上取得 **72.5** 综合均分，其中 **14 项**开源最佳、**10 项**开源第二；3 天下载量超 **3000**。
- **闭源对照**：同表 GPT-6 Astra **73.3**、Gemini 3.6 Flash **73.0**——差距收窄到 **1 分以内**；最强开源对手 Hy-Embodied-VLM-1.0（30A3B）为 **66.0**，落后 **6.5 分**。
- **小版本更值得看**：2B 版拿 **66.6** 分（官方规则不参与排名），数值上仍高于所有其他非 PhysBrain 开源参评模型——参数砍到四分之一，只掉 **5.9 分**。
- **动作维度的证据**：团队内部实验称动作预测能力从 **24% 提升至 54%**；Human-as-Humanoid 原始示范吞吐量达遥操作的 **4.8—7.2 倍**。
- **判断：这 28 张卷子考的是「看懂物理世界」，不是「在物理世界里动手」**——把 BLINK、CV-Bench、MMSI-Bench 这类基准的高分，直接读成操作能力强，是这轮叙事里最大的一次口径滑移。

### SRC

本文事实以**量子位与中关村科学城 2026-09-09 的报道**（含完整 28 项基准分项表）、**深度机智官方技术说明**为基底，交叉**FutureX Physical AI Daily Issue 119（09/14 期）** 的英文复核条目与 **AI Market Watch** 的公司档案页。**素材时间窗为 2026-09-13 18:00 → 2026-09-14 09:00**：模型于 09-09 发布，早于本窗口；本窗口内可定位的**新增量**是 FutureX 09/14 期明确标注该组基准为 **vendor-reported（厂商自报）**，以及 AI Market Watch 给出的第三方公司档案（成立于 2025 年、累计融资约 5000 万美元）。核查方式与不确定边界：① 72.5 分及各分项分数**全部来自项目方自测与自报，未见第三方独立复现**，FutureX 与 AI Market Watch 均就此给出明确警示；② 榜单中 GPT-6 Astra、Gemini 3.6 Flash 分数系项目方引用对比，**非同一评测运行下的结果**，评分设置（low think / minimal think）由项目方标注；③ 2B 版 66.6 分按官方评测规则不参与开源排名，本文的数值比较仅作参考；④ 「动作预测 24% → 54%」「示范吞吐量 4.8—7.2 倍」均为**团队内部实验口径**，未公开评测协议、样本量与失败定义；⑤ 公司成立时间与累计融资额来自第三方数据库，**未经公司方面确认**；⑥ 本文对 28 个基准属性的归类，依据的是基准名称与其公开定义的常识性判断，未逐项查阅原始论文。所有判断均以「判断：」标注。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>先把这张榜单原样摆出来</div>

<p>9 月 9 日，北京海淀的深度机智（DeepCybo）发布物理基座模型 PhysBrain 1.5，同时开源技术报告、2B 与 8B 两档权重，以及一套评测工具包。核心成绩一句话：8B 版在 28 项具身空间智能与规划基准上拿到 <strong>72.5</strong> 的综合均分，居参评开源模型首位。</p>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">GPT-6 Astra（闭源）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#566781"></div></div><div class="jx-bar-val">73.3</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Gemini 3.6 Flash（闭源）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:99%;background:#566781"></div></div><div class="jx-bar-val">73.0</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">PhysBrain 1.5 · 8B</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:99%;background:#0a749a"></div></div><div class="jx-bar-val">72.5</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Claude Opus 5（闭源）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:93%;background:#566781"></div></div><div class="jx-bar-val">67.9</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">PhysBrain 1.5 · 2B</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:91%;background:#00a6d6"></div></div><div class="jx-bar-val">66.6</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Hy-Embodied-VLM-1.0（30A3B）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:90%;background:#4b5f8a"></div></div><div class="jx-bar-val">66.0</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Embodied-R1.5（8B）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:89%;background:#4b5f8a"></div></div><div class="jx-bar-val">64.9</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">RynnBrain 1.1（9B）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:86%;background:#4b5f8a"></div></div><div class="jx-bar-val">63.1</div></div>
<div class="jx-legend"><div class="jx-lg">28 项具身空间智能与规划基准综合均分。深蓝为 PhysBrain 1.5，灰为闭源模型，蓝灰为其他开源参评模型。全部数值为项目方自报，未获第三方独立复现。</div></div>
</div>

<p>有两个数字值得单独说。第一个是 <strong>0.8 分</strong>——72.5 与闭源最强的 GPT-6 Astra（73.3）之间的差距。放在两年前，开源具身模型与闭源前沿之间还是两位数的分差，现在被压到 1 分以内。</p>

<p>第二个是 <strong>2B 版的 66.6 分</strong>。按官方评测规则，2B 版本仅作参考、不参与开源排名。但只比数值的话，它已经超过表中所有其他非 PhysBrain 的开源参评模型，包括 30A3B 的 Hy-Embodied-VLM-1.0（66.0）、8B 的 Embodied-R1.5（64.9）和 9B 的 RynnBrain 1.1（63.1）。参数从 8B 砍到 2B，只掉 5.9 分，却仍站在所有对手之上——这说明 2B 版不是 8B 的「展示性缩小版」，而是同一技术路线同时覆盖了性能上限和轻量部署两个方向。对开发者而言，后者的意义可能更大：一个能在边缘设备上跑起来的具身理解底座，比一个只能放在服务器上的榜单冠军有用得多。</p>

</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>把这 28 张卷子逐个翻一遍</div>

<p>现在做一件很少有人做的事：把这 28 个基准的名字摊开看，它们到底在考什么。</p>

<div class="tbl-wrap"><table>
<thead><tr><th>能力维度</th><th>代表性基准</th><th>它实际在考什么</th></tr></thead>
<tbody>
<tr><td>基础视空感知</td><td>BLINK、CV-Bench、3DSRBench</td><td>看图判断深度、尺寸、空间关系</td></tr>
<tr><td>空间与多视角理解</td><td>EmbSpatial-Bench、MindCube、MMSI-Bench、VSI-Bench</td><td>跨视角推理、空间想象、多图一致性</td></tr>
<tr><td>具身认知与规划</td><td>EgoPlan-Bench2、ERQA、RoboVQA、VLABench</td><td>给定第一视角画面，回答「下一步该做什么」</td></tr>
<tr><td>空间指向与可供性</td><td>Part-Affordance、RoboAfford、Where2Place、RoboRefit</td><td>指出「哪里可以抓、放在哪」</td></tr>
<tr><td>视觉轨迹推理</td><td>ShareRobot-Traj、VABench-V-Trace</td><td>根据画面判断轨迹是否合理</td></tr>
</tbody>
</table></div>
<div class="cap">表：PhysBrain 1.5 评测覆盖的五类能力与代表性基准。归类与释义为本文依据基准公开定义的整理，供读者判断分数含义，非项目方原始分类表述。</div>

<p>看出来了吗？这 28 项<strong>全部是「给模型看一张图或一段视频，让它输出一个答案」的评测</strong>——输出的是坐标、选项、轨迹描述或语言回答，不是发给电机的控制指令。BLINK 考相对深度判断，MMSI-Bench 考多图空间一致性，RoboVQA 考视频问答，Part-Affordance 考「这个物体的哪个部位可以操作」。</p>

<p>这些能力重要吗？<strong>极其重要</strong>。一个连「杯子把手在哪里可以抓」都判断不对的模型，不可能完成任何操作任务。Part-Affordance 84.0 分、RoboRefit 89.8 分，说明的是模型对物理世界的理解水位确实上来了。</p>

<div class="keypoint">判断：但「理解哪里可以抓」和「真的抓起来了」是两件事，中间隔着整个运动控制与接触力学的鸿沟。<b>把 28 项 VQA 类基准的均分，读成机器人操作能力的排名，是这轮叙事里最大的一次口径滑移。</b>这不是深度机智一家的问题——整张榜单都是这么设计的，行业目前也确实没有更好的公开标尺。</div>

</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>反过来看闭源模型：那次机械臂实验的两个数字</div>

<p>要理解「理解」与「操作」的落差有多大，可以借一个第三方的对照实验。Robocurve 把 GPT-6 Astra 直接部署到真实机械臂上，做了两类任务：</p>

<div class="jx-split">
<div style="flex:50">
<div class="eyebrow">积木放入碗 · 20 次</div>
<p>GPT-6 Astra 成功 <strong>19 次</strong>，成功率 <strong>95%</strong>；对照组 Claude Fable 5.1 完成 <strong>8 次</strong>。</p>
<p>模型读取摄像头画面与机器人自身状态，输出末端位姿与夹爪指令，并靠实时视觉反馈迭代调整。</p>
</div>
<div style="flex:50">
<div class="eyebrow">拼图块对位插入凹槽</div>
<p>同一套测试，GPT-6 Astra 成功率<strong>从 95% 掉到 10%</strong>。</p>
<p>毫米级精细装配任务，需要精确的接触判断与力反馈，通用理解能力在这里几乎帮不上忙。</p>
</div>
</div>

<p>这组对照把问题说得非常清楚：<strong>通用多模态理解可以跨越「看懂」到「粗动作」的鸿沟，却在「精细接触、精准插入」面前止步</strong>。而 PhysBrain 1.5 的 72.5 分，测的是前一半能力；后一半能力，在这张榜单里没有对应的格子。</p>

<p>那么深度机智在「动作」这一侧到底有什么公开证据？有两条，都需要标注口径：</p>

<p>其一是<strong>动作预测能力从 24% 提升至 54%</strong>——这是团队内部实验的数字，未公开评测协议、样本量与失败定义。其二是 Human-as-Humanoid 研究：把同步采集的第一视角与外部视角人类视频，转化为适配 Prime U（60 自由度拟人本体）的动作训练数据，<strong>原始示范吞吐量达到遥操作的 4.8—7.2 倍</strong>，部分任务无需目标机器人本体示范即可实现零样本迁移。</p>

<div class="jx-note">第二条比第一条更有分量，因为它解决的是具身智能最贵的一环：数据从哪来。如果人类视频能以 4.8—7.2 倍于遥操作的效率转成训练数据，那么「逐条采集机器人示范」这条最烧钱的路径就有可能被绕开。当然，这个倍数同样出自团队自己的测算。</div>

</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>该把这个 72.5 分放在什么位置</div>

<p>把上面几层叠起来，可以得到一个相对公平的读法。</p>

<p><strong>站得住的部分</strong>：在「空间理解与可供性判断」这个明确的能力切面上，一个 8B 的开源模型确实追到了闭源前沿 1 分以内，而且 2B 版本仍高于所有其他开源参评模型。技术报告、两档权重、评测工具包全部开放，社区可以自行复现——这一点本身就比多数只发公关稿的发布要扎实。</p>

<p><strong>需要打折的部分</strong>：全部分数为厂商自报，FutureX 与 AI Market Watch 都明确给了 vendor-reported / company-reported 的标注，未见第三方独立复现；闭源对照分数是项目方引用的对比值，不是同一评测运行下的结果；而「动作预测 24% → 54%」这条唯一的动作侧指标，是未公开协议的内部实验。</p>

<div class="keypoint">判断：PhysBrain 1.5 真正的位置，是<b>把开源具身模型的「理解层」水位推到了与闭源前沿持平</b>，同时用 2B 版本证明了这条路线可以下沉到边缘部署。但它还没有回答那个更难的问题——理解到位之后，手能不能跟上。行业缺的恰恰是后者对应的公开标尺：一份像这 28 项基准一样，能让所有人对着同一套协议报真机操作成功率的榜单。</div>

<p>顺带记一笔公司侧的信息：第三方数据库 AI Market Watch 的档案显示，深度机智成立于 2025 年、累计融资约 5000 万美元。这与公开材料中「2025 年 10 月 10 日发布《源于人，超越人》发展战略」的时间线大致对得上，但成立时间与融资额均来自第三方数据库，未经公司方面确认。一家成立不到两年的公司，把 28 项基准的开源第一和两档权重一起放出来，节奏本身是值得观察的样本。</p>

</div>

<div class="srcline">来源：量子位 / 中关村科学城 2026-09-09 PhysBrain 1.5 发布报道及 28 项基准分项表；FutureX Physical AI Daily Issue 119（09/14 期，标注 vendor-reported）；AI Market Watch 公司档案；Hugging Face collections/DeepCybo/physbrain-15。素材时间窗：2026-09-13 18:00 → 2026-09-14 09:00。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/physbrain-15-28-benchmarks-vqa-not-manipulation/*
