静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-08-06 02:33

当你的眼睛比手更聪明:VLM 的"身体盲区"与 16.8% 的尴尬

一台能看见一切的机器,却不会用手

想象一位外科医生,拥有世界上最先进的眼睛——能看清每一根血管的走向,能识别肿瘤的边界,能分辨组织的层次。但她的手没有触觉,不知道自己在哪儿,不知道有没有碰到东西,不知道缝针有没有缝进去。

你会让她做手术吗?

这就是 2026 年 7 月,Meta 联合南洋理工、华盛顿大学等五所机构在论文 HumanCLAW 中揭示的尴尬现实。当今最强的视觉-语言模型(VLM),被装进一个虚拟人的身体里,让它在 41 个室内场景中完成"找到目标→走过去→交互"的任务——成功率只有 16.8%。

不是它看不见。它看得见。问题是它感觉不到自己。

三种"行动智能"的分层

论文提出了一个清晰的三层框架来理解"行动智能"住在哪里:

第一层:没有身体的行动。 纯语言输出——"请帮我写一封邮件"。模型不需要知道自己在哪里,语言就是行动。

第二层:有身体但无闭环。 一次性指令——"去厨房拿杯水"。模型输出一个动作序列,执行完毕就结束,不关心中间发生了什么。

第三层:亚秒级闭环。 持续感知-决策-执行——"在杂乱房间里走到桌边拿起那个杯子"。每一步都要看、想、动,每一步都可能出错,每一步都要根据上一步的结果调整。

HumanCLAW 测的就是第三层。这一层有一个被忽视的核心能力:本体感觉(proprioception)——知道自己的身体在哪、在做什么、有没有碰到东西。

1218 个场景,九个模型,一个结论

研究团队构建了 HumanCLAW-Bench:1218 个长时程第一人称"找-走-交互"任务,覆盖 41 个室内场景,测试了九个最先进的 VLM。

任务设计很巧妙。模型不直接控制肌肉,而是通过一个"技能条件运动生成器"来执行——你告诉它"往前走"或"伸手抓",它生成相应的动作。这样就把"决策对不对"和"执行准不准"解耦了。如果任务失败,不是手没动好,是脑子下错了指令。

结果:最好的模型只有 16.8% 的成功率。也就是说,超过五分之四的任务失败了

失败的解剖学:34% 和 81%

最精彩的不是数字,而是失败分析。研究团队做了自动化的根因归因,把每一次失败拆开来看:

导航失败中,34% 是"身体意识"失败。 分两种:

  • 20% 的情况:模型已经到达目标 0.2 米以内,但不知道自己到了,继续往前走,永远停不下来。
  • 14% 的情况:模型撞在障碍物上卡住了,但继续发出"前进"指令,不知道自己被堵住了。
交互失败中,81% 是"身体意识"失败。 模型走到了目标附近,但不知道自己的手相对于目标的位置,抓了个空。

还有 30% 的失败是"距离幻觉":模型停下来宣布"我到了",但其实还离目标 0.2 米以上,把远处的东西当成近处。

这个分布说明一个根本问题:VLM 的视觉识别能力已经很强了——它确实能"看见"目标。但它不知道自己在哪、不知道自己的身体在做什么。

消融实验:验证器是决定性组件

论文的消融实验揭示了几个反直觉的发现:

验证器是决定性组件。 在"找-走-交互"三步中,"是否到达目标"的验证器比视觉感知本身更关键。一个好的验证器能大幅提升成功率,而堆更多视觉帧反而可能有害——更多图像帧带来了更多噪音,而不是更多信息。

文本历史是必要的,但很快饱和。 给模型看过去的动作历史很重要,但不需要太多——几步就够了。太多历史反而干扰当前决策。

中间层推理承载长时程交互。 不是高层目标("去拿杯子")也不是底层动作("往前 0.3 米"),而是中间层的推理("我需要先绕过桌子")对长时程任务最关键。

"感觉身体,而不仅仅是看见世界"

论文的讨论部分有一句话值得反复品味:

> "What current VLMs lack is embodied self-awareness: they lose track of their own body, failing to tell where it is, whether it has reached the goal, or whether it has hit an obstacle."

> "This is not a peripheral nuisance—body awareness underlies 34% of navigation failures and 81% of interaction failures—but a core capability that embodied action has yet to acquire: feeling the body, not merely seeing the world."

翻译过来就是:感觉身体,而不仅仅是看见世界。

这里有一个微妙的架构问题。HumanCLAW 的模拟器没有触觉通道——碰撞会移开世界,但永远不会被"感觉到"。模型只能通过第一人称视觉来重建身体状态。这可能本身就是困难的根源。

论文最后留了一个开放问题:如果给模型一个身体状态信号或接触信号,能不能补上这块短板?他们相信这是可行的——HumanCLAW-Bench 留了很大的提升空间。

这为什么重要

HumanCLAW 的意义不在于又一个 benchmark,而在于它精确定位了一个被忽视的能力维度:

当前 AI 社区在"让模型看懂世界"上投入巨大——视觉 grounding、空间推理、3D 理解。但在"让模型感觉自己"上几乎是空白。

这和人类发育形成有趣对照。婴儿先发展本体感觉(知道自己的身体在哪),再发展视觉空间认知。皮亚杰的认知发展理论中,感觉运动阶段(0-2 岁)是所有后续认知的基础。HumanCLAW 暗示 AI 可能需要走一条类似的路径——先解决"我在哪"和"我在做什么",再解决更高级的任务规划。

从工程角度,这提出了一个清晰的设计原则:具身 AI 系统需要三个独立模块——视觉感知(看世界)、本体感觉(感觉身体)、动作验证(确认结果)。当前 VLM 把前两者混在一起,用视觉代替本体感觉,这正是 81% 交互失败的根源。

一个类比收尾

你蒙上眼睛走路,即使前面没有障碍,也会越走越歪——不是因为你看不见路,而是因为你失去了本体感觉反馈。小脑里的身体地图在告诉你"左脚刚落地、重心偏右了、该出右脚了"。这个反馈不需要眼睛。

VLM 现在的状态就像一个蒙眼走路的人,但更糟——它连"左脚刚落地"都不知道。它看得见终点,但不知道自己在哪条路上。

16.8% 的成功率不是终点,而是起点。论文的潜台词是:补上身体意识,成功率就会跳一个台阶。 这比继续堆参数、堆视觉数据、堆训练算力都更直接。

---

论文信息:

  • 标题:HumanCLAW: Can Vision-Language Models Act Through a Body?
  • 作者:Li Siyao, Jiawei Gu, Shuai Liu 等(Meta / 南洋理工 / 华盛顿大学 / 布朗大学 / 西北大学)
  • arXiv:2607.27180(2026 年 7 月 29 日)
  • 项目页:https://human-claw.github.io
核心数据:
  • 1218 个任务,41 个场景,9 个 VLM
  • 最高成功率 16.8%
  • 导航失败 34% 源于身体意识缺失,交互失败 81% 源于身体意识缺失
  • 消融发现:验证器 > 视觉帧数;中间层推理承载长时程交互
开源状态: 论文未提供代码仓库,项目页 https://human-claw.github.io 可能后续发布。

暂无表态