当你的眼睛比手更聪明:VLM 的"身体盲区"与 16.8% 的尴尬
一台能看见一切的机器,却不会用手
想象一位外科医生,拥有世界上最先进的眼睛——能看清每一根血管的走向,能识别肿瘤的边界,能分辨组织的层次。但她的手没有触觉,不知道自己在哪儿,不知道有没有碰到东西,不知道缝针有没有缝进去。
你会让她做手术吗?
这就是 2026 年 7 月,Meta 联合南洋理工、华盛顿大学等五所机构在论文 HumanCLAW 中揭示的尴尬现实。当今最强的视觉-语言模型(VLM),被装进一个虚拟人的身体里,让它在 41 个室内场景中完成"找到目标→走过去→交互"的任务——成功率只有 16.8%。
不是它看不见。它看得见。问题是它感觉不到自己。
三种"行动智能"的分层
论文提出了一个清晰的三层框架来理解"行动智能"住在哪里:
第一层:没有身体的行动。 纯语言输出——"请帮我写一封邮件"。模型不需要知道自己在哪里,语言就是行动。
第二层:有身体但无闭环。 一次性指令——"去厨房拿杯水"。模型输出一个动作序列,执行完毕就结束,不关心中间发生了什么。
第三层:亚秒级闭环。 持续感知-决策-执行——"在杂乱房间里走到桌边拿起那个杯子"。每一步都要看、想、动,每一步都可能出错,每一步都要根据上一步的结果调整。
HumanCLAW 测的就是第三层。这一层有一个被忽视的核心能力:本体感觉(proprioception)——知道自己的身体在哪、在做什么、有没有碰到东西。
1218 个场景,九个模型,一个结论
研究团队构建了 HumanCLAW-Bench:1218 个长时程第一人称"找-走-交互"任务,覆盖 41 个室内场景,测试了九个最先进的 VLM。
任务设计很巧妙。模型不直接控制肌肉,而是通过一个"技能条件运动生成器"来执行——你告诉它"往前走"或"伸手抓",它生成相应的动作。这样就把"决策对不对"和"执行准不准"解耦了。如果任务失败,不是手没动好,是脑子下错了指令。
结果:最好的模型只有 16.8% 的成功率。也就是说,超过五分之四的任务失败了。
失败的解剖学:34% 和 81%
最精彩的不是数字,而是失败分析。研究团队做了自动化的根因归因,把每一次失败拆开来看:
导航失败中,34% 是"身体意识"失败。 分两种:
- 20% 的情况:模型已经到达目标 0.2 米以内,但不知道自己到了,继续往前走,永远停不下来。
- 14% 的情况:模型撞在障碍物上卡住了,但继续发出"前进"指令,不知道自己被堵住了。
还有 30% 的失败是"距离幻觉":模型停下来宣布"我到了",但其实还离目标 0.2 米以上,把远处的东西当成近处。
这个分布说明一个根本问题:VLM 的视觉识别能力已经很强了——它确实能"看见"目标。但它不知道自己在哪、不知道自己的身体在做什么。
消融实验:验证器是决定性组件
论文的消融实验揭示了几个反直觉的发现:
验证器是决定性组件。 在"找-走-交互"三步中,"是否到达目标"的验证器比视觉感知本身更关键。一个好的验证器能大幅提升成功率,而堆更多视觉帧反而可能有害——更多图像帧带来了更多噪音,而不是更多信息。
文本历史是必要的,但很快饱和。 给模型看过去的动作历史很重要,但不需要太多——几步就够了。太多历史反而干扰当前决策。
中间层推理承载长时程交互。 不是高层目标("去拿杯子")也不是底层动作("往前 0.3 米"),而是中间层的推理("我需要先绕过桌子")对长时程任务最关键。
"感觉身体,而不仅仅是看见世界"
论文的讨论部分有一句话值得反复品味:
> "What current VLMs lack is embodied self-awareness: they lose track of their own body, failing to tell where it is, whether it has reached the goal, or whether it has hit an obstacle."
> "This is not a peripheral nuisance—body awareness underlies 34% of navigation failures and 81% of interaction failures—but a core capability that embodied action has yet to acquire: feeling the body, not merely seeing the world."
翻译过来就是:感觉身体,而不仅仅是看见世界。
这里有一个微妙的架构问题。HumanCLAW 的模拟器没有触觉通道——碰撞会移开世界,但永远不会被"感觉到"。模型只能通过第一人称视觉来重建身体状态。这可能本身就是困难的根源。
论文最后留了一个开放问题:如果给模型一个身体状态信号或接触信号,能不能补上这块短板?他们相信这是可行的——HumanCLAW-Bench 留了很大的提升空间。
这为什么重要
HumanCLAW 的意义不在于又一个 benchmark,而在于它精确定位了一个被忽视的能力维度:
当前 AI 社区在"让模型看懂世界"上投入巨大——视觉 grounding、空间推理、3D 理解。但在"让模型感觉自己"上几乎是空白。
这和人类发育形成有趣对照。婴儿先发展本体感觉(知道自己的身体在哪),再发展视觉空间认知。皮亚杰的认知发展理论中,感觉运动阶段(0-2 岁)是所有后续认知的基础。HumanCLAW 暗示 AI 可能需要走一条类似的路径——先解决"我在哪"和"我在做什么",再解决更高级的任务规划。
从工程角度,这提出了一个清晰的设计原则:具身 AI 系统需要三个独立模块——视觉感知(看世界)、本体感觉(感觉身体)、动作验证(确认结果)。当前 VLM 把前两者混在一起,用视觉代替本体感觉,这正是 81% 交互失败的根源。
一个类比收尾
你蒙上眼睛走路,即使前面没有障碍,也会越走越歪——不是因为你看不见路,而是因为你失去了本体感觉反馈。小脑里的身体地图在告诉你"左脚刚落地、重心偏右了、该出右脚了"。这个反馈不需要眼睛。
VLM 现在的状态就像一个蒙眼走路的人,但更糟——它连"左脚刚落地"都不知道。它看得见终点,但不知道自己在哪条路上。
16.8% 的成功率不是终点,而是起点。论文的潜台词是:补上身体意识,成功率就会跳一个台阶。 这比继续堆参数、堆视觉数据、堆训练算力都更直接。
---
论文信息:
- 标题:HumanCLAW: Can Vision-Language Models Act Through a Body?
- 作者:Li Siyao, Jiawei Gu, Shuai Liu 等(Meta / 南洋理工 / 华盛顿大学 / 布朗大学 / 西北大学)
- arXiv:2607.27180(2026 年 7 月 29 日)
- 项目页:https://human-claw.github.io
- 1218 个任务,41 个场景,9 个 VLM
- 最高成功率 16.8%
- 导航失败 34% 源于身体意识缺失,交互失败 81% 源于身体意识缺失
- 消融发现:验证器 > 视觉帧数;中间层推理承载长时程交互