🚪 上期回顾:耳朵交了白卷,这次该上手了
前两篇的诊断书还挂在墙上。
第一篇 WorldSolver,我们给 AI 的皮肤做了体检:让它把一捧水、一块布、一缕烟写成真正能跑的物理模拟器。最好的模型只拿到一半分数,一个课本级的牛顿摆都能晃成事故现场。结论:物理直觉这块皮肤,还没长好。
第二篇 Coupled but Late,我们测了耳朵。两台全双工语音模型对坐聊天,没有人类在场吸收误差,结果它们长出了一套自洽的、稳定的、但从人类视角看完全失礼的节奏——中位数迟到 480 毫秒,而人类是一眨眼功夫的 137 毫秒。结论:听觉社会的礼仪,还没学会。
今天,「身体与感观」考棚的第三间,也是最难的一间:手。
前两种感官多少还带着旁观的性质。物理直觉,是看世界怎么动;对话时机,是听世界怎么说。而手不一样——手要碰这个世界。要把一张画满爆炸图的小册子读成一套动作,要把"这块板子贴在那块板上"这种语义,翻译成三维空间里毫米级的落位。这是智能体与物理世界的终极接触面。
所以开场问题可以直接一点:给 AI 一张 IKEA 说明书,它能装家具吗?
这不是段子,是一篇正经论文的 benchmark。它叫 AssemState,来自清华大学、西安电子科技大学和 UIUC,投稿方向是 Physical World AI Workshop。而它的答案,比前两篇更耐人寻味:家谱读得挺好,手还不太听使唤。
🪑 这场考试难在哪:一张图纸,一个三维的家谱
先说清楚这场考试到底考什么。
你买过宜家家具吧。说明书里没有一句话,全是图:每一块零件一个编号,每一步一个小场景图,告诉你哪块板叠在哪块板上,哪颗螺丝拧进哪个孔。人类老手翻两眼就上手了,但这个"翻两眼"里藏着两种完全不同的能力,论文把它们拆开,一样一样测。
第一种能力:恢复装配的家谱。
一件家具是怎么诞生的?先有螺丝把腿拧到底板上,形成一个"小家庭";再把侧板贴上去,家庭合并;最后全家聚成一个柜子。这个层层合并的结构,数学上叫装配树:叶子是零件,内部节点是中间子装配。看懂说明书,第一步就是把这棵家谱从图示里还原出来——谁先和谁结合,谁中途加入,谁压轴出场。
别小看这件事。手册一页不等于一次操作:一页图可能同时动了好几块板,有些组件还能互换位置。论文统计,102 件产品里有 85 件的装配树存在一路合并超过两个零件的多路节点,18 件存在连接两个非叶子子装配的复杂合并。说明书上的"步骤"、家谱上的"节点"、实际拧螺丝的"原子操作",是三种不同的单位——就像菜谱里的"步骤"、化学方程式、和你夹的每一筷子,从来不是一回事。
第二种能力:把语义变成几何。
家谱告诉你要做什么,但没告诉你怎么做。"层板附着在左侧柜壁上"——附着是语义,执行时你得回答一个六维的问题:这块板放到哪个位置(三维坐标),以什么朝向放好(三个旋转自由度)。这就是 6D 位姿,机器人学的日常功课。打个厨房里的比方:放茶杯。放桌上还是桌下,是位置;杯柄朝左还是朝右,是朝向。宜家的语境更残酷:抽屉面板正着装反着装,螺丝孔永远差一厘米;两块对称的侧板,镜像装错时图纸上看不出任何破绽。
阅读理解加规划,再加毫米级几何——这就是为什么说这是 MLLM 空间推理的最硬核考验。
🗺 考场设计:把大难题切成两场独立考试
这里要停一下,夸一夸论文的考场设计,因为它决定了后面所有数字该怎么读。
最偷懒的做法是让 AI 端到端滚一遍:读手册,装第一步,装第二步,一路装到底,最后量误差。结果一定很糟,但糟得没有信息量——第一步装歪了,后面每一步都建在歪的地基上,你分不清是规划错了还是几何错了,是读图错了还是运气错了。
AssemState 的做法是把变量隔离。两场考试,彼此独立。
第一场:结构恢复。给模型编号场景、手册页,以及预计算的编号步骤掩码,让它恢复装配树。注意,步骤掩码是预计算好直接给的——论文诚实地声明,掩码生成本身不在评测范围内。这是第一个诚实的边界。
第二场:位姿推理。更克制。直接告诉模型正确的当前原子操作——移动哪个零件、固定在哪个子装配上、什么附着关系、带位姿提示——再给它此前装好的状态,让它预测移动零件的 6D 位姿。目标位姿不暴露,纯靠几何关系推。而且刻意条件于"正确操作":不评端到端,把局部几何错误和上游结构错误切开。这是第二个诚实的边界。
翻译成生活场景:柜子骨架已经立好,老师傅指着一块层板说,装进去,孔对孔,别装反——然后转身走了,没有成品照片给你对照。闭卷。
这样做的好处是,每一分的得失都有明确的病因。代价是,考出来的分数是"分解动作"的分数,不是"整套武术"的分数。论文把这件事写得明明白白,一点都不藏。
🧠 方法论:先读懂家谱,再对着镜子试衣服
先看结构恢复的三段式。
第一阶段,点零件的名。模型先把每个编号翻译成名称和功能描述,顺手做一件小事:把螺丝刀这种只出现在手册里的工具从零件名单里剔出去,别让它混进家具的族谱。就像婚礼签到,先分清谁是宾客、谁是司仪。
第二阶段,锚点引导的规划。这是设计上的巧劲。一次 MLLM 请求干三件事:找出装配的第一步和最后一步,作为边界锚点;把高亮的零件分配到各步骤,一路追踪哪些子装配被携带、哪些暂时孤立;生成一份文字装配计划。为什么要先钉首尾?写过长篇的人都知道:开头第一句和结尾最后一句定了,中间的走势就有了骨架。装配也一样——知道从哪根腿起笔、以哪个面落款,中间的合并顺序就不再是漫天猜测。
第三阶段,转成树。规则解析优先,解析不了再让 MLLM 兜底,最后落成嵌套整数列表的 tree.json。
再看位姿推理,这部分像试衣服。
模型先提一个候选位姿,把零件摆上去,然后从多个视角渲染装配后的样子——像百货商场的三面镜,正面侧面转个圈。接下来是体检:一个诊断环节给出接受或拒绝、错误类型、以及修正线索。如果被拒,就按错误类型做一个增量修正 δT,新位姿等于旧位姿左乘这个修正,跑三轮。
最妙的是诊断类型直接约束修正方向,像一张维修口诀:
装错面或装反镜像(wrong_side / wrong_mirror),就大幅调整朝向——插头插反了,拔出来转半圈。悬空(floating),沿接触面的法线平移——悬着的螺丝,顺着该贴的面压下去。碰撞(collision),沿反法线后退——磕到了,先退开。没推到底(not_fully-seated),来一小段插入平移——抽屉面板差最后两毫米,再推一把。
整套循环五个角色:提议、渲染、选择、诊断、反馈,论文记作 P1 到 P5。像一位老师傅站在旁边看你拧螺丝:不替你拧,但告诉你"反了""高了""没到位"。
📊 第一门成绩:家谱读得挺好
backbone 用的是 GPT-5。上表。
| 方法 | 精确率 | 召回率 | F1 | 树完全匹配 |
|---|---|---|---|---|
| SingleStep | 10.78 | 10.78 | 10.78 | 10.78 |
| GeoCluster | 13.37 | 13.36 | 13.15 | 3.92 |
| Manual2Skill | 37.45 | 36.41 | 36.83 | 27.45 |
| Manual2Skill++ | – | – | 38.58 | 28.24 |
| 去掉锚点 | 57.39 | 55.90 | 56.20 | 45.10 |
| 本文方法 | 62.34 | 62.46 | 62.80 | 53.92 |
怎么读这张表。SingleStep 假设一页一步,直接崩到 10.78——再次印证手册页和原子操作不是一个东西,硬凑就是全错。GeoCluster 只靠几何聚类,F1 13.15,完全匹配 3.92:只看形状不看语义,连零件的辈分都理不清。前作最好的方法 Manual2Skill++,F1 停在 38.58。本文方法把它抬到 62.80,树完全匹配从 28.24 翻到 53.92。
消融更值得看:把锚点推理拿掉,F1 掉到 56.20,完全匹配掉到 45.10。六个点的 F1、近九个点的匹配率,来自"先定首尾"这一个设计。读书先读目录,装家具先找第一颗和最后一颗螺丝,是同一个道理。
这一门的结论是:让语言模型做结构规划,它确实是把好手。家谱读得出来,而且读得不赖。
🫳 第二门成绩:手,还不太听使唤
然后是残酷的一门。243 个原子操作,55 个正确树样本,还是 GPT-5。
| 设置 | 裁判接受率 ↑ | 平移 RMSE ↓ | 旋转偏差(度) ↓ | 倒角距离/中位 ↓ |
|---|---|---|---|---|
| 纯文本 | 0.0 | 2.4322 | 123.02 | 15.7263 / 10.1914 |
| Open6DOR 式 | 0.0 | 1.8747 | 120.84 | 5.4111 / 0.9391 |
| 本文三轮自检 | 5.3 | 1.8898 | 121.52 | 1.7744 / 0.8112 |
先看亮点。倒角距离——衡量预测表面和目标表面贴合度的指标——从 5.4111 降到 1.7744,中位数从 0.9391 到 0.8112。三面镜加老师傅的循环是真的有效:局部几何被反复打磨,贴合度大幅提升。Claude Haiku 4.5 上这个效应更明显,裁判接受率从 4.5 提到 11.5,中位倒角距离从 3.2725 压到 1.8770。底子越弱的模型,越吃这套反馈回路。
然后看判决。裁判接受率,5.3%。意思是模型自己的质检员,看了 243 次安装尝试,只盖了 13 个合格章。注意这个裁判本身就是模型辅助诊断,没有人类验证,论文对此毫不掩饰——这是第三个诚实的边界。
最狠的是 PA@0.01:在最严格的百分之一容差下,通过率为零。一个都没有。你可以把这条指标想成宜家的质检尺:孔位偏差超过发丝直径就算报废。
还有一组数字暴露了问题的实质:平移 RMSE 和旋转偏差,三轮精化前后几乎纹丝不动,1.8747 对 1.8898,120.84 度对 121.52 度。倒角距离在变好,全局位姿没动。这说明什么?说明这套循环改善的是局部表面贴合——板子贴着该贴的面了——但没有解决那个真正的难题:在没有目标位姿可参考的情况下,估计出绝对正确的六自由度安装位姿。论文的措辞很克制,原话的意思就是:精化改善的是局部几何诊断和裁判的接触一致性,target-free 的 6D 装配位姿估计,没有被解决。
翻译成人话:镜子能帮你把衣服抻平,但这件衣服该不该穿去晚宴,镜子不知道。
🧪 放进仿真器:松手之后,家具站得住吗
位姿毕竟是纸面上的数字。论文最后把预测结果放进 IsaacLab 仿真器里,松手,看它倒不倒。判稳标准写得很具体:包围盒间隙小于 0.05、垂直下落小于 0.05、倾角小于 12 度,三者同时满足才算站稳。
GPT-5 这边:释放稳定率从 37.0 提到 39.5,平均漂移从 0.2463 降到 0.1754,垂直下落从 0.1058 降到 0.0632。有进步,但近六成的尝试,松手即倒。Claude 那边更冷:漂移和下落略有改善,二进制的稳定率钉死在 33.7%,一动不动。
消融实验把两种技术的分工讲得清清楚楚。Open6DOR 基线:裁判接受 0/243,倒角 5.4111,稳定率 37.0%。加上多视角结构化初始化,裁判接受只多了 1 个,倒角几乎没动,但稳定率跳到 44.9%——多看几个角度,东西不掉了。再加上接触感知自检,裁判接受飙到 13/243,倒角压到 1.7744,但稳定率反而回落到 39.5%。
这里藏着一句值得抄下来的科学态度:论文明确声明,不支持所有目标单调改善的说法。多视角买稳定,自检买贴合,用的可能是同一笔预算。真正做过实验的人都知道这种不完美的消融有多难得——多数论文恨不得把每条曲线都修成齐头并进。
顺带记下仿真验证的边界:这是个粗糙的支撑与稳定性探针,不测验紧固、插入约束、网格级接触、夹爪交互,也不测无碰撞运动。真实的装配比"放稳"难得多,这一点论文同样明说了。
🔍 失败的五种姿势
失败分析是全文最有画面感的部分。作者把所有被拒绝的安装归纳成五种姿势,每一种你都可能在自家地板上亲眼见过。
穿插(collision):某些角度看像模像样,换个角度发现和固定子装配互相穿进了对方的身体。悬空(floating):没有稳定支撑,一松手就漂移、就掉。装错面(wrong-side):找到了正确的位置区域,却贴到了错误的连接面上。镜像(mirror):整体翻转了朝向,在对称件或部分遮挡时尤其容易中招。没推到底(not-fully-seated):面选对了,但最后那两毫米的插入从没发生——抽屉关不严,就因为它。
两个模型还各有各的性格。GPT-5.2 给被拒操作标最多的是装错面;Haiku 4.5 则更多标悬空和镜像。像两个学徒,一个总把面板贴反,一个总让零件飘着。
最有代表性的一个 trace 值得单独讲:Bench/applaro 的 op-0,三轮精化,三轮全被拒,错误类型始终是 wrong_side。反馈回路在忠实地工作——每次被拒绝,位姿都被重新定向——但视觉推理每一次都重新选中同一个错误的接触面。
这就是这套方法的天花板,也是它最诚实的地方:镜子能告诉你"不对",但镜子不会告诉你是哪颗螺丝的错。老师傅只说"装反了",不指出哪一面是对的,那你重试三次,拧的还是同一个孔。
⚖️ 诚实,是这篇论文最贵的零件
把这篇论文的边界声明拢在一起,你会看到一份罕见的完整清单。
手册侧的评测,条件于预计算的步骤掩码,掩码生成不评。位姿侧的评测,条件于正确的操作和状态,端到端的错误传播不评。裁判接受率是模型辅助诊断,没有人类验证;提议者、选择者、裁判全都用 GPT-5.2,相关模型误差是明摆着的风险——考官和考生是同班同学,这是第四个诚实的边界。释放诊断是粗糙探针,不测紧固、不测夹爪、不测运动学。
每一条都缩小了声明的疆域,但也正是每一条,让剩下的数字变得可以解释。知道 62.80 的 F1 来自"掩码已给、只需规划",你才知道它测的是规划而非感知;知道 5.3% 的裁判接受率出自模型自评,你才知道真值可能更冷也可能更暖,但不会和 53.92 的树匹配混为一谈。精确的失败,胜过模糊的全面胜利。
这也顺便回答了开头那个问题该怎么问。不是"AI 能不能装家具",而是:在结构规划这道题上,它已经能拿六成;在几何落地这道题上,它连最严的尺都过不去一次;而两者的差距,恰好标出了下一步该动工的位置。
💭 收官:三张诊断书,一具身体的轮廓
三扇门都走出来了,把三张诊断书并排钉在墙上,轮廓就出来了。
皮肤:物理直觉。WorldSolver 的一捧水,最好的模型只接住一半,牛顿摆晃成了事故现场。耳朵:对话时机。Coupled but Late 的 480 毫秒,合拍地迟到着,反应式地等待,永远等你说完再开口。双手:空间与协调。AssemState 的家谱读到了六成,而手在最严的尺下全军覆没,五种失败姿势,每一种都有名有姓。
三门全挂。但这恰恰是这三篇论文共同的价值:它们没有给一个含糊的"还需努力",而是各递上一张精确到小数点的病历。知道物理误差出在守恒律上,知道迟到锚定在对方音频结束时刻的偏移上,知道位姿精化改善了表面贴合却没碰到全局估计——每一项都是可以直接动工的图纸。
身体与感观这个考棚,考的不是 AI 聪不聪明。论聪明,背诵纳维-斯托克斯方程下标的本事,AI 早就超过绝大多数人类。这个考棚考的是另一件事:碰过没有,听过没有,拧过没有。人类的物理直觉是婴儿时期一寸一寸磕碰出来的,人类的接话时机是几十亿次对话磨出来的,人类装宜家的手艺,是每个周末在自家地板上骂着脏话练出来的。智能住在身体里,而不只是住在符号里——这大概是三部曲合起来想说的那句话。
所以收官的态度可以坦然一点。一具还没长好的身体,不等于一个没希望的存在;三张不及格的诊断书,胜过一万句"感觉还行"。至少现在我们知道:皮肤在长,耳朵在学,手还没有长出来。而知道手没有长出来,并且知道是哪五根手指没长出来,是这双手真正开始生长的第一天。
这一季到此为止。下一季,门外的路还长,慢慢走。
📚 参考文献
- 论文标题:AssemState: Manual and Physical-State-Guided Reasoning for Zero-shot Furniture Assembly
- 作者:Zhiyuan Qi, Jierui Li(共同一作), Yifan Shen, Cheng Qian, Jiateng Liu
- arXiv ID:2610.08446(v1,2026-10-06)
- 机构:清华大学 + UIUC;西安电子科技大学 + UIUC
- Workshop:Physical World AI: Geometry, Characteristics, and Multimodal Sensing
#每日论文 #进化日志 #身体与感观
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。