一篇把「诚实」写进 limitation 的论文,值得先给它记一功
先说没问题的部分,因为它太整齐了。我把 Table 1、Table 2、Table 3 逐格抄下来核过:结构恢复 SingleStep 10.78 / GeoCluster F1 13.15 EM 3.92 / Manual2Skill F1 36.83 EM 27.45 / Manual2Skill++ F1 38.58 EM 28.24 / 去掉锚点 56.20 与 45.10 / 本文 62.34 62.46 62.80 与 53.92。位姿表 GPT-5 三行的 RMSE 2.4322 → 1.8747 → 1.8898、旋转 123.02 → 120.84 → 121.52、倒角 15.7263 / 10.1914 → 5.4111 / 0.9391 → 1.7744 / 0.8112。Haiku 4.5 的裁判接受 0.8 → 4.5 → 11.5。释放稳定率 37.0 → 44.9 → 39.5,漂移 0.2463 → 0.1754,下落 0.1058 → 0.0632。85/102 与 18/102、393 步与 404 合并节点。全部对得上,一个小数点都没差。
而那句「六个点的 F1、近九个点的匹配率」的自算也对:62.80 − 56.20 = 6.60,53.92 − 45.10 = 8.82。
【直引】论文原话是 the effect is not uniform across metrics or backbones。这句话在正文里一带而过,却是全文最值钱的一句。
换分母:5.3% 到底有多小
帖子里写「裁判接受率 5.3%,模型自己的质检员看了 243 次安装尝试,只盖了 13 个合格章」。这已经够狠了,但把分母换成「自评」就更狠一层。
裁判、提议者、选择者用 GPT-5.2——但这一格要收窄,收窄的方向恰好和「诚实边界」相反。
论文附录 B 的原话是:In the representative GPT trace, proposer, selector, and judge all use gpt-5.2, so judge acceptance may contain correlated model errors and should not be interpreted as independently verified physical correctness. 紧接着还有一句更狠的:These settings document this trace only; they should not be read as proof that every aggregate row labeled 'GPT-5' in the main table used the identical API identifier or wrapper.
【直引】这两句都是限定词,而且是论文自己设的禁区。主表 Table 2 的表头只写「GPT-5」,而 5.3% 这个数出自哪次 API 调用,论文明确说没有承诺。
所以这不是一条「诚实的边界」,而是一个被标注出来的不可知区。两者的区别很实际:诚实边界是「我承认这里有偏差但方向是明的」,不可知区是「我连自己测的是哪一版都没说」。【判断】把 13/243 当成一个上界读,前提得先接受「这 243 次里用的裁判是不是 Table 2 那一版」这个问题悬着。
即便按最宽的读法——考官和考生同班、错有相关性——这 5.3% 也只能当上界,因为考官放水只会让数字偏高。论文自己说这是 model-based diagnostic,没有人类验证。GPT-5.2 已经很努力地给自己盖章了,也只盖了 13 个。这个数字的下界是 0。
再看 PA@0.01——最严的百分之一容差下通过率为零,论文原话是 PA@0.01 is 0.0000 for every setting。每一个设置都是 0。 243 个零件没有一个能通过发丝直径级的公差。
消融那一格的方向性,比帖子说的更有意思
帖子讲了「多视角买稳定,自检买贴合,用的可能是同一笔预算」,这句总结准确。但把三行的两列并排看,还有一层:
- Open6DOR:裁判 0/243,倒角 5.4111,稳定率 37.0%
- + 多视角结构化初始化:裁判 1/243,倒角 5.3113(几乎没动),稳定率 44.9%
- + 接触感知自检:裁判 13/243,倒角 1.7744(大幅降),稳定率 39.5%(回落)
【直引】论文自己下的结论是 target-free 6D 装配位姿估计 has not been solved。这句限定词是「没有被解决」,不是「改善了局部」,两种读法的分量差很远。
一处帖子的表格缺格
位姿表里 GPT-5 的「纯文本」一行裁判接受率是 0.0,但 Claude Haiku 4.5 的纯文本一行是 0.8,不是 0。帖子只列了 GPT 那一侧。这不是大错,但它说明一件更重要的事:连完全不给几何提示的纯文本基线,Haiku 都能偶尔蒙对一次。而 Haiku 自己的三轮精化是 11.5%——从 0.8 到 11.5 是 14 倍,GPT 从 0.0 到 5.3 则无法算倍数。帖子说「底子越弱的模型越吃这套反馈回路」,方向对,但 Haiku 是本场最弱的底子(RMSE 2.4315 比 GPT 的 2.4322略好,Open6DOR 式却只有 4.5 vs GPT 的 0.0),所以这条曲线的形状是:反馈回路对已经会一点的人几乎没用,对完全不会的人特别有用,对中间层最没用。
那个 op-0 才是最贵的
Bench/applaro 的 op-0,三轮精化全被拒,错误类型始终是 wrong_side。帖子的总结我原样抄回来,因为它没法再压缩了:
> 镜子能告诉你「不对」,但镜子不会告诉你是哪颗螺丝的错。
补充一个帖子没做的动作。Table 3 里的裁判接受率是 13/243,而这一行写的是拒绝的原因分类。wrong_side 是 GPT-5.2 给被拒操作标得最多的类型。也就是说那 230 次拒绝里,诊断器给的大多是同一种诊断。 一个诊断器在 230 次里给出同一个答案,它提供的信息量约等于一次。
下一根钉子
AssemState 把评测切成结构恢复和位姿推理两场独立考试,这是它最聪明的一步,也留下了最清楚的下一步:把两场重新接起来,看错误怎么传播。具体说,位姿这一门刻意条件于「正确的操作和正确的树」。那么同一个模型拿着自己预测出来的树去解位姿,得分会掉多少?这个差值就是「规划错误传染到几何」的量。
论文里有一个天然的对照物:单步操作 13/243 是 5.3%,而 Table 1 里树完全匹配是 53.92%。一半的题连第一步都走对不到,接下来的位姿推理是在错地基上算的。端到端完成率大概会落在这两个数的乘积附近——但这个乘积本身也未必成立,因为错误可能不独立。这一格论文没做,谁做了谁就拿到了「手到底能不能用」的第一个诚实答案。
一处帖子的推广,被数据反驳了
帖子写「Claude Haiku 4.5 上这个效应更明显……底子越弱的模型,越吃这套反馈回路」。前半句对,后半句论文明确否掉了。
把 Haiku 那一行自算一遍:
- 裁判接受 4.5 → 11.5,涨 2.56 倍,对
- Mean CD 10.8826 → 10.6708,只降 1.9%;Median CD 3.2725 → 1.8770,降 42.6%
- Translation RMSE 1.8887 → 1.9760(变差)
- Geodesic distance 123.20 → 123.69(变差)
- Release stability 33.7 → 33.7,一动不动
【直引】论文自己的定性总结是 after-state refinement can improve some physical plausibility diagnostics, but the effect is not uniform across metrics or backbones,并明确写了 For Claude Haiku 4.5……binary release stability remains unchanged at 33.7%。「底子越弱越吃这套」是一条论文没下、且被数据反驳的推广。
arXiv 2610.08446,清华 + UIUC + 西电,v1 2026-10-06,5 作者。