拆家具的人最怕的不是看错款式,是把强力胶当结构胶用——HARMONY 这篇的问题正好反过来,它不担心看错,怕的是摆对了位置但尺子就不对了
这篇把单图 3D 场景重建的两条路线摆得很清楚:智能体推理懂语义但跟输入图对不齐,视觉几何基模型对得齐但重建质量有限。HARMONY 走的是"分层思维链 + 点云精调"。我把 arXiv 全文和表格都核了一遍,有三处帖子没提的东西,比"优于基线"这句结论有意思得多。
一、VGGT 不是基线,是这家方案的地基
帖子(中译)只说"与视觉几何基础模型结合",读者容易以为 VGGT 是被对比的对象。全文里 VGGT 的身份是内部模块:Manhattan 坐标系、metric alignment、点云估计、深度细化,全靠它。
真正参加定量对比的五个基线是 Gen3DSR、3D-ReGen、CAST、SAM3D-star、VIGA,GPT-6 Astra 是额外对照。Cube3D 在全文、表格、参考文献里都没出现过。
这个区别有后果:如果 VGGT 是共同地基,那"几何对齐"这一步的功劳不能算给 HARMONY 的架构创新;反过来说,换个更强的几何基座理论上还能再吃一段红利。论文自己给了 "w/o VGGT refinement" 消融,N-CLIP 从 0.1034 掉到 0.1069——掉得不多,说明精调那一步是锦上添花,把整件事从"推得不准"拉回"推得准"的是相机标定(去掉它 N-CLIP 恶化到 0.1381,是全部消融里最大的一格)。
【判断】一篇把主要贡献写在"分层思维链"上的论文,最大的消融项却是标定。这不是说分层没用(去掉 VLM placement reasoning 掉 0.0045,去掉 feedback loop 掉 0.0150,都有量),而是说这套流水线的成败顺序是:标定 > 反馈回路 > 分层放置。
二、同一篇里,完整模型有两个数
主结果表:HARMONY 完整版 N-CLIP = 0.092、PL = 0.041。
消融表:HARMONY 完整版 N-CLIP = 0.1034、PL = 0.0462。
两组数不在同一张表里,论文没解释它们是不是不同子集或不同评测协议。
差多少自己算:0.1034 ÷ 0.092 = 1.12,PL 0.0462 ÷ 0.041 = 1.13。12% 左右的相对差。而 HARMONY 相对最佳基线的领先幅度也就是 27%(N-CLIP 0.127 → 0.092,对手是 SAM3D-star)。也就是说,口径差 12% 能吃掉这张表里一半的领先幅度。
【推论】看到"全指标最优"这句话时,先找消融表里那一行完整版对不对得上。这不是挑刺,是这批表格的读法。
三、用户研究那组数,比所有像素指标都有说服力
真实图像 30 张,16 名参与者、20 个场景排序:
- Top-1:SAM3D-star 13.7% → HARMONY 67.0%
- Top-2:39.3% → 86.0%
- Mean Rank:3.26 ± 1.60 → 1.54 ± 0.93
原因不难猜:像素指标(N-CLIP、PL)只管"这张图像不像",而"物体有没有摆对位置、装饰物有没有落在桌上"是语义对不对,指标几乎测不到。榜单上 Top-1 最高的也只有 67%,说明单图重建离"能进 3D 资产生成流水线"还有距离。
补三个数字(帖里全无):
- 25.9% 的检测带低 grounding 置信度(<0.35),但排除路由与去重错误后,真实 placement failure 只占物体的 0.3%。这两个数别混着用——低置信度 25.9% 看着吓人,真实失败 0.3% 才是有效指标。
- 单场景运行 20–90 分钟,L40 显存 46 GB,平均每个物体调用 VLM 3.4 次。
- Section 4.5 说要讲"三种常见失败案例",实际只给出两种(罕见物体类别、前景裁剪与遮挡),第三种没有正文。这个缺口我核到了,也核到论文没给第三种配比例数字。
下一根钉子:主表 0.092 与消融表 0.1034 哪个是"那个"配置。若论文出 v2 给了统一口径,这篇的可信度会明显上一个台阶;不给,以后引用这两个数都得带一句"两套口径"。另一根:那个只占 67% 的 Top-1 里,剩下 33% 集中在哪类场景——论文现在没给失败分布。