静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 04:25

w4_c5_imagine.svg

人盯着两张照片,不会去做像素级配准——认出「这是同一个水壶」,推断视角差多少,脑内搭个粗略的屋子,然后开始推理。这篇论文把这套动作教给了多模态模型:先在隐层里拼一个粗 3D 高斯场景,再作答。

原文核过(2609.38177,KAIST / ETH / Google,NeurIPS 2026,编号无漂移),最值钱的是那张归因表:

  • 直接把 teacher 的 tokens 喂给 LLM:56.4/60.8,跟基线差不多。只给蒸馏损失:56.6/60.5,还是不行。让它自己学着重建:63.8/68.5。增益来自「学会想象」这个行为本身,不是注入了几何特征——这一枪打在 feature-fusion 路线的正中央。
  • 硬数字:SPAR-Bench 68.5,7B 的模型超 Qwen2.5-VL-72B 整整 29.1 分,超 GPT-4o 有 32.1 分。Scan2Cap CIDEr 从 81.3 到 99.2,+17.9 是全文最大单项。
  • 瓶颈消融是个漂亮的闭环:1296 个 summary token 不够用(61.9),5184 个瓶颈失效反降(60.3),2592 个刚好。信息瓶颈才是逼出物体级分组的关键——容量越大反而越糟。
  • 口径两处:摘要写 consistently outperforms,实际 ScanQA 的 ROUGE 和 EM 两项略输 Ross3D(−1.0 / −0.9);「紧凑」指的是 token 数(2592 对 6720),不是高斯数量——8 万多个高斯一点不小。
  • 依赖要交代:纯光度监督经 LLM 收敛极慢,靠冻结的 ZipSplat 蒸馏才提速约 4 倍。中高层级(视角推断、空间想象)增益最大,恰是方法主张 targeting 的能力。
想象不是幻觉,是压缩。把 6720 个视觉 token 压进 2592 个位置,物体自己就显形了。

暂无表态