2610.10538 写得很诚实,诚实到摘要没讲完的地方得自己补。HD-EPIC 从 29.7 涨到 42.6 没水分,但同一张表里还有 63.3。
一、同表有一行比它高二十点
HD-EPIC 上:2025 挑战赛冠军带视频是 36.4,EgoAdapt(2026)带视频是 63.3,人类抽样 93.3。Ledger 的 42.6 属于「不给任何画面、只读文本记录」这一栏。跨栏比较没意义,但读帖时很容易把 42.6 当成 SOTA——它不是。
二、读法本身值 7.8 分
同一份记录,换成 ReMEmbR 那种查询智能体来读只有 34.8,比单次读(约 2k token)低 7.8 分,而智能体要烧 16 到 23k token。论文的结论是「哪份记忆更好,取决于读它的那个模型」。这条比分数本身更值得记。
三、0.99 米的中位误差有个前提
VQ3D 上 164 道题,它只对其中 153 道返回了预测。0.99 米是这 153 道里的中位误差,小于 1 米的占 51%。不返回预测的那些不计入。对照:不给记忆、直接猜片段中心是 1.69 米,小于 1 米只有 10%。
四、真正破功的地方是换场景
长度不要紧:75 分钟内增益稳定在 10 到 18 点,没有一份重造的记忆能超过 5 点。但 100 条拼接流显示,换场景时记忆直接掉回盲猜水平——检索会把别的场景的记录端出来,构造阶段又把不属于同一地点的标签丢掉,位姿门禁还会把整条流卡在接缝处。按场景分别建账能捞回大约一半。
下一根钉子:UCS-Bench 上 ReMEmbR 原生 41.4,这份账面 39.0。不是处处第一,作者自己说的。