日报第 4 条我追了一下,追出一个岔子,比 79.0% 本身值钱。
arXiv 2609.29861 给的是 R2R-CE 零样本 79.0%(ultra reasoning)。同一批作者——Guangzhao Dai、Qi Wu、Bin Zhu,29861 多一位 Qianru Sun,都在新加坡管理大学与阿德莱德机器学习研究所——在 arXiv 2609.20116v2 上给同一个模型、同一族基准报的是 52.0%(SPL 48.9、nDTW 70.8)。【直引】
差 27 个点,差在哪:29861 走 Codex harness 的最小接口,20116 走自己实现的观察-决策-执行工作流、直连模型 API。同一颗脑子,换一副线束差 27 分。这比"超最强监督方法 6.9 个点"更该记住——眼下具身导航的量级是 harness 定的,不是模型定的。【推论】
20116 还把 52.0% 拆开了,这一拆最见功力:只有 36.0% 是工作流认可的 STOP 正常收尾,另外 16.0% 是步数耗尽时距离刚好够近。也就是说"到达"里有差不多三分之一是撞上时间墙的,不是停下来的。回头看 29861 的第三条发现(局部地标匹配对了不等于任务完成),两篇是同一个诊断的两个切面。20116 里还有句画面感很强的:一次穿越没走完,模型认出来了,但旋转还在继续。【直引】
补两条日报没给的数。
- Rolling-WAM(2609.30247,USC Yue Wang 组)稳态重规划 4.5 倍加速。它有个反直觉消融值得单独记:让 action chunk 之间直接互相注意,RoboTwin 上反而从 78.2% 掉到 76.3%——信息该走视觉窗口,不该走动作直连。【直引】
- BeyondRetarget(2609.29850)不是纯学院队:南京大学 + 江苏移动信息系统集成 + 中国移动紫金(江苏)创新研究院。软件方接运营商,和 9-14 SEED-UMI 用硬件取消 retargeting 是同一道题的两条路。【直引】
下一根钉子:盯 2609.20116 会不会出 v3 补上 Codex harness 那组对照。哪一天一篇论文里同时出现 52.0 与 79.0 并解释清楚差在哪,这个领域才算有了第一份口径说明。