107.4 毫秒这个数,摘要没骗你,但它属于另一个配置。
一、把 Table 12 摊开,107.4 就有了坐标
论文附录 G 把上下文和延迟一一对应列全了:0秒 74.6 毫秒、2.4 秒 107.4、4.8 秒 138.3、9.6 秒 204.5、19.2 秒 341.0。
107.4 毫秒对应的是 2.4 秒。而 78.7% 那个数来自 19.2 秒配置,真实延迟341.0 毫秒,是 107.4 的 3.18 倍。
换成控制频率更直观:0 秒是 13.4 Hz,2.4 秒是 9.3 Hz,19.2 秒掉到2.9 Hz。
【直引】论文自己写了这个代价:「8 more history raises RTX 5090 latency 3.2× (107.4 to 341.0 ms)」。摘要里那句没说它是 2.4 秒那一档,两句并排容易被读成同一个配置。
二、「三个基准都最佳」那部分,上下文最多只有 2.4 秒
【直引】「For the first three benchmarks, the main results use up to 2.4 seconds of context」。
LIBERO-Long、RoboTwin 2.0、DOMINO 上的好成绩全是 2.4 秒上下文换来的,19.2 秒只用在一个基准上。这条限定词摘要里没有,帖子里也没有。
顺着这条看领先幅度就知道该怎么写:LIBERO-Long 99.5% 超LingBot-VA 1.0 点;RoboTwin 2.0 平均 94.4% 超 ABot-M0.5 0.3 点,而 Randomized 一栏 94.2 对 94.2 是打平——论文用词是 ties。
真正硬的是 DOMINO:34.9 对 Fast-WAM 的 19.9,是 15.0 点的正差距;MS 45.1 对 PUMA 的 35.0 是 10.1 点。要给 Long-WAM 找一个站得住的领先,DOMINO 比 LIBERO 合适。
三、论文自己打架了,帖子如实转述了摘要那一版
Table 4 把「2.4 s」这一行标成 63.3,而 5.3 节正文写「scaling from 2.4 to 19.2 seconds improves success from 66.3% to 78.7%」。同一个 2.4 秒,两个值差 3.0 点。
摘要、引言、Figure 1 说明用的都是 63.3 对应 0 秒基准的口径,帖子用的也是这个。所以这不是帖子抄错,是论文内部有一处没交代。【推论】63.3 应该对应 0.0 秒,Table 4 的行标签或数值有一处笔误——但论文没说哪一处是笔误,核不到。
四、两个数自己算一遍
论文自算句「exceeds the strongest GR-1 baseline by 11.6 points」,我反推:78.7 减 11.6 等于 67.1,正是 Cosmos Policy。不是 GR00T-N1.5(那会是 14.6 点)。
另外「每个上下文窗口单独训一个模型」这件事值得说:论文原话是本研究里每个 context window 都训成它自己的模型,测试时动态调窗口是明确的 future work。所以「19.2 秒」不是一个旋钮,是一个要重新训练一次的选择。【推论】这也是为什么延迟代价没有变成一个可调参数。
五、几条帖子零字未提但更硬的
训练开销:预训练用了64 张 H100、约 30,720 GPU-hours,下游 WAM 用 16 张 GB200。
复合任务那个对照实验最有说服力:Long-WAM 单独跑 Composite 只有 15.8% 和 6.1%,加 GPT-6 Astra 后到 38.8% 和 35.0%。作者专门做了对照——同一策略每 15 步查询一次(不用规划器),只有 11.2% 和 5.0%。所以涨点来自规划器的语义分解,不是「问得更频繁」。
38.4 秒处成功率回落到 75.2% 和 74.2%,论文的解释是 80.4% 的历史帧是 padding,并说这是历史覆盖不足,不是记忆上限。
还有一个数:所谓「约 1 万小时训练数据」,论文写明这是窗口等价估算(每个样本按 16 秒折算得 10,004.5 小时),「不是原始素材实测时长」。
下一根钉子:19.2 秒只在仿真 GR-1 上验证过,论文明说真机上的上下文长度研究是自然的下一步。同时每个窗口都要单独训一个模型。真机上扫窗口长度 + 窗口可调的架构改动,这两件里先落地哪一件,决定了「长上下文世界模型」是实验室结论还是工程规格。