⚙️ 把沙盘对回邮路:世界模型死在哪儿
读这篇的时候脑子里一直有个画面:一位将军把沙盘推到墙上拍了一下,然后指着桌子底下的网线说——锅在这儿,不在沙盘。
南航、清华、南大三个团队在 Mind the Execution Gap 里做的这件事【直引】,简单讲就是给两个老牌的机器人世界模型(TD-MPC2 和 DreamerV3)做体检,把它们的内脏剖开看,发现它们不是死在物理世界,是死在「邮路」——就是控制器和执行器之间那条会丢包、会迟到、会乱序的网线。沙盘没算错,是沙盘脚下的地图错了。
原文里我最喜欢的一组对照实验是这种:用同一个冻结的世界模型,规划器给的决策一字不改,只把投递延迟从 0 调到 200 毫秒。结果非常干净——延迟越大,命令-执行散度越大,短期回报越低。也就是说,毁掉控制的不只是将军偶发昏聩,是邮路这一关本身的代价。【直引】
两代架构死法不同:TD-MPC2 这种规划型,每一步要在脑子里滚一整条未来动作序列,异步执行把这条时间线拦腰剪断,于是模型拿着 A 序列推演、执行器磕磕绊绊实现出来 B 序列。DreamerV3 这种循环型,RSSM 每一步都要把「上一隐状态 + 上一动作 + 当前观测」三样东西拌在一起记账,异步一来账本就乱——账面永远是平的,每个观测都解释得通,只是把隔壁部门的支出记到了你这个项目头上。两种死法诊断结果是同一种病灶:动作的语义在执行链路里被错位了。
最有信息量的实验是消融那几组:喂「当前实际动作」无效,喂「缓冲内容」也无效,唯一有效的是「精确未来动作序列」,而且这个信息必须放进 rollout 内部,只用来给候选轨迹打分(scoring only)毫无收益。【直引】意思是错位的不是评分标准,而是世界内部的因果时钟。打个比方:开会时有人告诉你「桌上其实是果盘」,你只当八卦,发言照旧,会议照砸;唯一的解法是从你推演的第一步起,脑内沙盘里摆的就该是果盘。
更狠的当头一盆冷水:所谓延迟感知训练和执行侧纠偏不会自动叠加——用「固定 2 拍延迟」数据训练出来的检查点再配上 Future-Sequence 接口,恶劣平均从 256 掉到 52。两个方向单独看都正确,撞在一起就是双倍的错误。结论朴素得让人不舒服:接口设计必须匹配训练时学得的隐含动作语义,不能看见错位就上手掰。
数字上,Walker-Walk 这个任务里同脑同身同种子,放在乱序条件下,Single-Action 的机器人早期失衡,回报 397.4;Future-Sequence 的机器人全程直立走完,回报 889.2。【直引】这两组数字的分母非常窄——就这一个任务、这一种乱序条件——但它干净地剥掉了「这是不是偶然」那层疑心:一千对一名义增长,发生在被刻意制造的最恶劣条件下。
工程上两个接口都朴素得让人想笑:ECI-1 给规划器用,把整条规划序列打包下发,接收端维护可替换缓冲;ECI-2 给循环世界模型用,让执行器在回传观测的同一趟车上捎一张回执,RSSM 用真动作记账而不是用指令记账。【直引】一个是 TCP 的重排与重发,一个是 IP 的回执查询——解法全是网络课作业,不性感,但管用。30000 次转移测试里 ECT-Full 与 ECT-ID 都 100% 找回精确的实际动作,落地的工程可行性已经被验证。
把这篇放回更大的图景里,世界模型是这一轮 AI 里少有的、认真想成为「现实副本」的技术——它想把物理规律学进参数,想让推演代替试错。这篇论文告诉我们的是:即便你的沙盘推演全对,从沙盘到现实之间那条邮路也能凭一己之力决定成败。沙子对,地图错,再细的沙盘也算不到远方。
下一根钉子:从这篇里还能再压出一个方法论问题——观测侧的异步(传感器各报各的时间戳)作者明确点出这是另一条战线,但同样的「语义错位」会不会以另一种形式在观测侧发作?如果会,那世界模型不光邮路要修,沙盘本身要装两套坐标系才够用。