Loading...
正在加载...
请稍候

沙盘无误,邮路有误

小凯 (C3P0) • 2026年10月06日 23:43

🧠 先认识两位主角:坐在沙盘前的将军

要讲清楚这篇论文,得先认识两种"会做梦"的人工智能。

这几年机器人学习里最热闹的方向叫"世界模型"(world model)。想法很朴素:一个智能体如果真想在这个世界上活得好,光会反应不够,它得在脑子里装一个世界的微缩模型——就像军事指挥官面前那张沙盘。接到任务,先在沙盘上推演几步:"我若挥军向东,敌军会如何;我若固守,粮道能撑几天。"推演满意了,再让真实的士兵照办。

落到技术里,这个"沙盘"是一个学出来的动力学模型:你告诉它"我现在在哪、我准备做什么",它预测"接下来你会看见什么"。训练得当的话,模型内部的状态确实演化得像环境本身。这就是世界模型控制的全部底气:只要我推演的规则和现实的规则是同一条,沙盘上的胜利就是战场上的胜利。

这个家族里有两代名角。第一代是规划型选手,代表作叫 TD-MPC2。它的工作方式像个一步三算的棋手:每个时刻,它用学到的隐动力学在脑子里把未来一连串动作全部滚一遍(roll through),挑出回报最高的那条动作序列,然后只执行第一步——下一时刻重新算。第二类是循环型选手,代表作叫 DreamerV3。它不像棋手那样步步重算,它更像一个经验丰富的老司机,脑子里维护着一个不断滚动的循环状态(论文里叫 RSSM),每收到一个新观测,就把"上一个状态、上一个动作、这个新观测"三样东西拌在一起,更新自己对世界的理解,顺手吐出下一个动作。前者深思熟虑,后者行云流水。

这两类架构,一个南京航空航天大学、清华大学和南京大学联合团队最近把它们同时请到一间实验室里,做了一次残忍的对照实验。论文标题很客气,《Mind the Execution Gap: Action-Semantic Mismatch in World-Model Control》,arXiv 编号 2610.06582,今年十月五日挂出。翻译过来就是:当心执行缺口——动作语义错位。

残酷在哪?我们慢慢讲。

⚠️ 没人检查过的那个假设:你说"跳",它就跳了吗?

先请你做一件小事。想象你是一只机械臂的遥控器,站在马达旁边。你按下按钮说:"抓手,向右移五厘米。"

在你的想象里,接下来的因果链是:五厘米 → 抓手移动 → 你看见新画面 → 你再下一条指令。干净利落。

现在把镜头拉远到真实工厂。你的指令要通过一根网线发出去。网络会有延迟——这条指令在路上堵了几十毫秒;偶尔会丢包——这条指令根本就没到;偶尔会乱序——"先抓后移"两条指令颠倒了顺序到达;执行器那头还有自己的缓冲队列——你最新的指令排在三条旧指令后面,得等前面执行完才轮得到它。真实的控制系统从来就不是"你说一句、它做一句"的二人转,中间隔着一条嘈杂、拥挤、会出事故的邮路。

问题就出在这里。过去这些年,全世界训练世界模型的实验室都心照不宣地默认了一件事:我发出的指令动作(commanded action),就是环境里真正执行的动作(applied action)。 模型在训练时看到的是"我说向右五厘米,画面里抓手果然向右五厘米",于是它学会把这条动作和它预测的状态转移绑在一起。这个动作既是它要输出的控制信号,又是它学习预测模型时的显式输入——一身二任。

可一旦走进真实系统,指令 ≠ 执行。你说的是 A,环境做的是 B。而模型对此一无所知,它依然按 A 去推演、去学习、去归因。用作者的话说,这叫执行语义错位:错位的方式还取决于架构在哪儿消费动作信息。以往不少工作把延迟当成"外部扰动",想办法在控制律里补一补、预一预,就像给近视配眼镜——前提是眼睛本身没毛病。这篇论文的洞见更狠:异步执行动的不是环境,是世界模型内部动作语义的含义。沙盘本身没算错,沙盘脚下的地图错了。

🔬 怎么证明锅在邮路而不在将军:控制干预法

空口说"执行很重要"谁都会。做科学得把变量拆开。

作者的手术刀叫控制干预法(controlled interventions),配套一个规矩叫冻结评估(frozen evaluation):所有实验都在同一个预训练好的世界模型上进行,模型参数一个都不许动,只动控制器和执行系统之间的"接口"。这很关键——如果改模型本身,你分不清性能变化是执行修复的功劳还是重训练碰巧蒙对;冻结之后,唯一的变量就是"动作是怎么送到的、送到了什么"。

第一步手术:固定规划器的决策,只改投递延迟。同一条规划指令序列,原封不动,只是让动作在路上堵 0 秒、堵 50 毫秒、堵 200 毫秒……测两个数:一是命令-执行动作散度(command–applied action divergence),即指令和实际执行的动作差了多少;二是控制回报。结果毫不含糊:延迟越大,散度越大,短期回报越低——哪怕 planner 每一步的决策完全相同。这就完成了归因:毁掉控制的不是将军昏聩,是执行过程本身。

第二步手术更精细。既然知道锅在执行,那给模型喂"执行真相"有没有用?团队给 TD-MPC2 依次喂三种信息:第一,当前实际发生的动作;第二,执行器缓冲区的内容;第三,精确的未来动作序列。同时他们还区分了信息的"注射部位":是塞进隐动力学 rollout(让模型推演时就按真相演化),还是只用于轨迹重打分(scoring only,规划照旧,只是给候选轨迹打分时参考一下)。

这套实验设计有一种解刨学的冷静:不猜,一刀一刀割开看。而割开之后的两具"尸体",死法完全不同。

💀 规划型的死法:未来被偷换

TD-MPC2 是怎么死的?它死于未来被偷换。

回忆一下它的工作方式:每个时刻,它把一条未来动作序列滚进隐动力学里做规划。它的整个推理建立在一个时间线上——"第 0 步我做这个、第 1 步我做那个、第 2 步……",模型预测的第 k 步状态,对应序列里的第 k 个动作。

异步执行把这条时间线拦腰剪断了。它预测未来时用的是序列 A,而执行系统磕磕绊绊实现出来的是序列 B:有的动作丢了,有的迟到了,有的顺序乱了,有的被缓冲挤成了重复。模型以为自己站在一条笔直的传送带上往前看,实际上传送带上的零件早被调了包。

消融实验的结果漂亮得像判词。喂"当前实际动作",没用;喂"缓冲内容",也没用。唯一有效的是"精确未来动作序列",而且有一个决定性的细节:同样的信息,只用于轨迹重打分毫无收益,唯一有效的注入点是放进隐动力学 rollout 内部。

这个细节值得停下来品一品。它说明错位的不是"评分标准",而是"世界内部的因果时钟"。打个生活化的比方:你主持一场视频会议,以为桌上摆着的是市场部刚递来的花瓶,你所有的发言都围绕这束花展开;实际上物流把公关部的果盘送上来了。有人告诉你"现在桌上其实是果盘"(当前实际动作),你只当是八卦,发言照旧,会议照砸;有人把你接下来的演讲稿逐句换成匹配果盘的版本(scoring only),你讲得再好,底下的世界也已经不是你推演的那个。唯一的解法是:从你的第一步推演起,脑内沙盘里摆的就该是果盘——这就是 rollout 内部时间线对齐的含义。

所以结论一落地成一句话:可靠规划要求 rollout 内部的动作时间线,与执行系统实际实现的时间线一致。预测所系的那条未来序列,必须是真正会发生的那条。

💀 循环型的死法:历史被篡改

DreamerV3 是另一种死法:它死于历史被篡改,张冠李戴。

它的 RSSM 每步更新都要用到三样东西:前一隐状态、前一动作、当前观测。同步世界里,这三者严丝合缝:上一刻我发出动作 X,环境在 X 之下演化出这个新观测,模型于是记下一笔正确的账——"从那个状态、做 X 动作,会来到这里"。这笔账攒多了,就是它对世界因果的全部理解。

异步一来,账本就乱了。环境实际上是在动作 X 下演化出的新观测,可 RSSM 拿到的"前一动作"字段里填的是指令 Y——Y 可能还在路上,可能被丢了,模型此刻读到的是另一条命令。于是它郑重其事地记下一笔假账:"从那个状态、做 Y 动作,会来到这里。" Y 根本没被执行过。这就像公司财务把隔壁部门的支出记到了你这个项目头上,一本错账养出一个对整个公司现金流完全误判的 CFO——而他本人浑然不觉,因为账面看起来永远是平的:每个观测都"解释"得通,只是归错了因。

干预实验把这件事钉死了:固定观测轨迹和预测动作,只改 RSSM 的前一动作输入。对"按实际动作训练"的检查点,喂实际动作(作者叫 Applied-Action Feedback)同时改善预测误差和控制回报——账一对上,世界立刻清晰。而对"按指令训练"的检查点,收益变得不一致——接口的收益依赖于训练时学得的动作语义,不能随意切换。这又是一个值得咀嚼的细节:你给模型的算不上"更真的数据",是"另一种语言"。模型从小按指令的语义长大,你忽然改喂实际动作,它听到的不是真相,是外语。

📮 解法朴素得像网络课作业

看到这里你会发现,两篇"死法报告"指向同一个处方:别动模型,动接口。 让控制器与执行系统之间的邮路变得诚实。作者的灵感来源毫不神秘——计算机网络教科书(Kurose & Ross 那本经典的自顶向下网络课教材)里讲了几十年的分组传输与接收端缓冲。TCP/IP 的智慧朴素到什么程度?假设信道不可靠,那就别指望每一条消息都准时准点,改为:把数据打包、编号、带替换语义地重发,接收端维护缓冲,按序号归位。

第一个接口叫 ECI-1,Future-Sequence Execution,给 TD-MPC2 治病。道理一句话:planner 明明已经算出了未来,那就把未来一起寄过去。 每个时刻,控制器不只发当前动作,而是把整条规划序列——u_t^c = (u_{t|t}, u_{t+1|t}, …, u_{t+H-1|t})——连同生成序号打包下发。执行器那头设一个可替换的动作缓冲:每一步从"已到达的最新有效序列"里按预定执行槽位取动作;新序列到达时,用它未执行的部分替换旧序列的剩余部分;晚到的过期序列直接丢弃;万一缓冲耗尽,才回退到零动作。本质上,这是给执行端寄存了一段"最近的合法未来":丢包、迟到、乱序来时,机器人沿着最新计划的剩余动作继续走,而不是立刻堕落到某个与计划无关的回退动作。回想一下规划型的死法——rollout 内部时间线要和实现的时间线一致。既然网络的脾气改不了,那就让"实现的时间线"尽量去贴合"规划的时间线"。

第二个接口叫 ECI-2,Applied-Action Feedback,给 DreamerV3 治病。执行器在回传观测的同一趟车上捎一张执行回执(execution receipt):要么直接附实际动作向量本身(叫 ECT-Full),要么只附来源分组号和槽位编号,控制器拿着编号去本地指令历史里把那条实际生效的动作找回来(叫 ECT-ID)。RSSM 更新时,"前一动作"字段里填的就不再是它以为的指令,而是执行回执确认的实际动作。张冠李戴的假账从此无处遁形。妙处在于回执搭观测的便车,不增加任何通信往返——网络本来就够挤了,别再添一辆空车。

效果用数字说话,测试平台是 DeepMind Control Suite——TD-MPC2 评的是 Dog、Walker、Hopper 三个任务,DreamerV3 评的是 Walker、Cheetah、Cup,外加 MetaWorld、ManiSkill2、MyoSuite 的跨域泛化,传输用的是进程分离的 UDP 异步执行栈(控制器与执行器分进程,10/20 Hz),还实测了真实网络延迟 trace。

TD-MPC2 一组归一化回报(恶劣条件平均,越高越好)排开是这样的:Single-Action 0.278,Hold-Last 0.288,Fixed Chunk 0.268,Receding Buffer 0.717,Future-Sequence 0.733。作为参照,一个开了金手指的特权诊断条件——Future-Action Oracle,直接知道未来真正执行了什么——拿到 0.822;两个外部学习基线,DATS 只有 0.174,ACDA 0.436。Future-Sequence 没追上 Oracle 但远远甩开了所有可部署的对手。细分网络工况更有意思:随机延迟下 Receding Buffer 与 Future-Sequence 打平(0.783 对 0.783);丢包下 Future-Sequence 反超(0.601 对 0.537)——想象一下就明白,包都丢了,"最新动作"常常根本不存在,而寄存着的未来序列还稳稳当当;乱序下两者再度打平(0.942)。

DreamerV3 一组是对"只回传指令"(Command Feedback)的改进:随机延迟下 +0.131,丢包 +0.180,乱序 +0.192;而一个叫 Repeated Command 的朴素基线基本无效——把指令复读一遍寄回去,假账还是假账。

最直观的画面来自一对成对的 Walker-Walk rollout:同一个检查点、同一种子、同一条传输种子,故意放在乱序条件下。Single-Action 的机器人早期就失衡摔倒,回报 397.4;Future-Sequence 的机器人全程保持直立,走完全程,回报 889.2。同脑同身,唯一的区别是邮路的寄法。至于执行回执的可靠性,30000 次转移测试里 ECT-Full 与 ECT-ID 都 100% 找回了精确的实际动作——动作归因不需要什么特权模拟器访问,工程上完全落地。

⚡ 两条警示,比解法本身更重要

这篇论文最可贵的不是接口,是两盆冷水。

第一盆:接口不是万能补丁,它必须匹配训练时学得的语义。 团队发现延迟感知训练(delay-aware training)和执行侧纠偏不会自动叠加。用干净数据训练的检查点配上 Future-Sequence,全面受益;但用"固定 2 拍延迟"数据训练出来的检查点再配 Future-Sequence,所有恶劣条件全线崩溃——恶劣平均从 256 掉到 52。为什么?最可信的解释是双重补偿:训练时模型已经学会了"我下的指令会被延迟两拍才生效"这个隐含约定,它的整个动作语义都建立在这份延迟之上;接口再自作聪明地纠正延迟,等于把它的世界观又掰回去一次。两套正确的逻辑撞在一起,就是双倍的错误。随机延迟训练则好坏参半:随机延迟、丢包、乱序下改善,固定延迟下退化。教训冷冰冰地摆在那里:接口设计必须匹配训练时学得的隐含动作语义,不能看到错位就上手掰。

第二盆:回执要趁热吃。 实际动作的反馈必须和观测转移在时间上对齐:立即回执效果最好,延迟一拍打折扣,延迟两拍更差。拿到真相固然重要,拿到"过期的真相"就大打折扣——账本可以补记,但记在错误的月份里,现金流预测照样崩。

🚪 门外的第一课

这篇论文也有没走完的路。它聚焦的是动作侧的异步;观测侧的异步——传感器各报各的时间戳——是另一条战线(Anand 等人 2026 年的工作)。Oracle 那个 0.822 要记得,它是诊断工具,不是能部署的接口,更不是回报上界的保证。训练与接口相互作用的机理,"固定 2 拍训练为什么和未来序列接口如此相克",作者给出的是最可信解释,更深的理论还欠着。

但故事的骨架已经足够清楚,而且我认为它讲出了一个比机器人控制更大的道理。世界模型是这一轮 AI 里少有的、认真想成为"现实副本"的技术:它想把物理规律学进参数,想让推演代替试错。这篇论文告诉我们的是:即便你的沙盘推演全对,从沙盘到现实之间那条邮路也能凭一己之力决定成败——而修邮路的方法,一点都不性感,全是网络课作业:打包、编号、设缓冲、要回执。

还有个容易被数字盖过去的细节值得单独说:消融实验里"喂当前实际动作"和"喂缓冲内容"这两组都失败了,说明模型缺的不是更多信息,关键是信息被消费的位置和语义必须对。这正是"动作语义错位"这个标题的分量——错位不是一个可以糊弄的误差项,它是架构级的概念混淆。

这是个系列的第一篇,系列叫「门外的世界」。我们想追踪一个共同的问题:当 AI 走出干净的系统、进入真实世界,门外的混沌怎么进评测、怎么进设计。物理世界好歹还讲力学:抓手松手就掉,指令丢了就没执行,回执写得明白就能对账。下一篇要讲的那扇门更麻烦——人类社会。用户会改主意,"说过的"不等于"算数的",字面之外的含义一层套一层。沙盘将军在物理世界摔的跤,进了人类社会一个都不会少,只会摔得更抽象。

参考文献

  • Shengtao Wen, Xiang Chen, Yu Tian, Lingbing Guo, Lina Gong, Sheng-Jun Huang. Mind the Execution Gap: Action-Semantic Mismatch in World-Model Control. arXiv:2610.06582 [cs.AI], 2026-10-05. https://arxiv.org/abs/2610.06582
  • Hansen, N., Su, H., & Wang, X. TD-MPC2: Scalable, Robust World Models for Continuous Control. 2024.(TD-MPC2 原论文)
  • Hafner, D., Pasukonis, J., Ba, J., & Lillicrap, T. Mastering Diverse Domains through World Models. 2024.(DreamerV3 原论文)
  • Kurose, J. F., & Ross, K. W. Computer Networking: A Top-Down Approach.(接口设计的分组传输与接收端缓冲灵感来源)
  • Anand, et al. 2026.(观测侧异步相关工作,本文局限部分提及)

#论文 #arXiv #AI #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录