[论文] 报得分毫不差的预言家,输给了一枚硬币
一枚硬币抛向空中,落在正面或反面。拿它去回答任何一个是非题,答对的期望概率是百分之五十。这是全天下最廉价的基准线:不用训练,不用数据,不用关于世界的任何知识,甚至不用脑子。
目录
🎯 五枚硬币,与八个数据集
0.5。
一枚硬币抛向空中,落在正面或反面。拿它去回答任何一个是非题,答对的期望概率是百分之五十。这是全天下最廉价的基准线:不用训练,不用数据,不用关于世界的任何知识,甚至不用脑子。
现在看一个认真训练出来的东西。时序世界模型——Time Series World Model,TSWM——吃进三样东西:观测历史、计划动作、外生输入,吐出一种东西:受控系统未来状态的预测。打个比方,它的考场是这样一个系统:重症监护室里的病人,或者一座数据中心的冷却回路。它有状态(血压、温度),有你可以施加的动作(给药、调设定点),还有你管不了的外生输入(天气、客流)。模型要做的,是推演"在这些条件下,接下来会发生什么"。
论文在八个公开数据集上搭了考场。数据来自工程基础设施和临床护理,动作全是真实系统里被人施加过的真实动作。七个骨干模型,乘以五个随机种子,再扫过三条设计轴——预测空间、计划融合、计划编码——每个配置都先把预测误差压到尽可能低。
然后发下来一张考卷,考卷上只有一类题:已知方向题。
医学常识说,升压药 vasopressor 会升高血压。这是"已声明的机制"——方向是领域先验,不需要论文去发现,更不需要模型去猜测。检验方式朴素得像在抽查作业:把计划动作往"加药"的方向挪一点,看模型预测的状态是否朝"血压升高"的方向动。动了,得分;不动,或者反着动,扣分。
五枚硬币排开。在 5 个拥有已声明机制的数据集上,误差最低的那个配置,有 4 个的得分处于——甚至低于——抛硬币的水平。
而这不是某个角落里的偶然事故。把所有配置摊开看,结论冷得刺骨:没有任何一种设计选择能避免这个分裂。预测误差和机制一致性,是两根各走各的轴。把一根拧到最优,另一根可以纹丝不动,甚至倒着走。
翻译成临床语言,这件事一点也不客气。世界模型正在被用来比较用药方案——"接下来四小时维持剂量"和"接下来四小时梯度加量",哪一条路径的推演结果更好,模型说了算。而本基准里预测最准的模型,对"升压药升血压"这种写进教科书的方向,答对的次数可能不如一枚硬币。一个连"药往哪边推、血压往哪边去"都答不稳的模型,正被请去为"选 A 方案还是 B 方案"背书。这不是论文的修辞,是这个领域此刻的真实处境。
这篇论文把这件事做成了三部分:一个形式化,一套基准,以及两张配方。下面按这个顺序走。
🧭 世界模型真正的用处,是比较没发生的事
先把 TSWM 拆干净。一个受控系统,状态记作 s,动作记作 a,外生输入记作 e——三者要严格分开,因为它们的角色根本不同。状态是系统的现在,外生输入是系统要忍受的天气,而动作,是系统将要承受的决定。模型读进一段历史、一条未来计划、一路外生输入的假设,输出未来状态的分布。形式化里,动作被分成三种形态:连续动作,比如剂量的刻度;模式动作,比如设备的运行档位;事件动作,比如一次开关、一次切换。真实的系统里三种混着用,所以任何检验都得三种都能落地。
关键的问题不是模型是什么,而是模型为什么存在。
如果动作只是沿着历史的惯性往前走,预测的价值其实很有限——那种事,普通的时间序列预测器就能干,不需要世界模型这块招牌。世界模型真正的用途,是回答"如果":如果明早把冷却设定点调高两度,机房的温度曲线怎么走;如果下周实施错峰限流,电网的负载峰会不会削平;如果接下来四小时把升压药的剂量梯度加大,平均动脉压能不能拉回来。换句话说,它是一张用来比较的清单:把几个尚未执行的计划并排摆上去,逐条推演,看哪一条的结果更好,然后挑一条执行。
planning 的全部意义就在这里。任何真正要紧的部署——临床决策支持、基础设施控制——做决定的方式都是"比较几个还没做的选择",而不是"复述将要发生的事"。模型被请进这些场景,身份是参谋:不亲自拍板,负责把每条候选路线的推演结果摆到桌面上。
这就把评价标准逼到了一个尖锐的位置。既然模型的本职是比较未执行的计划,那么考核它,就得考核它对"计划变更"的响应。它答"会发生什么"答得再准,也只是完成了一半的本职——而且是相对容易的那一半。
🕳️ 只考"发生过的事",永远考不出"假如"
现有的做法是什么样?拆开看,简单到近乎随意:把动作当协变量,和状态历史、外生输入拼在一起,喂给一个预测器;训练目标是在已执行的计划上把预测误差(MAE)压下去;评估标准,还是这个 MAE。
问题在于数据从哪来。训练数据是系统日志:医生实际上开了什么药,运维实际上做了什么操作。换句话说,每一个训练样本都是"历史照原样走下去"的样本。模型在这种数据里学到的是拟合的艺术——世界照这样运转时,接下来会发生什么。至于世界"假如不这样运转"时会怎样,数据里一次都不出现,损失函数一次都不问。
打个比方。一位天气预报员,温度报得极准,历史同期的误差全场最低,颁奖都不带犹豫的。你问他:"如果明天实施人工降雨,气温会怎么变?"他说,上升。你换个日子再问,他说,下降。再问,又上升。方向完全随机,随机得很有职业道德。为什么?因为他只学过拟合发生过的事——训练集里每一天的天气,都是"没有人工降雨"的天气。他从未被问过"假如换个做法"。方向感不是误分的赠品,不会因为你报得够准就自动长出来;它是要单独学、单独考的东西。
更麻烦的是,拟合不但不奖励方向感,有时候还公开奖励它的反面。升压药这个例子里藏着经典的混淆:医生开升压药,往往正是在血压往下掉的时候——药是给最危险的病人上的。于是观测数据里,"药量"和"血压"的相关可以是弱的,甚至是反的。一个纯粹以误差为目标的模型,完全可以吃下这块捷径:在观测分布上它是对的,甚至是有预测力的;翻译成干预语言,它是错的——把药加上去,血压不会降。这一层错,在只考已执行计划的评测里,一次也不会暴露。误差越低,越说明这套捷径吃得干净。
这就是"只看预测误差"漏掉的那一层:误差度量的是拟合已经发生之事的精度,而世界模型的工作对象,是那些没有发生的事。一个评测从来没有挪动过计划动作,它就永远测不到模型对计划变更的响应——而那个响应,恰恰是模型被造出来的理由。
🧪 机制一致性:给"假如"出一张考卷
缺考的东西,要补考。论文给出的补考科目叫机制一致性(mechanism consistency),定义朴素得不像一个学术概念:对某些动作—状态关系,领域已经声明了方向——升压药升血压,是医学常识;阀门开大流量升,是工程常识。检验方式就一步:把动作往声明的方向移动一点,看预测的状态是否朝声明的方向变化。朝了,一致性;没朝,甚至反着走,不一致。没有假设检验的烟火气,就是把"假如换个做法"第一次变成了可以打分的题。
要注意这张考卷的知识论地位。它不是因果发现——它不要求模型从数据里找出未知的因果箭头;它是因果核对——它要求模型别在已知方向上犯糊涂。像期末考试的监考老师,不发明题目,只核对这一步推导的方向对不对。这个定位看似保守,实则锋利:一门学科里能被教科书级别的常识点名的方向,是最低限度的及格线。连及格线都守不住的模型,谈论它在更复杂的干预上表现如何,是没有起跑线的。
而且这张考卷不挑题型。连续动作、模式动作、事件动作,三种形态的机制都要能被检验——因为真实系统的干预从来不是单一口径:调的是剂量刻度,切的是运行档位,触发的是离散事件。形式化把三种动作分开建模,检验就得三种都落地,这一点论文做得非常工程。
把考卷设计好,下一步是把考场搭出来。八个公开数据集,七个骨干模型,五个随机种子,三条设计轴——这场考试的规模,值得单独说清。
🔬 八个数据集,与一场无法回避的分裂
考场的地基:8 个公开数据集,来自工程基础设施和临床护理,动作全部是真实系统里真实施加过的。7 个骨干模型,5 个随机种子,每一个组合都在三条设计轴上被系统扫过。
三条轴值得逐一说清,因为它们就是从业者日常纠结的旋钮。第一条,预测空间:模型在观测空间直接预测未来,还是在潜空间里预测、再解码回观测?第二条,计划融合:计划动作从哪一侧进模型——输入侧,和历史拼接在一起;还是输出侧,在生成预测的时刻用门控的方式融进去?第三条,计划编码:计划的时间结构——什么时候做什么——怎么被表示进模型?第三条轴后来被证明最不重要,对结果的影响不超过 2.2%,基本可以闭着眼睛选。真正起作用的,是前两条。
于是每个配置都有两个分数:一个预测误差,在已执行的计划上算;一个机制一致性,在已声明的机制上算。然后,看这两个分数的关系。
结果就是那个让人坐不稳的分裂:预测误差最低的配置,在 5 个有声明机制的数据集上,有 4 个的机制一致性处于或低于随机水平。注意是"最低误差配置"——所有配置里拟合得最漂亮的那一个。而分裂的另一半同样重要:扫遍三条设计轴的全部选择,没有任何一种组合能天然免疫。换骨干没用,换种子没用,换融合方式没用。
回到那位天气预报员。他在所有历史天气的考试里都是第一,人工降雨的问题一道没对;你以为换个学校培养他就行了,换了七所学校、五个老师、三种教学法,他照样一道没对——因为他的备考方式里从来就没有这种题。题不出现在考纲里,分就不会长在脑子里。
这个分裂背后是一条更深的解耦。误差度量的是"拟合已经发生之事的精度",这是一道函数逼近题,逼近得够细就能赢;一致性度量的是"对未执行计划的响应方向",这是一道因果结构题,要求模型内部的关系摆对。而拟合这道考题,不奖励因果结构——捷径相关更省力气,误差更低。两根轴之间,本来就没有任何先验的桥梁。
那么问题来了:既然准确性这条轴还能再拧,就把它拧到头。论文的第一张配方,管这个。
🧰 第一张配方:把误差再压低一截
先说结论,再拆理由。从三条轴的扫描里,论文提炼出准确性配方,每一条都有数字背书:
在预测空间这一侧,冻结潜空间预测(frozen latent prediction space)——在潜空间里做预测,再解码回观测——比直接在观测空间预测,平均 MAE 降低 9.9%。在计划融合这一侧,门控输出融合(gated output fusion)——把计划动作放到输出侧,用门控机制融进预测——比输入侧拼接,MAE 降低 12.7%。两者不互斥,叠加使用,并且在全部 8 个数据集上都稳定改善。至于计划编码,影响不超过 2.2%,工程上随便选,别在上面浪费调参的预算。
理由可以这样读。观测空间是脏的:传感器噪声、环境扰动全糊在上面,直接在那里做预测,等于让模型一边学动力学一边擦桌子。潜空间把系统压成紧凑的内部表示,预测在干净桌面上进行,这是 9.9% 的来源。而门控输出融合的优越性在说另一件事:动作的影响,本应在"未来怎么演化"里体现,而不是在"过去怎么编码"里硬挤进去。输入侧拼接逼着模型在读取历史的那一刻就把动作嚼碎吞掉,可动作的意义恰恰在将来才展开;输出侧融合让动作在预测的出口处发力,门控决定它什么时候开口、开多大口,这是 12.7% 的来源。
但请记住这张配方管的是什么:它只把误差这根轴拧得更低。它对一致性那根轴的立场是——不闻不问。事实上这正是分裂发现的另一面注脚:你把拟合调得再漂亮,方向该错还是错,因为没有任何一个旋钮把"对计划变更的响应"纳进目标。误差降 12.7% 的世界模型,面对"加药之后血压往哪走",依然可以面不改色地答错方向。
准确性这条腿,论文给得很足。但只靠这条腿走路的世界模型,就是开头那个输给硬币的配置。另一条腿,得换一门完全不同的手艺。
🧭 第二张配方:给方向上一道保险
方向性监督(directional supervision)的思路,一句话就能说清:既然一致性缺考是因为没人给它出题,那就把题出进损失函数里。
具体做法:按已声明的方向对动作做一个小偏移——往"加药"那边挪一点——然后看模型预测的响应。响应里符号正确的那部分,不动;符号错误的那部分,单独惩罚。也就是说,模型从此背负双重身份:它不但要对"发生过的事"拟合得好,还要对"假如换个做法"答对方向——答错了符号,就付代价。MAE 那道旧题照考,新题加进来,两门都算分。
结果干净得让人意外:在受罚的机制上,一致性显著提升;同时,MAE 不变。两个指标第一次不再互搏。前面说过,准确性配方的所有改进都碰不到一致性;而方向性监督证明了一件事——一致性也不需要拿准确性去换。两根轴可以被同时拧紧,前提是给第二根轴单独配扳手。
为什么 MAE 几乎不动?从约束的性质可以读出答案:方向性监督只在动作偏移的邻域里约束响应的符号,是一个局部的、轻触式的修正,不要求模型重塑整个预测面。它把模型在那个邻域里扳正方向,其余部分的拟合原封不动。监督的代价近乎为零,而这恰恰说明此前的一致性缺失近乎免费可修——缺的从来不是能力,是题目。
两张配方合起来,才是这篇论文给从业者的完整答案:准确性靠冻结潜空间加输出侧融合,机制一致性靠方向性监督目标。两条腿各管一根轴,缺一条,模型就瘸一边。回到天气预报员:方向性监督相当于给他开一门人工降雨情景的必修课——考不过,不准上岗。从此他的温度依然报得极准,但"假如换个做法"的答案,不再是硬币替他抛的。
当然,任何配方都有边界。这张考卷能考什么、不能考什么,值得一份诚实的负面清单。
⚠️ 负面清单:这张考卷能管多宽
第一,机制一致性只在"已声明方向"处可考。它是一张抽查卷,不是全量因果审计:没有声明方向的机制,一致性无从打分。所以一致性分数提高,不等于模型整体变因果了——只等于它在被抽查的那几个方向上,响应是对的。把分数读成"模型懂机理"的整体证书,是新一轮的高估。
第二,方向性监督只修被罚的机制。论文里它的成绩表写得很清楚:在受罚机制上显著提升一致性,没被点名的机制照旧。修复的覆盖面,取决于你肯为多少条已知机制出考卷。于是"已声明方向的清单"成了新的工程资产,也成了新的责任清单:每漏一个方向,那个方向上就依然裸奔着一个方向性可能不如硬币的模型。在临床场景里,这份清单该由谁维护、维护到什么粒度,不是技术问题,是制度问题。
第三,分裂无法用架构选择绕开。三条设计轴扫完,没有任何一种搭配天然免疫——一致性不是免费搭车的,它必须被写进目标函数。这条"坏消息"其实省掉了从业者大量的纠结:不用再幻想换某种融合方式能顺便换来因果,反正都不能;真正该检查的,是评估管线里有没有方向测试这门科目。
第四,考场的规模。8 个数据集、7 个骨干、5 个种子,覆盖工程基础设施与临床护理——作为基准足够扎实,但"没有任何设计选择能避免分裂"毕竟是在这个考场上得出的结论。把结论推广到一切受控系统之前,这张考卷值得在更多考场发一发:更多领域、更多动作形态、更多机制声明。考卷本身也需要被考试。
清单列完,地图反而更清楚:这门课不是选修,是必修;但它修的是"别在已知方向上犯糊涂",而不是"通晓一切因果"。这个分寸感,恰恰是它可信的原因。
🌐 影响:给上岗考试加一门科目
第一层影响在最直接的地方:临床决策支持。世界模型被用来比较用药方案,这不是假想,是正在发生的部署方式。本研究给出的信息再明白不过——误差排行榜第一的模型,方向性可以不如硬币。那么任何一个用世界模型给方案排序的系统,上线前的考试里必须加上干预方向测试:在已声明的医学方向上,抽查模型对动作偏移的响应。这几乎不增加数据成本——不需要新数据,只需要把已有的模型挪一挪、问一问——它增加的是一条评估纪律。而纪律,恰恰是这个环节现在最贵的东西。
第二层影响在所有"比较未执行计划"的下游。planning、what-if 分析、方案寻优——这些调用世界模型的方式天然是干预式的:把动作改一改,看结果往哪走。这样的调用一旦落在一个一致性不高于随机的模型上,输出的排序就是抽签。而预测误差,是这张抽签的隐形外衣:它太体面了,体面到让系统设计者忘记去问方向。这篇论文做的事情,本质上是把那层外衣扒下来。
第三层影响在评测方法论本身。MAE 从"充分标准"降级为"必要标准"。一个严肃的世界模型评测协议,从今往后应该同时报两根轴:拟合精度,与机制一致性。这听起来是额外的负担,其实是迟到的补课——模型的本职是比较计划,而旧协议从头到尾没考过这个本职。加一门科目不是吹毛求疵,是把考纲对齐到岗位说明书。
往更深看一眼,这件事呼应的是整个领域对"世界模型"三个字的重新定价。世界模型的卖点从来不是预测,是干预式的想象;可当想象的公平性从未被测量时,卖点就还停留在广告词阶段。方向测试把广告词变成可验收的条款——这是从"宣称"到"交付"之间,最便宜也最值得付的一笔钱。
🗺️ 三层地图,至此完工
这是「能力地图的三层」系列的第 3 篇,收官的一篇。
第 1 篇 Mingbird(arXiv 2610.02001)画的是潜能层:能力不是不存在,而是被困在坏脚手架里,换一个 harness,四十八倍的能力原地解锁。第 2 篇 Jev(arXiv 2610.01834)画的是边界层:评价不等于模拟,能力有硬边界,让代码拥有模拟,让模型拥有评价。这一篇画的是幻觉层:看起来会的能力,可能压根不存在——预测最准的世界模型,在"升压药升血压"的方向上,5 个数据集里有 4 个输给一枚硬币。
三层叠在一起,一张完整的地图浮出水面:有多少能力是被困住的,交给脚手架工程去解锁;有多少能力是有硬边界、该让位给代码的,交给架构分工去安置;有多少能力是看似存在实则幻觉的,交给机制审查去拆穿。三处病灶,三种处方,恰好各管一层,互不替代。
地图完工,不等于路好走。恰恰相反——它标出了三处最容易让人以为自己已经在走路的地方:换个脚手架就以为能力见顶,让模型越界去模拟就以为边界不存在,预测误差一低就以为机理已懂。这份清醒,是这三篇论文合起来留给从业者的真正资产。记住那个数字:0.5。下次看到一个漂亮的世界模型演示,先问一句——它比硬币强多少。
📚 参考文献
- Haochen Zhang, Jiaheng Guo, Zhen Xu, et al. On the Divergence of Accuracy and Mechanism Consistency in Time Series World Models. arXiv:2610.01842, 2026.