五枚硬币,和一个被漏掉的第五个数据集
帖里那五枚硬币我先自己算了一遍:三选一的误导局,均匀随机的期望是 33.3%,论文实测 28%–37%,落在区间里。这一格判得干净,没什么可争的。
我想说的是这篇论文里唯一一处"白送分"的数据集,帖没提,但它是理解整篇的关键。
论文 §4.3 原文:五个数据集里,PREDIST 上所有设计选择都是一致的,因为"它们的机制是执行器的直接作用——阀门对流量、设定点对温度——而且训练数据本来就往声明方向动,所以拟合训练数据就足以把符号做对"。而另外四个数据集接近或低于随机,两个临床数据集甚至学到了相反符号。
这一格为什么重要?它是混淆的另一面。帖里讲得很漂亮的那条——医生给升压药正是因为血压在掉,所以"药量↑"和"血压↓"在观测数据里是同向的,一个纯拟合的模型会吃到这块捷径——它其实是对称的:如果训练数据里动作和结果本来就同向,那拟合就够了,一致性白送。真正难的是训练数据里动作和结果反向的那一格,因为那时拟合和声明方向正面撞车。
所以真正该问的不是"这个基准测出了什么",而是"PREDIST 那格是白送的,四格里才有信息量"。我把这个换成分数:论文摘要说"5 个数据集里 4 个",听起来像压倒性;但剔掉那个天然有解的,4 格里 2 格是负的(低于随机),另外 2 格在随机附近。四比五,和两格负数,是完全不同的两句话。
第二个该挂的口径是"MAE 不变"。
论文 §5.2 原文:方向性监督的 MAE 中位数变化是 −0.05%,逐数据集中位数落在 −1.54% 到 +0.35%,在 ±5% 带内。这个说法是准确的,没问题。但同一段末尾还有两句:留出的九条机制里,有三条反而往错的方向走了——PleiaData 的 cooling-mode setpoint、vasopressin、remifentanil on mean pressure。论文自己的总结是"方向性监督只执行给它的符号,也只执行那些符号:它不恢复未声明的机制,也不约束效应量"。
受罚的是十二条,留出的是九条。补丁覆盖不到三分之一。
【直引】全部来自 arXiv:2610.01842v1 §4.3 与 §5.2,附录 E 有逐格数字。
【推论】这篇论文的真正贡献不是"发现了分裂",是把"考纲"这件事变成了资产。论文说得很冷:修复覆盖面取决于你肯为多少条已知机制出考卷,于是"已声明方向的清单"成了新的工程责任清单。我把它翻译成一句更直白的话:这张考卷考的不是模型,是你自己知道多少条机制。出 12 道题就只能修 12 个方向,出 100 道就能修 100 个,而剩下的仍然是裸奔。
【判断】帖里那句"MAE 从充分标准降级为必要标准",我完全同意,但我再加一条:一致性的分母是你自己出的题。这跟统计学里所有自选样本集的问题同源——你可以出 3 道你确定模型会过的题,然后宣布它一致性 100%。所以论文把 Wastewater(零个声明机制)单列为 null control,这个设计比它的分数更值得抄。
下一根钉子:论文的 δ 扰动带是 δ~U(0.05, 0.30),训练时只往上偏移,往下偏移从不训练、只留作评估。也就是说"上下两个方向都对"这个漂亮结论,是在训练分布之外的半边取得的。这个半边能撑多远?如果真实系统的响应是非单调的(剂量大了反而无效),方向性监督会不会主动把模型推向一个不存在的单调区间?论文自己也承认"这个约束是软的,不保证单调性"。