静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 17:40

w8-c7-posteriorbench.svg

你去医院拍片子,医生递给你一张"最可能"的影像。可同一张片子,背后站着一整族都说得通的病灶。

科学反问题就是这么回事:达西流反演、泊松源恢复、碳捕集封存、光传输材质推断——观测稀疏、数据带噪、正向模型非线性。同一组观测,本来就该对应一堆解。这里头的危险在于:一个方法可以在点精度上赢麻,同时在分布上输光。它把所有相容的解平均成一张"最安全"的图,或者把所有可能性塌成一个过度自信的点。

PosteriorBench 干的事,是把"你交的是不是一个诚实的分布"变成可以打分的东西。每个任务配一个参考后验,配五个指标:后验均值误差、后验标准差误差、MMD、切片 Wasserstein、径向平均功率谱误差。前两个管边缘矩,中间两个管分布对齐,最后一个管全局频率结构。思路很正:不问你像不像,问你全不全。

数字里有几处扎眼的。

最刺眼的是切片 Wasserstein 那一格:扩散类和解耦类方法比参考差 20 到 37 倍(泊松上 ECI 的谱误差甚至差 467 倍)。这些方法单张图的质量没得挑,在"解的多样性"上塌方。更麻烦的是作者观察到的一个反向现象——把样本往单个参考解上推,点态误差下降的同时,分布误差在上升。这意味着一个行业惯例正在系统性出错:用点态误差做 early stopping、选 checkpoint,选出来的往往是后验最塌的那个模型。

第二处更响:光传输那个任务上,最便宜、血统最老的方法五项全赢。ES-MDA(集合平滑器,数据同化的老古董)只花 0.1 分钟,均值、标准差、MMD、Wasserstein、谱误差五项全部第一;扩散系求解器(FunDPS、Fun-DDPS、DiffusionPDE、DDIS、FunDiff)要 4.8 到 10.8 分钟,没有一项赢过它。基准论文最有价值的,往往不是它想证明的,而是它不小心暴露的。

第三处是个实用的拧巴:引导权重这一个旋钮,拧不齐两头。理论上它该正比于观测噪声的逆方差,扫完之后发现,标准差误差的最优引导权重明显小于均值误差的最优权重,MMD、Wasserstein、谱误差卡在中间。作者的原话是"一个标量引导系数无法同时优化均值倾向和不确定性校准"。对所有在做扩散后验采样的人,这一条都是当头一棒:你调引导权重时,对着哪个指标调的?如果对着重建质量调,那你的不确定性区间本来就是错的——而那恰恰是科学反问题里唯一要紧的东西。

该泼的冷水得泼足。参考后验的构造是:先从先验抽一个大池子,按似然加权,设阈值 ε=3σ,然后随机保留 100 个样本。碳捕集那个任务从 200 万个候选地质模型压到约 26,000(接受率 1.3%),最后也还是只留 100 个。所谓"高保真参考",在指标计算这一步就是一百个点——这不是真 MCMC 后验,是先验池子过一遍似然筛。作者确实做了两套独立参考集互评的收敛性检查(最坏比值都在 1.13 以内),算是给了个下限,但一百个点撑五项指标,还是紧。另外它现在只评了八个求解器,规模尚小,是一个"框架先行"的基准。

所以我的读法是:方向性很强的基准,不是可以照着选型的排行榜。它把"点精度"这个长期独占的评审标准撬开了一条缝,逼大家交出分布而不是一张图。这件事本身值得做,哪怕参考后验暂时还是一百个点的粗糙版本。

一张最像的图,买不来一个诚实的分布。

*(arXiv 2609.20794)*

暂无表态