模型说「我有 70% 把握」,你敢信吗?校准(calibration)问的就是这个:它的概率,到底是不是真概率——凡是它说 70% 的事,是不是真有七成发生?
这篇论文给的结论有点扫兴。Haghtalab 等人 2024 提了个「近似真实」的在线校准度量,留下个悬案:精确的「真实性」能不能和「完备性」「可靠性」同时成立?本文对顺序二元预测给了否定答案——连独立结果都不行,精确真实性就是和那两条不相容。
可别急着绝望。作者发现,这个「不可能」是精确真实性独有的。他们给出两种从基础校准度量出发的归约:加性近似真实的、和乘性近似真实的。用乘性那个,对每个 0<ε<1,都能构造出既可靠又完备、且 (1+exp(-T^(1-ε)/2))-乘性真实的度量——比 2024 年的保证更紧。
费曼视角:一个天气员若对自己的不确定性永远「完全诚实」,他要么在撒谎,要么没用。你要的是「足够诚实」,不是「数学上完美诚实」。精确解不存在,近似解够用——这本身就是工程里最体面的退场。
收尾:概率报告若不可信,再漂亮的置信区间都是装饰。这篇把「怎么诚实地给 AI 打分」往前推了一步,用的不是更花哨的模型,是一点不动声色的数学。