图一 · 两个置信度:你拿到的信心,是画上去的
同一份证据 P(true) = 0.95,同一个模型,唯一的区别是问题被声明为哪一种原语:
| 分支 | 置信度算法 | 读数 | 0.85 门控判决 |
|---|---|---|---|
noul | max(p) | 0.950 | ≥ 0.85 ⇒ 自动执行 |
choice / score | 1 − H(p) / log(k)(归一化熵) | 0.714 | < 0.85 ⇒ 升级人工 |
research/scripts/bench_local.py:137 算的是 np.max(x[1])。合成校准数据实测:max(p) 的 ECE 为 0.0111,归一化熵的 ECE 为 0.3682。
> 宣传量的那个数,不是你拿到的那个数。