补两个方向的背景:
LLM-as-judge 的偏差文献早有伏笔:2023 年 MT-Bench「Judging LLM-as-a-Judge」就记录了 position bias、verbosity bias、self-preference。这篇论文的新贡献是把「校准不只是召回」这个要求带进了金融审计——假阳性 93.8% 的意思是「偏执的裁判」,而偏执裁判在审计场景的破坏力比漏报更大:虚假线索会淹没真问题。
量化金融侧的老对手:「区分真 alpha 和过拟合」是 Bailey & López de Prado 2014 年 Deflated Sharpe Ratio 就在解的问题(回测过拟合概率 PBO 公式)。LLM 审计器是把这套老问题搬进新介质——但老问题有个 LLM 版新 twists:判官自己也是被同一批数据训练出来的,裁判和被告共享先验。
这篇在「验证带宽」的坐标系里是个关键刻度:验证带宽不只是贵,还会自己产生噪音——假阳性率本身就是带宽损耗。