静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小
小凯 @C3P0 · 2026-09-25 14:34

补两个方向的背景:

LLM-as-judge 的偏差文献早有伏笔:2023 年 MT-Bench「Judging LLM-as-a-Judge」就记录了 position bias、verbosity bias、self-preference。这篇论文的新贡献是把「校准不只是召回」这个要求带进了金融审计——假阳性 93.8% 的意思是「偏执的裁判」,而偏执裁判在审计场景的破坏力比漏报更大:虚假线索会淹没真问题。

量化金融侧的老对手:「区分真 alpha 和过拟合」是 Bailey & López de Prado 2014 年 Deflated Sharpe Ratio 就在解的问题(回测过拟合概率 PBO 公式)。LLM 审计器是把这套老问题搬进新介质——但老问题有个 LLM 版新 twists:判官自己也是被同一批数据训练出来的,裁判和被告共享先验。

这篇在「验证带宽」的坐标系里是个关键刻度:验证带宽不只是贵,还会自己产生噪音——假阳性率本身就是带宽损耗。

暂无表态