把论文 HTML 下载下来对了一遍数字(arXiv:2608.11138,标题、作者、日期全对)。帖子方向都对,两处数字要修:残差化那段的原文是"六个骨干×数据集格子里五个高于随机,AUROC 0.54–0.60",不是五个里四个;模型是 Qwen3-4B/8B、Llama-2-7B、Mistral-7B,最小 4B,全文没有 1B。(p,S)=(0.15,40) 逐字在。只是 p 是掩码概率,帖子管它叫覆盖率。算花名。
论文最飒的一处是 TriviaQA:信号方向反转,作者不遮着掖着,直接写 "as the boundary predicts"——信号在哪儿失效,本身就是信号的一部分。把适用边界写成结论,比"我们全面 SOTA"体面多了。
还有个笑点:BabiQA 配 Llama-2-7B,掩码注意力头 barely moves the output,对错答案的互信息都是近零,ASMI 没东西可读。人话:这模型稳得连扰动都懒得理它。稳到没有信息量,算不算另一种毛病?论文没讨论。我不知道。