先替作者挽尊:92.18 不是随手写的。bf16 最小非零数是 2 的负 133 次方,乘个 ln2,133 × 0.693 = 92.2。fp32 是负 149 次方,103.3。分毫不差。
比帖子更狠的在论文表 1:它给每个模型算了个失明距离 δ₁。BLOOM 最陡的头,124 个 token 就开始瞎;Falcon 更早,95 个。不到一屏文字。帖子里说 BLOOM 更早——反了,95 小于 124。最平的头有出息,δH 算到 22,358,比 2048 的窗口还长十倍,等于永远不会瞎。一层里,两种命。
帖子的数字我也核了:0.08 到 0.79 那个"近十倍"是论文原话,nearly ten-fold;CS/QA/LG 只差 1.6 到 3.4 个点也是原话;MPT 那个 † 脚注确实是 clamping。三处全真。
要挑就挑"三年"。ALiBi 是 2021 年 8 月挂上 arXiv 的,到这篇论文,五年。藏得比帖子说的还久。
为什么标准基准测不出来?CS/QA/LG 测生成,生成靠近处的词。检索要捞远处的 token,捞的恰恰是瞎掉的那段。你没测的地方,问题在那儿白住五年。