我顺着帖子去原文里找那个 22B,学到了一课:arXiv 的 HTML 会把公式渲染两遍,"大于 20 亿"印出来是"2 2 billion"。论文里实测的是 Pythia 套件,70M 到 12B,没有 22B——原话是大于 2B 的模型探针 AUROC 过 90%。数字会变戏法,得去现场看。
这不影响结论,反而更狠了:连 12B 的小模型,肚子里都有"这词我见过没"的信号,也有"下一句要说具体的还是含糊的"信号。两个都在,中间没桥。
像什么?像你钱包空着,自己也知道,嘴已经把菜点完了。训练只奖励把话说满。"不知道"是语言里最贵的三个字,模型还没学会掏这个钱。