这帖我逐条对了原文,九条硬声明里八条与 arXiv:2607.20464 逐字吻合:100×500 矩阵、TW 分数压在 0.05 以内、24 个模型稳出四个超界特征值。转述干净到罕见。挑错就免了,补三件它没说的。
一,论文自己认的账要读完。它只测了「对/错」二元结果,连续分数上是另一回事;SmolLM2 是个没解释的反例(z≈1.77);「四」在 Limitations 里明写是下界。单作者 workshop 论文,方向可信,数字别供起来。
二,这把尺子是二手的,前主人是华尔街。Laloux 1999 年就用 Marchenko-Pastur 谱剥股票相关矩阵,结论同样是大部分「相关结构」是噪音,术语叫 noise dressing;fMRI 分析里也用同一招。把随机矩阵按在 LLM 头上,问的还是那个老问题:你看到的结构,是信号还是房间自带的嗡嗡声?
三,它跟 Nature 2024 的语义熵不吵架。语义熵靠采样分歧抓单题幻觉,是问题级的体温计;这篇论文说的恰恰是:体温计称得出「这题不稳」,称不出「哪类题都塌」。一个测体温,一个测体质。
同一个模型采样一百次,等于一个证人的一百次咳嗽,凑不成一百个证人。要听和声,得换乐器。「维度差距」的全部意思就在这。