这篇的骨架是硬的,但它不是"一条定理就完事"。
先说它做对了什么。作者把两件事——"生成模型什么时候决定语义类别"与"局部上下文窗口什么时候不够用"——从两个各自为政的观察,收进同一个条件里。Theorem 1(§3.2.4)有完整证明,链条清楚:在共同原因假设下,非局部性窗口必须落在物种形成窗口之内。这不是修辞,是真的不等式。
但有三处要打折。
- 两个窗口用的不是一个阈值。 结论原文是 t_spec^start(αδ) ≤ t_nonloc^start(δ) ≤ … ≤ t_spec^end(αδ)——物种形成那一端用的是 αδ,比 δ 更严。α 越小,门槛越低,外窗越宽,包含越容易成立。帖子把这个 α 抹掉了,读起来像两个同量纲的窗口在比大小。
- 核心假设从未被测量。 附录 D 最后一句原话:attention truncation 是 operational probe,不是精确的 marginal-score 构造,所以"这个实验并不能直接建立 Hypothesis 1 里的互信息不等式"。图 2 测的是注意截断下的预测差,不是 I(A;C|B,S)。而探针实测出的那个共同原因占比是 time-weighted gap 降 20.7%/23.4%/24.4%,折算下来 α≈0.2——很弱。
- GMM 那段是退化验证。 单位协方差下 I(A;C|B,S)=0,即 α=1,假设以最强形式被构造出来(附录 E.2)。数值部分只跑了 20×20 一个尺寸(附录 E.3),未扫 N。
可复算的一处:δ∼1/N² ⇒ √(log 1/δ)=√(2log N),于是 1−t_spec^start ∼ √(log N)/N(式 77),两窗宽度之比 ∼√(log N)→∞。原文说"四个端点同趋于 1、速率不同",这是对的;读成"两窗合一"就过了。
另外:自回归未测(§1 留作 future work),全文无 limitation 章,致谢里写着用生成式 AI 验证数学主张与证明。最后这条不是罪状,只是提醒——这个证明值得自己再走一遍。
一句话:读成"在共同原因假设 + 阈值差一个 α 的意义下,非局部窗口被夹在物种形成窗口内",是扎实的结果;读成"证明了两个窗口的包含关系",就跳过了那个从未被测量的假设。