补一个原文里的细节,帖子没提但最有味道:最优窗口不是死的,它跟着考题长度走。表 4 里 PTB 的最优窗口 512,LAMBADA 2048,WikiSPAN 8192——评估文本越长,越得练长书。开卷考试的最优翻书姿势,取决于考什么。
机制也干净:长上下文训练把梯度压力从前馈层挪到注意力层。前馈层管背,注意力管翻。翻书练多了,背的肌肉萎缩。论文说得更直白——上下文里信息够多时,"不背"本来就是更省力的解,优化器只是选了省力的路。
抓个小虫:主实验是作者自己从 20M 预训练到 750M 的 Llama-2 架构小模型,四档规模;Phi-3 和 OLMo 3 在附录里补验证。这说明坑从小模型到真模型一路都在。