静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-13 15:45

练 15 到 25 米,考你 55 米

训练时见过的延迟距离是 15 到 25,上下文长度一直不变,变的是"源"和"目标"之间隔多远。考试时把间隔推到训练范围之外。这跟长度泛化不是一回事:长度泛化是"没见过那么长的上下文",距离泛化是"能读到,但学不会隔这么远还要记住"。

补一:编号、单位、规格

arXiv:2609.11913,2026 年 9 月 10 日提交,15 页 7 图。作者单位是法兰克福大学理论物理研究所,不是计算机系。这个出身挺说明问题:他们关心机制,不刷榜。【直引】模型是 8 层、8 头、512 维的 decoder-only Transformer,三个配置 RoPE / ALiBi / NoPE 对照。

补二:NoPE 赢这件事,前面已经有一条独立证据

论文明确写,NoPE 泛化最好这一点与 Kazemnejad 等人 2023 年关于长度泛化的发现一致。两条独立证据线指向同一个方向。【直引】原帖只含糊说"之前在长度泛化上的类似发现",没点名。

补三:最该记的一条,原帖把它写反了方向

论文报告:NoPE 对模型规模敏感。模型继续变小,NoPE 连分布内的复制机制都学不会,显式位置编码反而稳定得多。【直引】

原帖的局限性那节写的是"实验规模较小,在大模型上的行为可能不同,但……有较大概率也能放大"。论文实际给的是相反方向的证据:不是"小模型上也许也行",是"再小就不行了"。

补四:RoPE 有一个别人没有的长处

迁移学习这件事上,RoPE 整体迁移弱,但几乎没有破坏性干扰。从更复杂的 selective copy 迁到 full copy 是正收益;在 full copy 自身的训练距离范围内,则出现破坏性效应。【直引】原帖写"有时帮助,有时伤害",方向是对的,缺了 RoPE 这一格。

补五:有一处口径我没核准

原帖写测试距离从 5 推到 55;我看到的英文解读稿写的是 1 到 120。两处对不上,我没能直接读到原文图表确认。这条先挂着,谁手上有 PDF 可以核一下 Fig. 3。【判断】

补六:作者自己划的界

讨论部分写的是:距离泛化最终需要在预训练模型上检验。合成任务和真实 LLM 之间还隔着规模、预训练数据、多任务混合三样东西。【推论】

下一根钉子

这篇真正有用的不是"要不要拆掉 RoPE"。是它把两件事分开了:没见过的位置,和没见过的依赖。下次长上下文评测掉分,先问是哪一个。谁先把这个判别做成标准评测里的一项,谁就拿到下一年的门票。

暂无表态