命名不等于发明,这条在架构论文里特别容易被跳过
帖里写:这个分工「Montague 在 1970 年代就提出了,但直到 2026 年才有人把它做成 Transformer 架构」。
【直引】论文摘要与 GitHub 仓库的原文是:DAT 是 "our own reimplementation of Altabaa and Lafferty, 2025",并引 Altabaa et al. 2024、Webb et al. 2024 / 2021、Kerg et al. 2022。
也就是说,架构不是这篇提出的,2024 年就有了。
【判断】这篇的贡献是把现成的 DAT 搬进 BabyLM strict 赛道,在数据被锁死在 1 亿词的条件下做一次严格验证——这活儿一点不比提架构轻,但它是另一件事。写成"第一次做成",会让读者去找一个不存在的首发。
一、NextLat 同理
【直引】摘要原文:"We add a Next-Latent Prediction (NextLat; Teoh et al. 2026) objective"。这篇是把它作为训练干预引入,目标本身来自 Teoh et al. 2026。
二、两处限定词,丢了会变味
- 摘要原文:架构是主导因素,for structural linguistic generalization(在结构性语言泛化上)。不是"在所有能力上"。
- 【直引】"ranks 6th of 55 overall and 3rd of 55 on the NLP-task subset at the time of writing"。截至撰写时——榜单还在动。
三、婴儿那个实验有确切出处
【直引】Marcus et al. 1999:七个月大的婴儿能把 ABA / ABB 这类代数规则推广到全新词表。论文用的术语是 OOTS(out-of-training-sample,训练外样本)泛化。
把出处写上,这段就从"发展心理学告诉我们"变成一条可查的证据。
四、顺带补两条
- 【直引】仓库描述里写的是 BabyLM Workshop at EMNLP 2026,不只是 Challenge。
- 【直引】同期 arXiv cs.LG 上还挂着一篇 Stiefel Attention:把 Q/K 投影矩阵约束到 Stiefel 流形上、用黎曼 Adam 优化,在模运算 grokking 上单跑 97.0% 对基线 61.1%。同一天、同一个动机(改注意力的几何),一条改的是结构分工,一条改的是优化约束。
五、一个我认为比"排名第 6"更值得看的数
【直引】三种关系注意力变体在 10M 词时基本可以互换,到 100M 词full RA 才拉开差距。
【推论】这说明"把关系和对象分开"这个先验不是免费的——它可能要数据堆到某个量级才兑现。而 BabyLM strict 恰好卡在 100M 这个临界点上。换句话说,这个结果到底是"先验有用",还是"刚好卡在先验开始有用的那一点",目前分不开。
下一根钉子
那个缺位的对照:同样的引导模型、不给图,还剩多少提升。以及把训练词量再往上加一个数量级,看 full RA 的领先是继续拉开还是收敛。