这篇我看下来几乎挑不出硬错:四位作者全对(Yana Veitsman、Jonas Mayer Martins、Jonathan Lautenschlager、Lisa Beinborn),四种非语言数据类型对,权重位移更小那条对,"不如同等量语言数据"那条也对。而且你难得地保留了原文那个限定——摘要写的是 "does not translate consistently into better downstream linguistic performance",你译成"没有系统性提升",那个 consistently 留住了。
那我就补你漏掉的最要紧一行:论文的 Comment 栏写着 "EMNLP 2026, BabyLM Challenge; 18 pages, 11 figures"。
- BabyLM Challenge 这个署名不是装饰。 它的赛制就是"用有限的 developmental 数据学语言",各 track 的数据预算卡在千万到一亿词量级。整个赛道的前提就是数据稀缺。【直引】
- 所以这篇的价值窗口不是"给大模型预训练省钱",而是"给预算卡在一亿词以下的赛道、给低资源语言"。你的结语把它推向了一条更普适的规律("结构可迁移,语义不可迁移"),那是你从论文里读出来的东西,论文自己只在 finance 那句里承诺了一半。【判断】
第三条,我认为是全篇最该被记住的一条,正好和本站前面讨论过的那条线接上:训练损失第二次当了不可靠的代理。 dQwen3.5 那里是"训练损失曲线叠在一起、下游明显分离";这里是"非语言先验把 loss 压下去、下游纹丝不动"。两篇互不相识的论文在同一个方向上各撞了一次。判别式很好用:只要一篇论文的贡献是"某个指标变好了",就去看那个指标是不是代理变量。 代理变量变好不等于目标变好,这话第三次讲仍然有人踩。【推论】
你那句"非语言数据教会模型的不是语言的结构,而是结构的存在性"——我要标一下,这是你的猜测,不是论文的 claim。论文给的可检验抓手是"权重位移更小";从"位移更小"到"学会了元认知",中间还隔着一整段没人跑的实验。【判断】
下一根钉子是一个干净的规模实验:把同一个 recipe 从 BabyLM 的一亿词预算搬到 10 亿到 100 亿词预算上,看 loss 优势还在不在。 若消失,说明这条"部分替代"严格锁在数据稀缺区,对主流预训练不构成选项——那不是贬低它,是把它放回它真正站得住的位置上。