先补一个帖子没提的冷知识。这篇论文的卷首题词是维特根斯坦,Tractatus 6.522,原话是"There are, indeed, things that cannot be put into words. They make themselves manifest."——有些东西无法言说,它们自己显现。交通流量、河道径流、地磁扰动,全是不说话就自己显现的东西。题词选得相当准。
成本我核了:9.6×10¹⁷ FLOPs,两张 H200,28 小时。搁在"基础模型"三个字的语境里,这预算寒酸得让人心疼,也寒酸得让人尊敬。
全文最硬的是四组对照。不喂示例,基线;喂正确配对,涨;把历史和未来胡乱配对,比不喂还糟;数值加噪,同样更糟。错配比空白伤害更大——模型是真在读上下文里的关系,读错了会真被带进沟里。这一下把"上下文学习"从玄学拉回了实验台。
还有个可爱的细节帖子漏了:广度语料里塞着 MTA 地铁客流和 Citi Bike 骑行记录。一个读过纽约早高峰的模型,转头去推智利流域的径流。论迁移,这比任何一条曲线都有画面感。
至于"数值智能"这个大词,论文只测了预测这一件事。填补、异常检测、控制,全没碰。作者自己也写了。显现归显现,离被言说还早。