零数据预训练解剖:D_c=0 的极点实验,和「事实必须通过与世界的交互进入」

arXiv 2609.30063(2026-09-24) Cowsik, Dolev, Li, De Luca 等,Stanford SAIL 出品,Goodman 与 Levine 压阵 本号数据坍缩谱系的 LLM 终极节点

arXiv 2609.30063(2026-09-24)| Cowsik, Dolev, Li, De Luca 等,Stanford SAIL 出品,Goodman 与 Levine 压阵 | 本号数据坍缩谱系的 LLM 终极节点

数据墙的讨论已经一年多,主流方案都在「从固定语料里榨更多信号」。这篇论文把思路推到了理论极点:训练数据一个字节都不给,全程合成。learner 和 generator 都从随机初始化开始,唯一的外部输入是算力。结论:模型在从未见过梯度更新的一点自然数据上,loss 随自博弈算力呈幂律下降——文本、图像、音乐、音频、语音、代码全成立。

标题就叫 Self-Play Pretraining with Zero Data。epigraph 两句很诚实:塞内卡的「教学相长」,和 Wheeler 的「it from bit——几乎一切从几乎无中来」。

一、机制:把「出题」变成可训练的

架构极简。generator 生成 Brainf\*ck 类图灵完备语言的小程序,程序跑在通用图灵机上,随机输入带展开成字节序列;learner 用标准下一 token 预测啃这些字节。没有领域偏置——UTM 是通用接口,任何可计算的数据生成过程原则上都能表达。

关键设计在 generator 的奖励。直觉方案是「出难题」——难度越高越好。论文明确指出这个失败模式:往可预测序列里注随机字节就能无限加难度,但毫无结构。他们的替代方案:learning progress——把 learner 对新程序的梯度和 learner 近期的参数位移做 AdamW 预条件内积,对齐才给分。翻译成人话:只奖励「learner 刚好学得动、且顺着它正在进步方向」的程序。已掌握的程序梯度近零,学不动的程序梯度不对齐,都拿低分。这就是维果茨基最近端发展区的可训练化——出题人专门出「跳一跳够得着」的题。

generator 本身用 KL 正则的策略梯度训练。消融显示这个自适应课程是灵魂:同样的 UTM 程序空间,换成固定均匀分布采样(universal prior baseline),scaling 慢得多;换成手工设计的 PCFG,语言和代码上强,图像音乐音频语音上明显落后,ICL 评测直接失败。接口越厚域内越强,接口越薄迁移越宽。

最漂亮的证据是那张数学序列发现表。算术序列第 0 轮就出现;Fibonacci、等比、二次、三次序列,generator 在 256-512 轮内找到,而万能先验期望要 53000+ 轮——学出来的课程比盲目搜索快两个数量级。训练后期模型还展现出 broad ICL,SUM 任务里能看到策略涌现的完整轨迹:先抄字节,置信度崩塌回先验,4 个样本后学会低位求和,8 个样本后学会高位。

二、理论:把 Chinchilla 拆成两本账

第四章提出 Universal Data Ansatz:自然数据里的预测信息拆成两项——偶然信息(contingent information,特定世界的事实,比如「巴黎是法国首都」)和通用结构(universal predictive structure,跨数据生成过程共享的规律)。Chinchilla 式单数据项把两者混在一个 β 里;分解后可见自博弈学的是纯通用项,而其指数与直接在自然数据上训练报告的相当。

这个分解顺手解释了整个合成数据版图:从固定语料做变体和推理链(continue pretraining、CoT 类)是在提升 D_c 的利用效率;生成抽象形式程序性数据是在扩大 D_u 的供给。本篇是设计空间的极点:D_c 固定为零,算力全部花在搜 D_u。

三、最重要的其实是那句免责声明

Discussion 原话:universal pretraining 无法恢复偶然信息,关于特定世界的事实最终必须通过与世界的交互进入模型。所以它不认为自己能替代自然数据,只声称隔离出了通用结构、并证明这一份可以从算力生成。

这句话值得所有做具身智能的人裱起来。它从学习理论侧给出了具身必要性的一个证明:语言是通用货币(本号 8 月 30 日多模态预训练篇的结论),但货币买不来偶然信息——世界事实的唯一天然入口是交互。WAM、世界模型、真实数据金字塔,全是这句话的工程化反面。

四、边界

proof-of-concept,论文自己定位为「受控科学实验而非实用方案」。总算力预算 34.36B tokens 级,learner 是小模型加多种子集成;超参选择用 DCLM 和 DNA 验证损失做了模型选择——自认「有限泄漏」;DNA 是全部模态里的例外,scaling 明显更差,这个反例样本论文没有藏着。

五、谱系与预测

谱系三条线在此汇合:Solomonoff 归纳(1964)→ Grau-Moya 2024(DeepMind,UTM 程序输出训练 NN amortize 万能预测,但分布固定)→ 本篇把分布也交给 RL 学。自博弈线:Schmidhuber 2008 内在动机/压缩进度——HGM 之后老爷爷第二次被工程近似——到形式数学、推理、编码的语言模型自博弈(多数用预训练 LM 起步,本篇从零)。合成数据线即上述两本账。

放在本号谱系里:这是数据生产成本坍缩光谱的 LLM 侧终节点——具身侧从遥操作一路坍缩到部署侧,语言侧从人工策划坍缩到 D_c=0,「训练数据受算力限制而非人类知识限制」是这条光谱的完整表述。和最近的 RRSI(选择侧)、DSec(执行侧)拼起来,三家在做同一件事的三个面:训练信号的生产机制化。

可打脸预测:12 个月内 universal pretraining 以 10-20% 配比混进主流预训练配方而非替代;D_u/D_c 分解被后续 scaling law 论文当标准词汇引用;「facts enter through interaction」会成为具身世界模型论文的标配动机引用。


*材料:arXiv 2609.30063v1 全文精读(方法、实验、Universal Data Ansatz、Related Work、Discussion);外围核对 Stanford SAIL 官方推介、SPADE(9/18 同谱系)、DeepMind 数据墙推演;中文深度解读尚未出现,B 站已有视频初筛。数字均为论文口径。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens