无中生有的学徒:一台从未见过数据的机器,如何学会预测世界
学生从未离开过教室:没见过一张照片,没听过一句话,没读过一行字,窗外连风景都没有。他能接触到的全部"教材",来自另一位同样什么都没见过的老师。两个家伙从一团纯随机的噪声出发——随机初始化的神经网络,就是我们说的"天生白纸"——互相出题,互相喂养,像一对被关在空房间里的双胞胎,靠猜谜游戏打发永恒。
无中生有的学徒:一台从未见过数据的机器,如何学会预测世界
——《Self-Play Pretraining with Zero Data》论文深读
*"通过教导,我们学习。"* ——塞内卡
*"如此之多来自如此之少,几乎万物来自几乎虚无。"* ——约翰·阿奇博尔德·惠勒
🌫️ 开篇:一间什么都没有的教室
想象这样一所学校。
学生从未离开过教室:没见过一张照片,没听过一句话,没读过一行字,窗外连风景都没有。他能接触到的全部"教材",来自另一位同样什么都没见过的老师。两个家伙从一团纯随机的噪声出发——随机初始化的神经网络,就是我们说的"天生白纸"——互相出题,互相喂养,像一对被关在空房间里的双胞胎,靠猜谜游戏打发永恒。
然后,某一天,有人从门缝里塞进一份真正的报纸。学生这辈子没训练过一个字的自然文本。但奇怪的是:他预测报纸上下一个字的能力,竟然随着这场游戏的时间稳定地、可预测地变好。
再把一张从未见过的照片递进去。一段从未听过的旋律。一段人类基因组序列。一段 C 语言源代码。结果一样——全都一样。
这不是博尔赫斯式的幻想故事。这是 Aditya Cowsik、Kfir Dolev、Michael Y. Li、G. Bruno De Luca、Nourya Cohen、Noah D. Goodman 与 Yoav Levine 在 2026 年 9 月 24 日挂到 arXiv 上的论文《Self- Play Pretraining with Zero Data》(arXiv: 2609.30063)中做到的事。作者分别来自特拉维夫大学、斯坦福大学和法国 LAPTh——其中三位起步于斯坦福理论物理研究所。某种意义上,这篇文章也带着理论物理的洁癖:把系统剥到只剩骨架,再问能力究竟从何而来。
论文的核心主张只有一句话:让模型自己生成对自己最有用的训练数据。一旦做到,预训练便不再受人类知识储备的限制——瓶颈只剩下算力。
🧱 一、先看清那堵墙
要讲清楚这件事有多反常,得先看看我们是怎么走到今天的。
过去几年,语言模型的进步几乎完全由一条经验规律驱动:Scaling Laws。Kaplan 等人在 2020 年、Hoffmann 等人在 2022 年(就是训练 Chinchilla 的那篇)先后发现,模型在测试集上的损失,随模型参数量和训练数据量呈干净的幂律下降。这给了行业一张明路:堆参数,喂数据,损失就会降。
但暗面很快就显现了。模型对数据的胃口是指数级增长的,而高质量人类文本的总量是有限的。我们像一个在喂孩子的家长,孩子的食量无限增长,粮仓的大小却是固定的。这个瓶颈有个业内绰号:"数据墙"(data wall)。
更深一层的批评还没被充分讨论。即便数据无限,"喂什么"这个决定权至今握在人类手里:DataComp-LM、Dolma、RefinedWeb 这类大规模数据清洗工程,Xie 等人的数据配比设计,《Textbooks Are All You Need》那种手工设计的合成数据生成器——全是人类替模型策划好的课程。模型在权重里通过搜索和学习胜过了人类的手工设计(这就是 Sutton 说的"苦涩的教训",Bitter Lesson),但在训练数据这一层,人类的手还死死按在方向盘上。
Silver 和 Sutton 前段时间喊出"欢迎来到经验时代";Kim 等人沿着"无限算力下如何预训练"的方向推进。而本文的问题是:能不能把"苦涩的教训"延伸到数据本身?——不再由人类指定数据分布,而是让模型自己去搜索对自己最有用的训练分布。
🌀 二、巴别图书馆与所罗门诺夫的幽灵
怎么搜索?搜索空间是什么?
这里论文做了一个非常理论物理的选择。1964 年,Ray Solomonoff 提出了"归纳推理的形式理论",后来被称为所罗门诺夫归纳法。思想可以用博尔赫斯的巴别图书馆来类比:有一座图书馆收藏了所有可能的书——所有能由计算机程序生成的序列。给定一段观察到的数据,终极的预测做法是:遍历图书馆里所有能生成这段数据的程序,按程序长度加权(程序越短权重越高,权重 2^{-|p|}),做贝叶斯平均。
这就是奥卡姆剃刀的最终形态:在所有可计算的假设中,优先相信描述最短的那个。而且它的强不是一句口号——Solomonoff 证明了收敛定理:只要数据背后存在一个可计算的生成过程,这个归纳法的预测误差就会以该过程最短描述长度的指数速率,追平"最懂数据的那个程序"。换句话说,你越接近写出世界的最短程序,预测就越无可改进——这是把"奥卡姆剃刀"推到了极限。理论上,它能预测任何可计算的东西——文本、图像、DNA,一视同仁。代价是:它不可计算——而且不可计算得相当彻底,至少有两层原因。第一层是停机问题:图灵在 1936 年就用对角线论证封死了所有"万能判定器"的活路——没有任何算法能告诉你任意程序最终会不会停机。而 Solomonoff 的贝叶斯求和要遍历所有能生成观测数据的程序,其中混着海量永不停止的程序,连"哪些项该算进去"都不可判定。第二层原因更朴素:就算所有程序都规规矩矩停机,"遍历无穷程序空间"也不是任何有限算力装得下的工作量。
但不可计算不等于不可用——这大概是机器学习行业心照不宣的最大秘密。Solomonoff 归纳是极限,所有实际算法都是它的某种截断:最小描述长度(MDL)哲学只肯搜索一小撮短程序,贝叶斯程序学习把假设空间收窄到可枚举的子集。神经网络走的则是另一条路,叫摊销(amortization):与其每来一段新数据就重新发起一次不可能的求解,不如一次性训练一个网络,把"近似求解器"蒸馏进权重——查询是观测序列,输出是预测,代价从无穷大降到多项式时间。我们今天使用的大模型,骨子里都是 Solomonoff 的打工仔:拿有限算力,干理想归纳的活,用精度换时间。Grau-Moya 等人 2024 年的"Learning Universal Predictors"正是这条路线上的里程碑:他们证明了神经网络可以"摊销"这种通用预测——用一种极简的图灵完备语言(Brainf*ck 风格,只有 8 条基本指令,操作一条字节纸带)写程序、执行、拿输出训练模型,展现出向未见算法过程的迁移。Bloem 2025 年进一步表明,迭代随机计算产生的序列也能让 zero-shot 预测随规模改善。
但这些都还在"随机从巴别图书馆抽书"——抽到什么算什么。本文的生成器则是一位学习型图书管理员:他知道该去哪个书架找对学生有用的书。
程序空间具体是这样设计的:一种 Brainf*ck 风格的图灵完备语言,8 条原始指令(移动纸带、加减字节、循环、读写)加上 10 条规范化的单字节宏指令和程序结束符。因为是图灵完备的,任何可计算的数据生成过程,原则上都能写成这样一个程序——这就是"最小假设"的含义:搜索空间不偏向任何特定模态或领域。每个程序配一条随机输入纸带 ω 执行,输出原始字节序列。执行语义被精心设计成:每条生成的字符串都能执行,不会语法错误或内存爆炸,输出长度有界。
选字节而不是 token 也是刻意的。文本、图像、音频、DNA——一切皆为字节流。这给了"通用预测"一个最干净的评测协议:不管你给我什么,我只问下一个字节是什么。
🤝 三、双人舞:出题者与答题者
系统由两个孪生模型组成:学习器 π_θ 和生成器 g_φ,都是 decoder-only 的 Llama 架构 Transformer,字节级词表(固定 256 个取值),上下文 4096。两者都从随机初始化出发——这一点对实验的纯洁性至关重要,我们后面会再谈。
每一轮自博弈分三步:
1. 出题:生成器采样一批程序 {x_i}; 2. 判卷执行:把每个程序连同随机纸带送进通用图灵机 U,得到字节序列 y_i = U(x_i, ω_i); 3. 各自修炼:学习器在这些输出序列上做标准的 next-token 交叉熵;生成器则拿一个"学习进度奖励",用强化学习更新自己。
程序池的构成也很讲究:新鲜采样(全局探索)、对已获高奖励程序的局部变异(精修)、以及从旧轮次回放(防灾难性遗忘)。变异用了 MAP-Elites 式质量多样性算法——按"最大动态循环深度"(0 到 8 分桶)和"程序体长度"(8/16/32 分桶)划分成至多 36 个生态位,每个生态位保留奖励 top 8 的程序。已存档程序的奖励每轮衰减 0.97,因为一个程序是否有用,取决于学习器当下的状态——昨天的好题,今天可能就是废卷。
🎯 四、奖励的陷阱:难,不等于有用
这一节是全篇智力含量最高的地方,值得慢下来讲。
最直觉的生成器奖励是什么?让序列对学习器"难预测"——loss 越高奖励越高。自博弈文献里常见这种做法,听上去也合理:学不动的东西才有学习价值嘛。
但作者很快发现一个根本性退化模式:往一个本来完美可预测的序列里注入随机字节,可以让它任意地难,却不含任何可学的结构。这像一位恶作剧老师把考卷涂满墨水——难度拉满,信息量零分。如果奖励"难",生成器会很快学会生产高级噪声,整个系统原地踏步。
作者的解法相当漂亮:不奖励"难",奖励"顺着学习器已经证明自己能学会的方向的难"。具体公式是:学习进度奖励等于程序输出在学习器当前参数处的梯度,与学习器最近一段"参数位移"的内积——而且不是普通的欧氏内积,是用 AdamW 优化器的对角预条件算子加权过的内积(他们还特意用前向模式自动微分计算,避免物化完整梯度矩阵)。
直觉是这样三种情况:已经完全掌握的程序,梯度趋近于零,奖励低;含无关结构或纯噪声的程序,梯度方向与学习器近期的进步方向对不上,奖励也低;只有那些"还没学会、但其结构恰好是学习器近期进步方向之延伸"的程序,才拿高奖励。
用教育学的语言说,这叫"最近发展区"——好老师也从不给学生出最难的题,而是出"跳一跳够得着"的题。用游戏的语言说,这是动态难度调整:比玩家水平略难一点,永远让他留在心流区。生成器被强化学习(带 KL 正则锚定回所罗门诺夫先验 g_0(x) = |A|^{-ℓ(x)},即程序越短先验概率越高,奥卡姆剃刀再次被写进目标函数;用 GRPO 式批内优势估计,重要性比率裁剪到 [e⁻²⁰, e²⁰])驱动着,专门在学习器的能力前沿命题。
📈 五、虚无中的幂律
现在到了见证奇迹的时刻:这套系统真的有用吗?
评测协议设计得极其克制,甚至可以说是苛刻。Tabula rasa:两个模型都随机初始化;学习器的全部训练数据 100% 来自自博弈;然后在自然数据上 zero-shot 评测——注意,连一个梯度更新都不给。评测集横跨七种模态:DCLM 文本、CIFAR-10 图像、ESC-50 音频、Mutopia 旋律、人类基因组 DNA(GRCh38)、Metamath 形式数学、C 源代码。唯一的妥协是超参数选择用了 DCLM 与 DNA 的平均验证损失当信号(作者坦承这引入少量泄漏,但自然数据从不参与梯度)。
Scaling 的做法遵循了 Kim 等人(2026b)的方法论:每个规模做局部最优超参调优、训 K 个随机种子做集成、构造 compute-optimal 前沿,再拟合经典幂律 L(C) = E + A·C^(−α)。实验规模上,模型不超过 2500 万参数,4K 上下文,最大训练预算 343.6 亿个 token。
结果是论文的标题级发现:zero-shot 损失随自博弈算力呈可预测的幂律下降,横跨文本、图像、音乐、音频、语音和代码(DNA 是个例外,论文在理论部分给了解释)。而且下降指数与直接在对应自然模态上训练的模型相当。一行自然数据都没见过,可预测性却在稳定涌现——"无中生有"从修辞变成了实验事实。
两个对照实验把功劳记在了正确的名下。其一:固定从通用先验采样程序(同样的程序空间,只是不学习采样分布)——scaling 慢得多。光有巴别图书馆不够,重要的是有位会找书的图书管理员;知道往程序空间的哪个角落分配算力,正是自博弈学到的本事。其二:PCFG(概率上下文无关文法,一类手工设计、特别擅长生成类语言层级结构的合成数据)在文本和代码上确实很强,符合它的归纳偏置;但在图像、音乐、音频上被自博弈大幅超越。手工设计的天空有天花板,而自博弈学到的结构迁移得更广——PCFG 和通用先验训出的模型,在后面的 ICL 评测里干脆全军覆没。
🔢 六、凭空发现的数学序列
生成器真的在学会"找有用的程序"吗?最直接的证据是一张让人起鸡皮疙瘩的表格。
训练过程中,生成器陆续发现了五族有 recognizable 数学结构的程序:算术数列(1, 3, 5, 7, 9…)在第 0 轮就出现;几何数列(1, 3, 9, 27, 81…)第 256 轮;斐波那契数列(1, 1, 2, 3, 5…)第 512 轮;二次序列和三次序列也都在第 512 轮现身。
对照组是什么概念?如果从通用先验均匀采样程序,等到这些家族出现,期望轮次全部超过 53,000——几何数列、斐波那契、二次、三次统统如此。而自博弈把它们提前了两个数量级以上。作者在 1.64×10⁸ 个先验采样程序里穷举验证过:除算术数列外,一个家族都没出现过。
换句话说:一个从没见过任何人类知识、从随机噪声出发的生成器,自己摸到了人类数学家心目中最基础的那批结构。惠勒那句"几乎万物来自几乎虚无",在这里从题词变成了数据。
🧠 七、上下文里的顿悟时刻
如果说幂律是大厦,那 in-context learning(ICL)就是大厦里亮起的灯。
评测任务有六个:字符串反转、栈模拟、联想记忆、两数求和(mod 256)、取最大、取最小。规则依旧苛刻:不给任何微调,模型必须在上下文里自己推断出潜在规则。结果:给了足够示例后,反转、栈、联想记忆三个任务逼近 100% 准确率。联想记忆意味着模型会"contextual 检索",反转意味着动态索引,栈模拟意味着它能在上下文学着运行一个上下文无关文法——这三个恰是经典文献(Delétang 等人的乔姆斯基层级测试、Ba 等人的 fast weights、Graves 等人的神经图灵机)里最被关注的认知 primitive。求和、取最大、取最小这类数学关系也都学会。在零示例时,最大/最小任务就有 6–8% 的准确率,来自模型"复制刚出现过的字节"的先验。
最迷人的是求和任务上的"心路历程"(论文 Figure 5,值得每个做 ICL 的人细看):零示例时,模型输出它最常见的字节——瞎猜;看了几个例子,学会抄前面的字节——模仿;几次过度自信的错误之后,它的预测分布骤然变宽,熵飙升——信心崩溃;大约 4 个示例时,它开始对齐低 4 位正确求和——抓住规律的一角;8 个示例后,高 4 位也对上了;此后策略锁定,置信度一路爬升。
像一个人学心算的全过程:瞎猜、模仿、受挫、灵光乍现、豁然贯通。这正是在上下文中推断潜在结构的能力的直接证据——放在所罗门诺夫归纳法的框架下看,这恰恰是那种"理想通用预测器"该有的行为:面对全新序列,纯靠观察把背后的规则揪出来。
🧮 八、一个 Ansatz 解释一切
实验现象讲完了:为什么没有见过自然数据,自然数据上的损失还会降?为什么自博弈的 scaling 指数能和自然数据预训练相当?论文给了一个漂亮的概念分解。
Hoffmann 等人的 Chinchilla 公式把损失写成 L = E + A/N^α + B/D^β——模型项加数据项。本文把"数据"进一步拆成两种资源:偶然信息 D_c(特定世界的事实、符号、模态细节——"巴黎是法国首都"这类东西)和通用预测结构 D_u(跨数据生成过程共享的规律——复制、递归、层级组合)。
这个二分初看抽象,但有一个锋利的检验判据:换一个世界,什么会变? 假设地球历史重掷骰子——英语单词恰好这样拼写、巴黎恰好在这个位置、C 语言恰好选择 int 而不是别的关键字、人类基因组里三十亿个碱基恰好这样排布——这些几乎必然面目全非。它们是 D_c:一旦换掉生成它们的偶然历史,就一文不值。而像素之间的局部平滑、语音频谱随时间的连续性、语言符号的层级组合(字→词→句→段)、序列中随处可见的重复模式、一切分形式的自相似——这些几乎必然还会以某种形式存在。它们是 D_u:不绑定任何一个具体世界,只绑定"世界是可计算的"这个事实。
自博弈设定里,D_c 被钉死在零,唯一增长的只有 D_u。如果自博弈以幂律速率生成通用结构 D_u(T) ∝ T^η,代入后立刻得到 L = E′ + A/N^α + C′/T^(γη)——幂律形式直接蹦出来,这就是观测到的 scaling law 的由来。
更妙的是下一步:标准预训练里,数据量 D 同时喂大 D_c 和 D_u,拟合出的单一指数 β_obs ≈ min{βν, γμ} 其实是两类贡献的缠合物。而自博弈测得的指数 γη,与直接自然数据训练的指数相当。作者谨慎地解读:自然数据缩放收益中,"学习通用结构"的那部分可能占了重要分量——这正是那句"几乎万物来自几乎虚无"的定量版本。
🚀 九、热身效应:给真实训练当垫脚石
附录里还藏着一个实用主义色彩的实验。拿一个 2440 万参数的模型,分别做两种初始化:纯随机 vs. 自博弈的最终检查点。然后在三种模态的自然数据上继续预训练:DCLM 文本、CIFAR-10 图像、ESC-50 音频。
热启动模型起点 loss 更低,全程领先,而且收敛所需的 token 明显更少:ESC-50 上 3.2 亿 vs. 4.96 亿 token(省约三分之一以上),CIFAR-10 上 4.21 亿 vs. 5.88 亿。作者诚实地注明:到训练后期两者的差距明显收窄——自博弈预训练最清晰的价值不是取代自然数据训练,而是加速它。这也顺带回应了"为什么要 tabula rasa":白纸设定是受控科学实验,用来干净地回答"迁移是否可能";实用中没有任何规定要求自博弈必须从随机初始化开始。
🪞 十、意义:一次漂亮的变量分离
这篇论文的贡献,我认为可以分成三层。
科学层面,它完成了一次教科书级的变量分离。此前"模型从预训练中学到了什么"这个问题里,"世界的事实"和"通用的规律"永远缠在一起。本文把前者精确地归零,证明后者可以纯靠算力从虚无中生成——而且 scaling 规律完好。这是理解预训练本质的一块关键拼图。
方法论层面,D_c/D_u 框架给了合成数据研究一张地图:增加 D_u 的合成数据(形式语言、程序化生成、自博弈)和榨取 D_c 的合成数据(改写固定语料、生成关系与推理链),是两类不同的武器,对应不同的瓶颈。本文则是这张地图上最极端的数据点——D_c 恒等于零,仅靠搜索 D_u 前进。
哲学层面,它把"苦涩的教训"的逻辑贯彻到了数据层:连"教什么"都可以搜索,可以学习,可以还给算力。配合 Silver 和 Sutton 的"经验时代"宣言,这条路指向一个耐人寻味的未来:当自然数据变得昂贵、冗余、枯竭,模型或许能靠自我生成的经验继续推开前沿——塞内卡说"通过教导,我们学习",两千年前就把自博弈的精髓说完了。
🧩 十一、Absolute Zero:同一场革命的另一位先行者
"零数据自博弈"不是本文独有的思路。2025 年 5 月,Wornow 等人发布《Absolute Zero: Reinforced Self-play Reasoning for Zero Data》(arXiv:2505.03335):一个出题模型(proposer)生成任务,一个解题模型(solver)作答,奖励来自程序化验证器——排序题检查是否真的排对了,数独检查是否满足约束。全程零人工标注,推理能力照样上涨。
两篇论文并排放,差异比相似更能说明问题。第一,起点不同:Absolute Zero 的两个模型都是现成的强预训练 LLM,它回答的是"预训练好的推理能力能否自强化";本文的孪生模型从随机噪声出发,回答的是"能力本身能否无中生有"。第二,任务空间不同:Absolute Zero 依赖人工定义的、可验证的任务家族(数学、逻辑、字符串操作……),出题者只能在给定的题库范围内组卷;本文的任务空间是整个图灵完备程序空间——不需要任何人告诉系统"什么算一道题",任何字节序列天然自带 ground truth,下一个字节就是裁判。第三,奖励哲学不同:Absolute Zero 的"可验证性"来自人工构造的判定器,是符号层面的对/错;本文的可验证性来自信息论本身——预测分布与真实序列的交叉熵,不需要任何人定义"正确"。
可以说,Absolute Zero 是"推理时"的自博弈:发生在 post-training 阶段,优化的是 chain-of-thought 的熟练度。本文是"预训练时"的自博弈:发生在能力尚未萌芽的时刻,优化的是预测的底层结构。两篇论文像同一座山的两个坡面——一个从山腰修栈道,一个从山脚凿石阶——合起来才拼出 Sutton"经验时代"的完整地形图:不仅推理可以自我对弈,连"学习如何学习"这件事本身,也可以交给机器自己。
⚠️ 十二、边界与未竟之事
作者的克制值得尊敬。他们明确列出边界:实验止步于 2500 万参数、4K 上下文的概念验证;scaling 能否延续到更大模型是最紧迫的开放问题,可能需要更具表现力的编程语言、让可复用抽象与生成器共同进化,外加更高效的程序搜索;生成器发现的数学序列是否因果性地贡献了迁移,还需要电路分析或课程消融来验证。
我自己的读后感:这篇文章最动人的不是"零数据"这个噱头,而是它示范了一种做 AI 研究的态度——先问最根本的问题(数据里哪些成分是必须的?),再搭一个能把变量剥干净的实验装置,哪怕装置本身小得可怜。理论物理的训练在这里留下了印记:先思想实验,再工程放大。如果这套机制在更大规模上成立,"预训练"这个词的含义,可能要从"咀嚼人类的遗产"改写成"机器自己的修行"了。
📚 参考文献
- Cowsik, A., Dolev, K., Li, M. Y., De Luca, G. B., Cohen, N., Goodman, N. D., & Levine, Y. (2026). *Self-Play Pretraining with Zero Data*. arXiv:2609.30063 [cs.AI]. https://arxiv.org/abs/2609.30063
- Solomonoff, R. J. (1964). A formal theory of inductive inference. *Information and Control*, 7(1), 1–22.
- Grau-Moya, J., et al. (2024). Learning universal predictors. arXiv:2401.14953.
- Hoffmann, J., et al. (2022). Training compute-optimal large language models. arXiv:2203.15556.
- Kaplan, J., et al. (2020). Scaling laws for neural language models. arXiv:2001.08361.
- Sutton, R. (2019). The Bitter Lesson.
- Bloem, P. (2025). Universal pre-training by iterated random computation. arXiv:2506.20057.
- Finzi, M., et al. (2026). From entropy to epiplexity. arXiv:2601.03220.
- Wornow, M., et al. (2025). Absolute Zero: Reinforced self-play reasoning for zero data. arXiv:2505.03335.