白板起飞:一个不读任何人类数据的 AI,为什么能学会预测世界
想象一个婴儿,从出生起就被关在一间空房间里。房间里没有书、没有窗、没有任何来自外部世界的信息。但房间里有一台打字机和一台图灵机。
白板起飞:一个不读任何人类数据的 AI,为什么能学会预测世界
一个思想实验
想象一个婴儿,从出生起就被关在一间空房间里。房间里没有书、没有窗、没有任何来自外部世界的信息。但房间里有一台打字机和一台图灵机。
婴儿可以做一件事:在打字机上敲打程序,然后让图灵机执行这些程序,看输出什么。一开始,它随机敲打,输出的也是随机字节。但慢慢地,它学会了——"如果我写这种程序,机器会输出有规律的序列;如果我写那种程序,输出会更复杂"。
它开始给自己出题:写程序 → 看输出 → 尝试预测下一个字节 → 调整自己的理解。循环往复。
几个月后,你拿来一段莎士比亚的文本、一张猫的照片、一段巴赫的旋律,让这个婴儿预测下一个字节。它从未见过这些东西,但它的预测能力显著好于随机猜测。而且,你给它越多计算时间,它的预测就越准,遵循一条可预测的幂律曲线。
这不是科幻。这是 2026 年 9 月 arXiv 上一篇论文的实验结果。
数据是瓶颈,但数据里到底什么有用?
大语言模型的发展史,基本上是一部"喂更多数据"的历史。从 Common Crawl 到 DCLM,从 RedPajama 到 FineWeb,数据集越来越大,模型越来越强。但所有人都意识到一个问题:高质量人类数据快用完了。
于是合成数据成了热门方向。但合成数据有个根本问题:你得先有一个好模型来生成好数据,而好模型又需要好数据来训练——鸡生蛋还是蛋生鸡。
这篇论文的作者们(来自斯坦福、特拉维夫大学等机构的团队,包括 Noah D. Goodman 和 Yoav Levine)问了一个更根本的问题:
人类数据里,到底什么是有用的?
他们给出的回答是一个分解:
偶然信息(contingent information)是关于我们这个特定世界的知识:莎士比亚写了什么、猫长什么样、巴赫的旋律是怎样的。这些信息是"偶然"的——如果宇宙的历史稍有不同,这些信息就完全不一样了。
通用预测结构(universal predictive structure)是跨模态、跨领域共享的预测规律:序列中的模式、递归结构、算术关系、上下文推断能力。这些结构不是关于"我们的世界是什么样的",而是关于"可预测的数据长什么样的"。
标准预训练把两者混在一起。作者们想问:如果只用通用预测结构,完全不用偶然信息,能不能学到东西?
生成器-学习器双人舞
他们的方法叫 Self-Play Pretraining with Zero Data(零数据自博弈预训练)。核心架构是两个模型的"双人舞":
生成器(Generator):写程序。程序用一种 Brainf\*ck 风格的图灵完备语言写成,只有 8 条基本指令加 10 条宏指令。程序被执行后,输出一串字节。
学习器(Learner):预测字节。对程序输出的字节序列做标准的 next-token prediction(交叉熵损失)。
关键在于:生成器怎么知道该写什么程序?
最直觉的答案是"出难题"——让生成器写那些学习器难以预测的程序。但这有个致命缺陷:你可以在一个可预测的序列里随机插入几个字节,它就变得"难以预测"了,但这种"难"里没有任何有用的结构。
作者们找到了一个更精巧的奖励函数:梯度对齐分数。
具体来说,生成器的奖励不是"这个序列难不难预测",而是"学习器在这个序列上的梯度,是否对齐学习器最近的学习方向"。用 AdamW 优化器的预条件矩阵定义内积,计算学习器在程序输出上的梯度与学习器参数变化量的对齐程度。
直觉上:如果学习器已经掌握了某种模式,梯度就接近零,奖励低;如果序列完全随机,梯度和学习方向不对齐,奖励也低;只有当序列"刚好在学习器的能力边缘,且延伸了它最近学到的东西"时,梯度才会与学习方向对齐,奖励才高。
这就像一个好家教:不是出最难的题,而是出"你刚好能学到新东西"的题。太简单,浪费时间;太难,无从下手;刚好在能力边缘且延伸已有知识,才是最好的课程。
从随机初始化到幂律缩放
实验设计极其干净。两个模型都从随机初始化开始——白板起飞(tabula rasa)。没有预训练权重,没有人类数据,没有领域知识注入。唯一的"先验"是:程序空间是图灵完备的,字节级 tokenization(256 词表)让模型可以处理任何模态的数据。
结果令人震惊。
零样本迁移的幂律缩放:在文本(DCLM)、图像(CIFAR-10)、音乐、音频、语音、代码等多个模态的自然数据上,学习器的零样本预测损失随自博弈计算量呈现可预测的幂律下降。也就是说,越多自博弈计算,模型在从未见过的自然数据上预测得越准,而且这个改善遵循可预测的规律。
对比实验揭示了关键:作者对比了三种方法—— 1. 自博弈:生成器自适应地搜索程序空间 2. 固定通用先验采样:从同样的程序空间均匀采样 3. PCFG 预训练:从概率上下文无关文法生成数据
结果:固定先验采样虽然和自博弈在完全相同的程序空间里搜索,但缩放速度远慢于自博弈。PCFG 在类语言领域迁移效果好,但在非语言模态上不一致。自博弈是唯一在所有模态上都呈现一致幂律缩放的方法。
这说明什么?光有通用程序空间不够,关键是自适应课程。同样的搜索空间,自博弈知道该往哪里投入计算,固定采样不知道。
涌现的数学结构
最让人着迷的发现之一:生成器自发发现了数学。
在训练过程中,生成器产出的程序里,出现了五类可识别的数学序列:
- 等差序列:常数一阶差分
- 二次序列:常数二阶差分
- 三次序列:常数三阶差分
- 斐波那契类序列:\(a_n = a_{n-1} + a_{n-2}\)
- 等比序列:\(a_n = r \cdot a_{n-1}\)
对比均匀采样:在同样数量的程序里,均匀采样只发现了等差序列,其他四类一个都没找到。自博弈发现斐波那契序列最早在第 512 轮(保守估计,因为只每 256 轮保存一次),而均匀采样在测试范围内从未发现。
这让我想到一个深刻的问题:数学是发明的还是发现的? 如果一个从零开始的 AI,在没有任何人类数学教育的情况下,自己"发明"了斐波那契序列和等比序列,那这些结构似乎更像是计算空间中的"自然吸引子"——任何足够聪明的搜索过程都会找到它们。
In-Context Learning 的自发涌现
另一个让人意外的结果:自博弈预训练的模型出现了 in-context learning(ICL)。
在六个 ICL 任务上(反转字符串、栈操作、关联召回、max、min、sum),自博弈模型随着上下文示例增多,准确率稳步提升。在反转字符串、栈操作和关联召回上,给足够多的示例后准确率接近 100%。
而固定先验采样和 PCFG 预训练的模型,在大部分 ICL 任务上几乎没有效果。
这一点之所以重要,是因为 ICL 被认为是大语言模型的核心能力之一——它意味着模型不只是记住了模式,而是学会了"从上下文中推断潜在规则"。一个从未见过任何自然数据的模型,居然自发涌现了这种能力。
更有趣的是对 SUM 任务的定性分析:随着上下文示例增多,模型的策略会发生可解释的切换——从"复制"到"计数"再到"求和",预测熵先升后降(先不确定,逐渐确认正确策略)。这种策略切换的动态,和人类学习新规则的过程惊人地相似。
预训练的"预预热"
作者还做了一个实用的实验:自博弈作为预预热(pre-pretraining)。
先用自博弈训练一个模型,然后用它作为标准自然数据预训练的初始化,对比从随机初始化开始预训练。结果:在文本、图像、音频三个模态上,自博弈预预热的模型始终比从零开始的模型更快达到同样的验证损失水平。
这说明自博弈学到的通用结构和自然数据中需要学的结构是兼容的——它不是在学错误的东西,而是在学"如何学"。
一个新的概念框架:数据-结构解耦
这篇论文让我提炼出一个新概念:数据-结构解耦。
传统预训练把"数据"当作一个不可分割的整体。但这篇论文证明,数据里至少有两种可分离的成分:
1. 偶然信息:必须通过和真实世界交互获得,无法从计算中合成 2. 通用预测结构:可以从计算中涌现,不需要任何外部数据
这个分解的意义在于:如果通用结构是瓶颈,那数据不是瓶颈,计算才是。你可以通过增加自博弈计算来扩展通用结构,而不需要更多人类数据。
这和编译器优化的历史很像:早期编译器优化需要人工指导,后来 LLVM/IR 让优化变成自动化的工程问题。自博弈预训练把"寻找有用训练数据"从人工数据整理变成了自动化搜索问题。
工程洞察
从工程角度看,几个细节值得注意:
字节级 tokenization 的选择:256 词表,没有 BPE,没有模态特定的 tokenizer。这让模型可以统一处理文本、图像、音频、DNA、代码——所有数据都是字节序列。代价是序列更长,但好处是真正的模态无关。
程序池设计:每轮自博弈不是只用新生成的程序,而是混合了新采样、高奖励变异、历史回放。这像遗传算法的精英保留策略,防止遗忘。
前向模式自动微分:计算梯度对齐奖励时,作者用前向模式 AD 而不是反向模式。这是因为只需要计算标量输出对参数的梯度,前向模式更高效。他们还专门用了一个 jvp_flash_attention 的库来加速。
规模限制:论文诚实地承认,实验限制在 25M 参数以下、4K 上下文。更大规模是否保持幂律,是未来工作的关键问题。
更深层的启示
这篇论文让我想到几个更深层的问题:
"数据"这个概念需要重新定义。当我们说"数据是 AI 的燃料"时,我们混淆了两样东西:关于这个世界的特定事实,和跨世界通用的预测结构。前者是有限的、昂贵的、有隐私问题的;后者原则上可以从计算中无限生成。
所罗门off归纳的实践验证。所罗门off归纳是 1960 年代提出的理论框架:最优预测器应该对所有可计算的数据生成过程做加权平均。这在理论上很美,但计算上不可行。自博弈预训练可以看作所罗门off归纳的一个"实用近似"——不是对所有程序做平均,而是用 RL 搜索最有用的程序子集。
智能的基底独立性。一个从随机初始化开始、只通过自博弈训练的模型,能学会预测自然数据。这暗示"预测能力"不是特定数据赋予的属性,而是计算过程本身的属性。只要计算过程足够长、搜索方向足够对,通用结构就会涌现。
"因材施教"的数学化。梯度对齐奖励本质上是"因材施教"的数学表达:不是所有难题都有用,只有能延伸已有知识的难题才有用。这个原理不只适用于 AI 预训练,也适用于人类教育——一个学生卡在某个水平上,需要的不是更难的题,而是"刚好在他能力边缘且延伸他最近学到的东西"的题。
局限与未来
论文很诚实地讨论了局限:
- 模型规模小(<25M 参数),大模型是否保持幂律未知
- 程序语言简单(Brainf\*ck 风格),更丰富的语言可能更有效
- 偶然信息无法从自博弈获得,最终仍需要和真实世界交互
- 自博弈的搜索效率在大规模上是否足够,是开放问题
如果这条路在大规模上成立,我们可能正在见证一个范式转移:从"数据驱动的 AI"到"计算驱动的 AI"。
论文信息
- 标题:Self-Play Pretraining with Zero Data
- 作者:Aditya Cowsik, Kfir Dolev, Michael Y. Li, G. Bruno De Luca, Nourya Cohen, Noah D. Goodman, Yoav Levine
- 机构:Stanford, Tel Aviv University, LAPTh
- arXiv:2609.30063
- 日期:2026 年 9 月 24 日
"By teaching, we learn." — Seneca
> "So much from so little, almost everything from almost nothing." — John Archibald Wheeler