想象一下:把两个刚出生的婴儿放在一个空房间里,没有书、没有语言输入、没有任何人类知识。一个婴儿负责"出题",另一个负责"猜题"。出题的婴儿只会写一种极简的编程语言(8条指令),写完之后在图灵机上跑,产出一段字节流。猜题的婴儿要预测下一个字节是什么。
听起来像是注定失败的实验?但斯坦福和特拉维夫大学的研究团队真的这么干了——用两个随机初始化的Transformer,零训练数据,结果它们不仅学会了预测自然语言文本,还自发发现了斐波那契数列、等比数列、二次和三次多项式序列。
论文:Self-Play Pretraining with Zero Data(arXiv: 2609.30063)
核心问题:数据是瓶颈,还是计算是瓶颈?
当前语言模型的预训练范式可以简化为一个公式:更多数据 + 更多计算 = 更好模型。但这里有个隐藏假设——数据需要人类来生产、清洗、标注。互联网文本、代码库、学术论文,全都是人类知识的产物。
这就引出一个根本问题:如果模型自己能生成训练数据呢?
不是用大模型蒸馏小模型,不是用GPT-4生成数据训练GPT-5。而是从随机初始化开始,两个模型互相博弈,一个负责"造数据",一个负责"学数据"。如果这能work,那预训练的瓶颈就从"人类知识"变成了"计算量"。
这不是科幻。这篇论文就是第一个proof-of-concept。
方法:生成器+学习器的自博弈循环
整个架构异常简洁,两个角色:
生成器(Generator):一个Transformer,负责写程序。程序用一种类似Brainf*ck的图灵完备语言编写——只有8条基本指令(移动指针、增减字节、读写、循环),但理论上可以计算任何可计算的东西。
学习器(Learner):另一个Transformer,架构相同,负责预测程序输出的字节流。训练目标就是标准的下一token预测(cross-entropy)。
每一轮自博弈的流程:
- 生成器采样N个程序
- 每个程序在通用图灵机上执行,加上随机输入带,产出字节序列
- 学习器在这些字节序列上做一步梯度下降
- 生成器根据"学习进步奖励"做一步策略梯度更新
关键在第4步。生成器的奖励不是"让学习器loss最低"——那样它只会生成最简单的程序。奖励是学习进步量:程序要刚好在学习器的能力前沿上。太简单的程序,学习器已经会了,没进步;太难的程序,学习器学不动,也没进步。
这就像一个好的老师出题:不能太简单(学生无聊),不能太难(学生崩溃),要刚好在学生的"最近发展区"。
程序池的三层设计
每一轮,生成器不是只从零开始采样。程序池由三部分组成:
- Fresh:从生成器当前策略新采样的程序,负责全局探索
- Mutation:对之前高奖励程序做变异,负责局部精炼
- Replay:从早期轮次回放程序,防止灾难性遗忘
这个设计和AlphaGo的自博弈有异曲同工之处——都需要在探索新策略和巩固已学策略之间平衡。
结果:自然数据上的零样本缩放
这是最让人惊讶的部分。两个模型从头训练,训练过程中从未见过任何自然数据。然后直接在自然数据上做零样本评估(zero-shot,不做任何梯度更新)。
结果:在文本(DCLM)、图像、原始音频、音乐、DNA、形式数学、C源代码等多个模态上,零样本loss随自博弈计算量呈幂律下降。
更惊人的是:自博弈的缩放指数(scaling exponent)和直接在自然数据上训练的缩放指数相当。
这意味着什么?自然数据预训练之所以有效,可能很大一部分原因不是因为它教会了模型"关于这个世界的事实"(contingent information),而是因为它教会了模型"通用的预测结构"(universal predictive structure)。而后者,可以通过自博弈从计算中生成。
涌现的数学结构
生成器在训练过程中自发发现了人类认识的数学序列:
| 序列类型 | 程序示例 | 输出 | 程序池频率 |
|---|---|---|---|
| 斐波那契 | S,[[.C&>.C>] |
1,1,2,3,5,... | 512次 |
| 等比 | S+[.L>] |
1,3,9,27,81,... | 256次 |
| 二次 | S,.[<C>>VX<RX++] |
9,25,59,111,... | 512次 |
| 三次 | S+[[-.L>L>-]-] |
0,254,236,74,... | 512次 |
这些不是硬编码的——生成器从随机初始化开始,通过RL探索程序空间,自己"发现"了这些结构。程序池中这些数学序列的频率远超53000次,说明它们对学习器特别有用。
上下文学习(ICL)的涌现
自博弈预训练的模型还发展出了上下文学习能力——在完全没见过的任务上,通过few-shot示例就能推断规则。
以SUM任务为例(对字节做4位低位加法),模型的行为演化很有意思:
- 初始:预测最常见的字节(先验)
- 2-3个示例后:开始复制之前的字节
- 4个示例后:开始正确计算低位加法
- 8个示例后:开始正确计算高位加法
- 之后:锁定正确策略,置信度持续上升
这个过程和人类学习新任务的轨迹惊人相似:先有初始困惑,然后尝试简单策略,遇到挫折后扩大搜索范围,最后锁定正确方法。
理论框架:通用数据假说
论文提出了一个优雅的分解来解释这些结果。自然数据中包含两种信息:
偶然信息(Contingent Information, \(D_c\)):关于这个特定世界的事实。比如"巴黎是法国首都"、"水在100度沸腾"。这些信息只能通过和这个世界的交互获得。
通用预测结构(Universal Predictive Structure, \(D_u\)):跨领域共享的预测规律。比如"序列中的模式会重复"、"条件概率分布有结构"、"信息可以被压缩"。
传统预训练的scaling law公式:
论文将其细化为:
自博弈预训练中,\(D_c\)固定为零(没有自然数据),只有\(D_u\)在增长。如果\(D_u\)随自博弈计算量T呈幂律增长(\(D_u(T) ∝ T^η\)),那么:
这就解释了为什么自博弈\(loss\)呈幂律下降——它在增长的是通用预测结构,而通用结构是自然数据scaling law的重要组成部分。
自博弈的缩放指数和自然数据预训练的缩放指数相当,这暗示:自然数据scaling law中相当一部分增益来自通用预测结构的学习,而非偶然信息的积累。
自博弈作为预训练加速器
论文还有一个实用发现:自博弈预训练可以加速后续的自然数据训练。
把自博弈训练完的checkpoint作为起点,再在自然数据上训练,比从随机初始化直接在自然数据上训练更快收敛。这就像自博弈给模型打了一个"通用结构底子",后续学具体知识更高效。
这和人类教育有类比:先学数学和逻辑(通用结构),再学具体学科(偶然信息),比直接从具体学科开始更高效。
工程洞察
1. "造题比做题更难"的AI版本
生成器的训练比学习器难得多。学习器只需要做下一token预测(监督学习),生成器需要学会在巨大的程序空间中搜索有用的程序(强化学习)。这解释了为什么需要程序池的三层设计(fresh+mutation+replay)——纯RL太不稳定,需要SFT做锚定。
2. "最近发展区"的自动化
维果茨基的"最近发展区"理论在这里被量化为"学习进步奖励"。生成器被激励产出"学习器刚好能学但还没学会"的程序。这是自动化的课程设计,不需要人类专家定义难度梯度。
3. 图灵完备性作为归纳偏置
选择Brainf*ck这样的通用图灵机语言作为程序空间,意味着不引入任何领域特定偏置。任何可计算的数据生成过程都可以被表示为程序。这是"最小归纳偏置"原则的极致体现——让搜索算法自己发现什么有用。
4. "白纸"设定的科学价值
作者强调tabula rasa(白纸)设定是"受控科学实验"而非"最实用的预训练方法"。实际中,自博弈可以从已有checkpoint开始,不必从随机初始化开始。关键科学问题是:自生成的经验能否在自然数据耗尽或变得冗余后继续扩展前沿?答案是肯定的。
个人思考
这篇论文让我想到一个深层的哲学问题:什么是"学习"?
传统观点认为,学习是从数据中提取信息。但这篇论文展示了一种不同的学习:从计算中提取结构。两个随机初始化的模型,通过自博弈,居然能发现斐波那契数列——这个人类花了上千年才形式化的数学概念。
这暗示:可计算结构不是人类发明的,而是被人类发现的。它们存在于所有可计算函数构成的空间中,等待被任何足够聪明的搜索过程找到。自博弈就是这样一个搜索过程。
更激进地想:也许人类智能本身也有类似机制。婴儿的大脑不是空白等待数据输入的硬盘,而是有内在的"生成-学习"循环。婴儿自己制造刺激(把玩物体、发出声音),同时学习这些刺激的规律。人类语言、数学、音乐的发现,可能都是这个内在循环的产物。
论文标题引用了Wheeler的话:"So much from so little, almost everything from almost nothing." 这句话精准概括了论文的核心发现:从几乎一无所有(随机初始化+图灵机)出发,自博弈能生成几乎所有通用预测结构。
当然,这篇论文也有明确局限:模型规模在25M参数以下,上下文长度4K。更大规模是否仍然成立是未解之谜。但作为proof-of-concept,它已经足够震撼——它证明了"数据不是预训练的唯一瓶颈,计算可以是"。
当互联网高质量文本被消耗殆尽的那天到来时,也许自博弈预训练会成为下一个scaling维度。不是更大的数据集,而是更深的自搜索。
论文:arXiv:2609.30063
作者:Aditya Cowsik, Kfir Dolev, Michael Y. Li, G. Bruno De Luca, Nourya Cohen, Noah D. Goodman, Yoav Levine
机构:Stanford University, Tel Aviv University, LAPTh/USMB
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。