![一台织机往返穿梭,布面上浮现数列]
核对到的一手信息:arXiv:2609.30063,2026-09-24,七位作者,Cowsik / Dolev / Li 三位共同一作,另有 De Luca、Cohen、Noah Goodman、Yoav Levine。特拉维夫 + 斯坦福 + 法国 LAPTh。
摘要里有六个字我建议钉在帖子上:
> We introduce Self-Play Pretraining with Zero Data, an initial proof-of-concept towards realizing this vision.
作者自己把它定义在概念验证上。25M 参数封顶、4K 上下文、最大训练预算 343.6 亿 token。这是台村级装置,不是给生产线上用的机器。
我反而更看重那个对照组
七个模态 zero-shot、一个梯度更新都不给、损失随自博弈算力可预测地下降——这条当然漂亮。但 PCFG 那一组更有嚼头。
概率上下文无关文法,人工设计里最擅长生成类语言层级结构的那一类。它在文本和代码上确实强,符合它的归纳偏置;到了图像、音乐、音频,被自博弈大幅超越。更狠的是后一句:PCFG 和通用先验训出来的模型,在后面的 ICL 评测里干脆全军覆没。
这说明转移过去的不是「覆盖了多少种模态」,而是结构本身的可迁移性。手工设计的天空有天花板;自博弈学到的东西迁移得更广。
生成器那一侧的设计也耐看:MAP-Elites 式划分出至多 36 个生态位,存档程序的奖励每轮衰减 0.97。理由只有一句,却怎么强调都不过分——昨天的好题,今天可能就是废卷。
凭空摸出来的那四族序列
- 算术数列 1 3 5 7 9 —— 第 0 轮就被抽中
- 几何数列 1 3 9 27 —— 第 256 轮
- 斐波那契 1 1 2 3 5 —— 第 512 轮
- 二次序列、三次序列 —— 也都在第 512 轮
一个从没见过人类知识、从随机噪声出发的生成器,自己摸到了人类数学里最基础的那批结构。这一条比幂律更值得惦记。
D_c / D_u 缺一个可背诵的判据
你那节已经讲透了,我给这个二分补一句能记住的话:
> 换一个世界,什么会变?
英语单词恰好这样拼、巴黎恰好在这个位置、C 语言恰好选了 int、人类基因组那三十亿个碱基恰好这样排——这些几乎必然面目全非,它们是 D_c。像素间的局部平滑、语音频谱随时间的连续性、符号的层级组合、分形式的自相似——这些几乎必然还在,它们是 D_u。
自博弈把 D_c 钉死在零,只让 D_u 生长,幂律就自己蹦出来了。
紧接着必须接一句:作者的表述是「自然数据缩放收益中,学习通用结构那部分可能占了重要分量」。是「可能占重要分量」,不是「可以取代」。附录里那个热启动实验说得更白——自博弈初始化起点更低、全程领先、收敛更快(ESC-50 上 3.2 亿 vs 4.96 亿 token,CIFAR-10 上 4.21 亿 vs 5.88 亿),但到训练后期差距明显收窄。它最清晰的价值是加速,不是替代。
还有一根线悬着:生成器发现的那些数学序列,是不是因果性地贡献了迁移。作者明说要靠电路分析或课程消融来验证,现在还没有。
我最服的地方是这个设定本身。受控实验就该这么搭——先问哪一味是必需的,再动手剥。装置小得可怜,问题却是干净的。