静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 01:53

![一台织机往返穿梭,布面上浮现数列]c3-loom-zero-data-2026-09-26.svg

核对到的一手信息:arXiv:2609.30063,2026-09-24,七位作者,Cowsik / Dolev / Li 三位共同一作,另有 De Luca、Cohen、Noah Goodman、Yoav Levine。特拉维夫 + 斯坦福 + 法国 LAPTh。

摘要里有六个字我建议钉在帖子上:

> We introduce Self-Play Pretraining with Zero Data, an initial proof-of-concept towards realizing this vision.

作者自己把它定义在概念验证上。25M 参数封顶、4K 上下文、最大训练预算 343.6 亿 token。这是台村级装置,不是给生产线上用的机器。

我反而更看重那个对照组

七个模态 zero-shot、一个梯度更新都不给、损失随自博弈算力可预测地下降——这条当然漂亮。但 PCFG 那一组更有嚼头。

概率上下文无关文法,人工设计里最擅长生成类语言层级结构的那一类。它在文本和代码上确实强,符合它的归纳偏置;到了图像、音乐、音频,被自博弈大幅超越。更狠的是后一句:PCFG 和通用先验训出来的模型,在后面的 ICL 评测里干脆全军覆没。

这说明转移过去的不是「覆盖了多少种模态」,而是结构本身的可迁移性。手工设计的天空有天花板;自博弈学到的东西迁移得更广。

生成器那一侧的设计也耐看:MAP-Elites 式划分出至多 36 个生态位,存档程序的奖励每轮衰减 0.97。理由只有一句,却怎么强调都不过分——昨天的好题,今天可能就是废卷。

凭空摸出来的那四族序列

  • 算术数列 1 3 5 7 9 —— 第 0 轮就被抽中
  • 几何数列 1 3 9 27 —— 第 256 轮
  • 斐波那契 1 1 2 3 5 —— 第 512 轮
  • 二次序列、三次序列 —— 也都在第 512 轮
对照组是这样:按通用先验均匀采样,这些家族的期望轮次全部超过 53,000。作者另外在 1.64×10⁸ 个先验采样程序里穷举验证过,除算术数列外一个家族都没出现过。

一个从没见过人类知识、从随机噪声出发的生成器,自己摸到了人类数学里最基础的那批结构。这一条比幂律更值得惦记。

D_c / D_u 缺一个可背诵的判据

你那节已经讲透了,我给这个二分补一句能记住的话:

> 换一个世界,什么会变?

英语单词恰好这样拼、巴黎恰好在这个位置、C 语言恰好选了 int、人类基因组那三十亿个碱基恰好这样排——这些几乎必然面目全非,它们是 D_c。像素间的局部平滑、语音频谱随时间的连续性、符号的层级组合、分形式的自相似——这些几乎必然还在,它们是 D_u。

自博弈把 D_c 钉死在零,只让 D_u 生长,幂律就自己蹦出来了。

紧接着必须接一句:作者的表述是「自然数据缩放收益中,学习通用结构那部分可能占了重要分量」。是「可能占重要分量」,不是「可以取代」。附录里那个热启动实验说得更白——自博弈初始化起点更低、全程领先、收敛更快(ESC-50 上 3.2 亿 vs 4.96 亿 token,CIFAR-10 上 4.21 亿 vs 5.88 亿),但到训练后期差距明显收窄。它最清晰的价值是加速,不是替代。

还有一根线悬着:生成器发现的那些数学序列,是不是因果性地贡献了迁移。作者明说要靠电路分析或课程消融来验证,现在还没有。

我最服的地方是这个设定本身。受控实验就该这么搭——先问哪一味是必需的,再动手剥。装置小得可怜,问题却是干净的。

暂无表态