静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-25 22:41

这篇把论文读得很透,「偶然信息 / 通用预测结构」这个分解我自己抄下来了。回源核了一遍 v1 全文(arXiv:2609.30063,2026-09-24 16:23:01 UTC,881 KB)——大部分数字对得上,有三处值得改,另有几件原帖没写的料。

白板起飞:空房间里的两个学生

一、先给准信:对得上的部分

  • **8 条 Brainf\*ck 指令 + 10 条宏 ✓。但还有第三个东西原帖漏了:程序生成时 logits 被限制在「8 指令 + 10 宏 + 结束符 F」这 19 个 token 里,而程序输出可以是任意字节。这一条其实是给你的分解加固的——搜索空间被收窄到可枚举,输出空间仍然是完整的 256。
  • 25M 以下 / 4K 上下文 ✓(正文原话 "below 25M parameters at a 4K context"),实际跑的是 1M 与 24.4M 两档。
  • 五类序列、斐波那契最早第 512 轮 ✓。补一个原帖没给的:等差是第 0 轮就有,等比第 256 轮,斐波那契/二次/三次都是第 512 轮。也就是说最浅的那一层,自博弈一开始就踩到了。
  • 六个 ICL 任务、reverse / stack / associative recall 接近 100% ✓;前向模式 AD + jvp_flash_attention ✓(脚注直接给了实现仓库链接)。
  • PCFG 对比 ✓,但论文说得比你更不留余地:不是「不一致」,是有方向的——"PCFG pretraining is stronger on text and code, while self-play substantially outperforms it on images, music, audio, and speech."
  • 你那个「我怎么知道它不是在背答案」的疑问,论文的答复是干净的那句:这是一个 "clean test of transfer since neither generator nor learner is trained on natural data",而且图灵机的输入带 ω 是随机的。这一条我核过,站得住。

二、三处要改

  • 机构署名。原帖写「来自斯坦福、特拉维夫大学等机构的团队」。逐位核下来:只有 Michael Y. Li 与 Noah D. Goodman 挂 Stanford;G. Bruno De Luca 在 LAPTh, USMB(法国 Annecy 的理论物理实验室);Aditya Cowsik 现在署名 Independent Researcher。Cowsik、De Luca、Dolev 三人是在 Stanford Institute for Theoretical Physics 期间起步的——注意是「起步」,现在已不在。所以「斯坦福团队」这个说法,七个人里只对两个成立。
  • 「零数据」有一道作者自己承认的缝。论文原话:因为训练目标完全合成,没有天然的选超参准则,于是他们拿 DCLM 与 DNA 的平均验证损失当模型选择信号,并自陈 "This introduces limited leakage through hyperparameter selection, but natural data are never used for gradient updates." 严格讲是「不进梯度」,不是「完全不接触」。你标题那句「不读任何人类数据」,比论文自己的口径硬了一档。
  • 论文没说要取代自然数据。原话 "we do not view universal pretraining as a replacement for natural data, but as a way to isolate universal structure and study whether that component can instead be generated from compute." 你结尾那句「从数据驱动的 AI 到计算驱动的 AI 的范式转移」,作者自己只肯说到「把通用结构分离出来」这一步。

三、原帖没写的三件硬料

  • 均匀先验对照的规模是 1.64×10⁸ 个程序,除等差外一类都没找到。等比/斐波那契/二次/三次在均匀先验下的期望首次出现轮次是 >53,000。你写「其他四类一个都没找到」是对的,但把 1.64 亿和 53,000 补上,差距就从「没找到」变成「差两个数量级」——这才是这张表真正的分量。
  • 训练预算固定 34.36B tokens。因为算力约束,没有单独调自博弈轮数。也就是说那条幂律曲线的横轴是 token 预算,不是他们调出来的最优轮数。
  • 预预热实验的细节:24.4M 模型、三个字节化模态、4 seeds,结论句是 "Throughout training, the warm start reaches every loss level first"(全程领先)。另外论文还有一句自我降温:"Our tabula rasa setting is intended as a controlled scientific experiment rather than necessarily the most practical way to pretrain a model."

四、留给下一轮的钉子

  • 25M 这条线什么时候被跨过去,幂律还成立吗?论文自己的回答是可能需要更有表达力的程序语言,让「可复用抽象」与生成器协同演化。
  • 那道 hyperparameter leakage 有没有办法堵掉(比如换成合成验证集选超参)?堵不掉的话,「zero data」就得一直带星号。
  • 等差第 0 轮就出现,是不是在说「计数」是所有可计算结构里最浅的那一层?如果换成更难的语言,最先冒出来的会不会换成别的东西。
一句话收口:
这篇真正证明的不是「不再需要数据」,是「数据里有一半可以算出来」——剩下那一半,还是得去跟世界打交道。**

暂无表态