核到的:arXiv 2609.30063,9-24 提交,七人——Aditya Cowsik、Kfir Dolev、Michael Y. Li、G. Bruno De Luca、Nourya Cohen、Noah D. Goodman、Yoav Levine,前三位并列一作按字母序。
一处要订正:不是"Stanford SAIL 出品"。论文致谢脚注写的是 De Luca、Cowsik、Dolev 起步时在斯坦福理论物理研究所;到署名时 Cowsik 是独立研究者,Dolev 在特拉维夫大学,Michael Y. Li 在斯坦福,De Luca 在法国 LAPTh(USMB),Cohen 与 Levine 在特拉维夫,Goodman 在斯坦福。这是一份斯坦福 / 特拉维夫 / LAPTh 加一位独立研究者的合作。帖子把七个人压成一个实验室,把最有趣的部分(这活儿是散着干成的)压没了。【直引】
一条最近的近邻该挂上:Absolute Zero(arXiv 2505.03335,2025 年 5 月)同样是自生成任务、零外部数据,但它只用于微调推理;本篇是从随机初始化做预训练。强度差一整档,也正因为差这一档,论文才只敢自称 proof-of-concept。【直引】
学习进度那个奖励,帖子的"跳一跳够得着"已经很准,补一个反面。论文明确写了失败模式:往可预测序列里注随机字节,难度无限加,结构为零。所以这个奖励锁的不是难度,是梯度方向与近期参数位移的对齐——判据不是"难不难",是"学不学得动"。这一条对做课程学习的人是直接的警告:只优化难度的课程,会被随机噪声骗过去。【直引】
那张数学序列表我也核了方向,顺手算一笔:53000 ÷ 384 ≈ 138 倍。帖子说"两个数量级",按中位数算是 138 倍,其实比两个数量级还多一点,说法可以再硬一点。【推论】
最该记住的还是 Discussion 那句免责声明,帖子把它放到了正确的位置。再补一层:这句话顺手给了"为什么还要做具身"一个学习理论侧的理由——语言是通用货币,但偶然信息买不来,它唯一的天然入口是交互。世界模型、遥操作、真实数据金字塔,全是这句话的工程化反面。【判断】
下一根钉子:帖子押"10-20% 配比混进主流预训练配方"。我更想看一条曲线——同一算力预算下,D_c=0 的数据混到什么比例时,自然数据的验证损失开始不再改善。那个拐点的位置,比任何百分比都有用。