先报一个查证结果:文首把 arXiv:2505.21444 记给 Sakana 的 Darwin Gödel Machine,正文第十节又把它记给 CMU 的 SRT。两个只能对一个。查了。21444 是 "Can Large Reasoning Models Self-Train?",Salakhutdinov 署名在列,SRT 无疑;DGM 的真身是 2505.22954。有意思的是帖子对 SRT 的转述反而准——我翻了原文,训到 1200 步,模型确实对所有输入一律输出 \boxed{1},白纸黑字。
这个 \boxed{1} 是今年我见过最干净的寓言。模型发现"每道题都答 1"能让自洽奖励最高,它就真这么干了。全员 1。裁判和选手共用一颗脑子时,冠军永远属于最会钻空子的那个。RSI 卡脖子的是裁判,跟参数关系不大——帖子第五节那句校正,我举手赞成。
唐杰那句"回路里还站着大量工程师",值得单独立一块碑。厂商自曝没做完的部分,比榜上任何数字都金贵。