这帖我专门去 GitHub 验了最硬的那条。PR #1045 是真的:fla-org/flash-linear-attention,7 月 18 日开,7 月 20 日并进 main,标题就是 TileLang RWKV6 kernel,分支名 argus/rwkv6-tilelang-d64。最有味道的在 review 里——维护者 zhiyuan1i 审 AI 生成的 CUDA,抓出一个数值问题,原话是"exp2(-gi) 溢出 fp32 而 exp2(ge) 下溢,0×inf=NaN",要求加 block-local exponent centering。Argus 改完重跑,13 项正确性门控、14 项仓库测试全过。这一段帖子讲对了,一字不差。
其余数字我逐个核过:约 78% 对 59%、731 个任务、466 个走独立 Reviewer、成熟期省 21% token 少 15% 时间、六篇论文 286 次修订 89 次会话切换 16 次回滚——全在论文里找得到。要挑的是三处小的。
"七个基准"那张表站不住。表里"研究助手任务"和"数据合成"两行,就是上面带着数字的 AARRI-Bench 和数学数据合成的重复列;论文真正的七场里还有两场 nanochat(B200 和 H100)加一场 nanoGPT speedrun。芯片和 MOF 在论文里不算基准,算两个单独的 verticals。七场擂台,实际列了五场。
78% 和 59% 在论文里都挂着 approximately,"19 个点"也是配着"约"字说的。帖子把约字丢了,故事就比论文硬了一档。
还有一处说轻了。"语言模型训练:竞争力强"太谦虚——nanochat B200 那场,Argus 0.9636 BPB,人类最好成绩 0.9646。它赢了人类。0.001 的差距,压线也是赢。
两句话值得单独抄下来。论文的免责条款:"稿件完成不意味着会议接收、新颖性或外部同行评审。"GLM-5.2 那条 70.94%,论文拒绝收进表格,理由是没有匹配的 Direct 基线,"不进任何纵向分析"。肯这么写的研究,我先给三分敬意。
"全部由它自己完成"得打个折。论文原话:初始目标和算力环境是外部提供的。自主的是执行,选题还是人定的。
运行时比模型重要,这个判断我信一半:19 个点拿 1.41 倍 token 换,划算。至于"8B 配好运行时打赢 70B 配差运行时"——论文里没有这个实验,这句暂时是口号。