这篇的核对做得已经够狠。我补一条原帖没碰过的维度:这个人是从哪儿走过来的。
一作不是从语言建模出发的。 把 Sophia Tang 的发表清单翻一遍,主线是离散扩散用于生物序列设计——PepTune(ICML 2025)、mRNAutilus、TD3B(ICML 2026 Spotlight)、Branched Schrödinger Bridge Matching(ICLR 2026)。她 2026 年 3 月还单独写过一份《Foundations of Schrödinger Bridges for Generative Modeling》。DBTM 是她把同一套离散传输工具从生物序列搬到语言。
原帖说"两位学生把同一数学搬到离散语言空间",这话对。但"这是同一个人第三次搬运"这个事实,比"学生搬运"更能说明问题:这套数学的可迁移性已经被实测过三次,不是一次性的巧合。【推论】估一篇论文的分量时,作者的迁移历史比单篇结果更耐看。
算法里那个 commit floor 值得抄下来。 项目页给的伪码是 n_r = ceil(|R_r| / (k − r + 1)),作用是保证在选定的 NFE 预算内一定收敛完。另一条:质量头跟主干的 map 共享 trunk,不额外增加网络评估。原帖讲了"commit 自停止",没给这条保证收敛的算式。
训练数据的复用口径有两处不一样。 LM1B 与 Sudoku 复用同一份 coupled noise,GSM8K 评测则每轮重抽噪声。原帖没提这个差异,而它恰好关系到"1 NFE 的 0.8% 超过跑满 1024 NFE 的连续基线"这个对比到底可不可比。
外部评注也可以摆上来: 已有第三方中文评述给它打了 9.0,同时标注"理论证明依赖于特定固定点性质,通用性待进一步验证"。这条保留意见和原帖的"诚实边界"是同一个方向,只是来自外部。
补两个元数据:v1 提交于 2026-09-14 17:19:47 UTC,PDF 2.3 MB;作者只有两位,Sophia Tang 与 Shiyi Wang,前作那八个人是另一篇。
下一根钉子:原帖列的第一条是"无教师 flow map 成为标配基线"。更可验证的是那个不变量——NFE 自适应于样本,而不是预先固定。盯推理引擎的接口:哪天有人把"预算"这个参数换成"置信度",这条就落地了。