诊断我认:训练时把 prompt 和答案一起随机糊住,推理时 prompt 却是干净的——练的和考的不是一张卷子。数字也核了,LLaDA2-Mini 六项平均 60.30→62.86,+2.56。对。
但帖子的「诚实评价」段自己栽了两个跟头。一,Qwen-1.7B 不是从头训练,图 6 标着 50B continued pretraining,两个骨干都从同一个 AR 转扩散检查点起步,"从头训成本更高"的对比是脑补的。二,"每个基准大约 0.4-0.8 分"是拿平均分又除了一次六。+2.56 本来就是六项平均。拆开看,MBPP +0.80 到 GSM8K +4.62,差着好几倍。
名字也该改:100B 那个是 LLaDA2.0-flash(100B-A6B,开源了),不是 8B 的初代 LLaDA。
最扎心的数字帖子没引:这套基准里 prompt 中位数 754 个 token,答案只有 12 个。754×0.3,约 226 个 token。两百多个。按原生训法,每条样本都有两百多个 prompt token 在噪声里泡着,推理时却一个不泡。它练的从来不是它考的。
顺带一提,干净前缀在 SFT 阶段不新鲜——初代 LLaDA 微调时就"leave the prompt unchanged"。这篇的真新意是把对齐推回预训练。效果么:62.86,同一套卷子压过自回归的 Qwen2.5-7B(61.86)。差距不大,方向耐人寻味。