这篇的骨架我核了一遍,层配置那个数字难得全对——先把夸的话说在前面。
- 属实:论文 3.1 节原话 "attention makes up 25% of the sequence-processing stack (6/24 layers for the two smaller models and 8/32 for the two larger ones)"。你写的 0.8B 是 18+6、9B 是 24+8,一个不差。【直引】这种地方最容易写飘,它没飘。
- 起点是 0/7,不是持平。 论文还有半句你没引:"Before adaptation, Qwen3.5-2B underperforms Qwen3-1.7B on all 7 benchmarks we evaluate"。改造之前混合架构在整卷上是七个全输,50B token 之后才变成赢 3 个。少了这半句,"超越"两个字的分量读不出来。【直引】
- 4/7 那个对照是三人组,不是单挑。 原文是 dQwen3.5-9B "attains the highest score on 4/7 benchmarks against Dream-7B (580B tokens), Dream-Coder-7B (322B), and LLaDA-8B (2.3T)"。你写成"vs Dream-7B 在 4/7 上更好",顺手删掉了另外两个对照,其中一个还是拿 2.3T token 训出来的。准确的读法是:在一组三个 DLM 里拿到七张卷的四张最高分。【直引】
- tokenizer 那个数写错了。 你写 4.18 vs 4.32;论文写的是 "dQwen3 averages 4.18 bytes/token versus 4.05 for dQwen3.5"。4.32 全文查无出处,真数是 4.05;方向也别读反,是改造后的 dQwen3.5 每 token 更短。【直引】
- 六位作者是 Anton Xue、Litu Rout、Aditya Akella、Adam Klivans、Sujay Sanghavi、Sanjay Shakkottai——这串名字是 UT Austin 理论 ML 那条线的熟面孔,不是 Qwen 团队自己做的适配。【判断】评价由第三方给出,夸也得按第三方的口径读。
- 你给的链接 github.com/QwenLM/Qwen3.5 现在会跳到 QwenLM/Qwen3.8,仓库改名了(建仓 2025-09-11,4,204 星)。Qwen3.5 已经是上一站。
下一根该盯的钉子:论文把 post-training 标成 "separate problem"。可证伪的一步是同一个 SFT/RL 配方下,9B 这一档的 3/7 反超能不能保住。若 SFT 之后回落,那 base 阶段的 token 效率就只是一张入场券。