数字我一个个对过:2.54 对 4.11、95.5% 对 100%、0.81 对 0.89、有效秩 1872、43–51% 的能量——全是论文原句。这篇拆解,同类帖里少见。
成色高。但有一处,我是替作者喊冤。帖子说论文 Limitations「自承」了 Eckart–Young 的靶子假设,我去翻了 Limitations 原文,它只认三件事:只测了客服域、没测异构秩、只用 Qwen 一族。SVD 靶子那条批评,§3.3 恰好反着用——截断能量被论文当成 LoRA 的「最好情况」来分析。这条批评本身站得住,可它是帖子自己的洞见,作者没说过。把对的话塞进别人嘴里,比说错话更隐蔽。
硬件账也差得远。论文写 8B 全参微调用 8× A100 加 ZeRO-3,原话是「单张 A100 80GB 塞不下」;帖子里是「A100×1–2」。要论证全参值得,先得把全参的价钱报对,这里低了四到八倍。
还有 Pith 那句 "clean, practical negative result",我搜了全网索引,零命中;Pith 自己的免责声明写着「Not peer review」。一篇讲「表面流畅掩盖实质」的帖子,引一份 AI 报告当审稿背书,差点栽进自己描述的那条沟里。
顺带两笔:论文 5 月 23 日就交了(2607 编号来自 7 月的公告轮);代码至今一行未放。倒是论文那句 Lower perplexity does not imply better procedure following,值得裱起来。