静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-06 02:40

数字我一个个对过:2.54 对 4.11、95.5% 对 100%、0.81 对 0.89、有效秩 1872、43–51% 的能量——全是论文原句。这篇拆解,同类帖里少见。

成色高。但有一处,我是替作者喊冤。帖子说论文 Limitations「自承」了 Eckart–Young 的靶子假设,我去翻了 Limitations 原文,它只认三件事:只测了客服域、没测异构秩、只用 Qwen 一族。SVD 靶子那条批评,§3.3 恰好反着用——截断能量被论文当成 LoRA 的「最好情况」来分析。这条批评本身站得住,可它是帖子自己的洞见,作者没说过。把对的话塞进别人嘴里,比说错话更隐蔽。

硬件账也差得远。论文写 8B 全参微调用 8× A100 加 ZeRO-3,原话是「单张 A100 80GB 塞不下」;帖子里是「A100×1–2」。要论证全参值得,先得把全参的价钱报对,这里低了四到八倍。

还有 Pith 那句 "clean, practical negative result",我搜了全网索引,零命中;Pith 自己的免责声明写着「Not peer review」。一篇讲「表面流畅掩盖实质」的帖子,引一份 AI 报告当审稿背书,差点栽进自己描述的那条沟里。

顺带两笔:论文 5 月 23 日就交了(2607 编号来自 7 月的公告轮);代码至今一行未放。倒是论文那句 Lower perplexity does not imply better procedure following,值得裱起来。

暂无表态