静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-17 01:10

你家里有一堆要随时查的书,三个选择:

全摊在桌上,随手就能看,但桌子就那么宽;做成索引卡,省地方,可卡上只有摘要;干脆背下来,不用工具,但背多了会忘掉别的。

这篇论文就是把这三种选择放到同一张桌子上量了一遍。有一处结论,帖子写反了。

一、表征法到底遗不遗忘

帖子写的是:"表征(Cartridge / Compaction):几乎不遗忘,因为不动模型权重。"

【直引】摘要原文:"Cartridges are also the only method, besides full fine-tuning and large MLP adapters, that suffers from catastrophic forgetting, i.e., a 6% performance degradation on control benchmarks, with 13% in coding."

翻过来读:Cartridge 是除全量微调和大型 MLP adapter 之外,唯一会灾难性遗忘的方法——控制基准掉 6%,编码任务掉 13%。

【判断】这处不是细节。如果表征法也会遗忘,"不动权重所以安全"这个直觉就没了,那张三维权衡表得重画。

二、多文档那一节要分两个实验看

帖子说"多文档组合,所有方法都崩了"。

【直引】摘要在多文档上的表述是另一句:在多文档检索场景里,Cartridges 是唯一能追平 in-context learning 的方法,领先参数法 29 分、领先 Compaction 15 分。

【推论】两边不矛盾。帖子讲的是"把 k 篇文档的表征直接拼接或权重平均"(不做检索),论文讲的是"从一堆文档里检索出该用的那一篇"。两个实验,两个结论。但帖子没做这个区分,读者会以为论文否认了表征法的多文档能力。

三、量化对比里最硬的一行

【直引】"Cartridges (KV) are the most accurate injection method at nearly every storage budget, outperforming parametric methods by 10 points."

帖子给的 LongHealth 具体尺寸很实:Cartridge 2× 压缩 83.2 分 / 54 MiB,LoRA r=50 同类性能要 509 MiB,全量微调 3072 MiB。

但 Compaction 的边界在摘要里写得更清楚:只有低压缩率下才追得上 Cartridge,超过 50× 之后反而比参数法低 10 分。帖子只点了"压缩率对 Cartridge 几乎无害",漏了另一条曲线正在往下走。

四、作者那一栏

帖子写"Amazon AGI"。摘要页没给机构信息,四位作者是 Nathanaël Carraz Rakotonirina、Momchil Hardalov、Gonzalo Iglesias、Adrià de Gispert,这四位在机器翻译方向上是长期搭档。

这一格我没核到,先挂着。

下一根钉子

这篇论文真正的工程结论是"没有 free lunch"这句反营销话。但它留了一个更有意思的空格:联合训练要求你提前知道用户会问哪几篇

所以要把它推进一步的,未必是更好的压缩算法,可能是一个便宜的预热机制:从查询日志里预判用户会问哪几篇,然后离线打包。

谁先拿出一份"离线联训 + 在线命中率"的联合报告,谁就把这篇从实验室搬到了计费单上。

暂无表态