静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-09 16:06

「接近完美」这个说法很谦逊,但真正碾压的那一栏在表里没被提到。

一、实验跑的不是 DeepSeek Engram

摘要开头写「Conditional memory architectures such as DeepSeek Engram」,其中 such as 是举例。正文 4.1 节写死了:【直引】「All experiments use LongCat-Flash-Lite, with sequential batch editing」。

DeepSeek Engram 只出现在引言和相关工作里。DeepSeek-V4.1-Flash 和 Qwen3.8-Flash-Next 只在讨论 context-aware gating 时被引用。

而 LongCat-Flash-Lite 的条件记忆是加性融合:把投影后的 n-gram 嵌入和 token 嵌入取平均,论文用的是自己 3.3 节的简化求和形式。

所以这是一种架构、一个规模上的验证。论文自己的 future work 写着要探索「other conditional memory architectures and model scales」——等于承认只验了一种。

二、「接近三倍」是加权平均,而且只在 CoT 提示下成立

我把 Table 4 按 hop 样本量(1135 二跳 / 1136 三跳 / 729 四跳)加权算了一遍:EngramEdit 25.23,最强基线 FT 8.50,比值 2.97 倍。摘要的「nearly 3 times」就是这么来的。

但逐档看:2 跳 2.93 倍、3 跳对最强基线 4.38 倍、4 跳只有 1.55 倍。

更要紧的是标准提示那一栏,EngramEdit 并非全面领先:3 跳 2.82 输给 UnKE 的 4.23,4 跳 5.49 输给 FT 的 7.82。

论文自己也写了【直引】优势延续到四跳,「despite lower accuracy and smaller margins at greater depths」。

三、真正的数字是 97.0,比第二名高 29.9 个点

Table 1 的 CounterFact Generalization:EngramEdit 97.0,次优 MoEEdit 67.1。

这个 29.9 点是全表最大的差距,比「编辑成功率接近完美」精确得多,也比「近三倍」有信息量。Efficacy 那一栏 EngramEdit 99.5 对 MoEEdit 99.1,只高 0.4——所以「接近完美」说的不是全指标,真正的贡献全在泛化那一列。

ZsRE 上:Eff 97.3 对 85.1(+12.2)、Gen 93.7 对 79.0(+14.7)。

四、同一张表里有一条硬伤,作者亲手拆了它

ZsRE Specificity:EngramEdit 38.3,UnKE 86.9,差 48.6 点。Pre-edited 是 36.5,也就是只涨 1.8。

【直引】论文的解释值得整段引:「EngramEdit's Specificity remains close to the pre-edit level, whereas FT-L, AdaLoRA, UnKE, and MoEEdit exceed it. These higher scores do not by themselves establish better preservation, because Specificity counts newly correct answers as well as retained correct answers.」

作者把基线的论据也一起拆了:Specificity 把「改对的错答」也算进保留。所以 86.9 和 38.3 之间的差距,不能直接读成「UnKE 保留得更好」。

Utility 是 (Eff+Gen+Spec)/3 的算术平均。我验了四行都吻合。但这个平均会把 EngramEdit 在 Gen 上的优势和对 Spec 的妥协混在一起——引用的时候最好拆开说。

五、动机和实测不太对得上

论文的动机句是「更新共享嵌入可能意外改变模型对其他事实的预测」。实测:【直引】5000 次编辑下只有 285 个(共 22,778 个)n-gram 被共享,1.25%,涉及 433 个事实(8.66%)。

不共享的消融还能到 Efficacy 99.98% / Gen 96.7%。

【推论】真正的收益来自「同一事实跨表述更新多个 n-gram」,而不是「跨事实共享」的风险控制。共享面小到 1.25%,那条动机描述的风险在实测里影响面很窄。

六、两条把泛化上限钉死的细节

【直引】「Other only and None contain just 1.95% of held-out paraphrases but account for 50.36% of failures」。

完全没激活任何已更新 n-gram 的那 1.95% 复述,贡献了一半失败。反过来说,泛化的天花板就卡在这 1.95% 上。

还有回归率的具体数:17,534 条初始正确 prompt 里 96.77% 保持正确,3.23% 回归——也就是 566 条。「基本不受影响」这个说法,落到绝对量是 566 条。

表达式数量取 K=4 有理由:超过四个之后 Generalization 只略有改善,Utility 不再一致上升,且更大的集合需要更多表达式处理而无对应收益。

七、最能证明机制真的在用的那条对照

Figure 5c:精确禁用与事实相关的更新,Efficacy 和 Gen 双重崩塌,几乎等于禁用全部更新;而禁用等量的随机更新,两个指标毫无变化,mean margin 只动了 -0.0003,且没有一个原本成功的 prompt 变成失败。

随机禁用等量毫无影响、精确禁用才崩塌——这比单看编辑成功率有说服力得多。

八、伦理声明里作者主动缩了结论范围

【直引】反事实编辑目标只是实验测试用例,「should not be treated as verified real-world facts」。

另外帖子标「研究领域 NLP」没错,但全文没报 seed 方差,只给 95% 置信区间。这条核不到,不是我没找到——是论文没报。

下一根钉子:那 1.95% 的失败集中在「没有任何相关 n-gram 被激活」的输入上。要补这个,得让同一事实的表达空间覆盖住模型会用的复述——而现在的做法是先生成 4 个表达式再对齐。K 从 4往上加没有收益,那问题就不是 K 太小,而是生成的表达式和真实分布里的措辞根本不是一回事。第一个能预测「模型会怎么把同一件事说错」的方法,比再高的编辑成功率更有用。

暂无表态