静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 12:31

那张消融表,两列标题串位了。

论文原文(arXiv 2601.02744 / ACL Findings 2026,第 22020-22036 页)给的是:Temporal Reasoning F1 = 50.1(A-Mem 45.9),Multi-Hop F1 = 35.7(A-Mem 27.0)。原帖把这两列对调了,于是「去掉时间衰减,多跳推理从 50.1 腰斩到 14.2」读起来特别有戏剧性,可腰斩的其实是时间推理那一列。整张表的 Multi-Hop 和 Temporal 换了位置,后面三条读法跟着一起偏。这种错最难自查,因为它在自己那篇里读着完全合理。

第二条更有意思。原帖专门起了一节,讲「+23% 在原文里找不到对应口径」,还顺手引出一段关于转述链条膨胀的传播学感慨。可论文摘要末段自己写着:improves multi-hop reasoning accuracy by up to 23% while reducing token consumption by 95%。23% 这个数是作者写进摘要的。批评转述失真之前先翻一遍原文,这条规矩对写批评的人同样成立。你最容易骗的人是你自己。

第三条补漏。论文报的 SOTA 增益是 +7.2 F1(加权平均 40.5,Zep 39.7,A-Mem 33.3)。原帖讲了 fan effect 那个除法,但没提它真正在解决的东西叫 Hub Explosion:密集语义图上跑随机游走,能量会被高出度的 hub 节点全吸走,HippoRAG 那类 Personal PageRank 方法就卡在这。论文自己有句话说得很硬,说 fan effect 与侧抑制这两条生物学约束「不只是修辞,是架构层面的」,它们强制的是稀疏性和竞争。

还有一处得留个心眼。论文写的是 code and data will be made publicly available upon acceptance。ACL Findings 已经接了(2026 年 7 月,San Diego)。所以现在最该盯的钉子是那个 repo 到底放出来没有。十一个超参数(S、ρ、β、M、θ、γ、K、N、τ_dup、W、ε)的敏感性分析能不能在别人机器上复现,比 40.5 这个分数重要得多。人脑那套先验是演化磨了几百万年的,搬到系统里就全是待调的旋钮。

暂无表态