微信群里那句"我以为他同意了",可能害得一个人白等三天——SpeakerMem-R1 处理的正是这类"谁说的"和"说的是谁"的分离
多方对话记忆的难点,帖子的概括基本到位:谁说了什么、每句涉及谁、彼此怎么看、群体共享什么、状态怎么随时间变。论文的解法是双轨记忆(逐字消息 + 派生状态)× 两个作用域(个人级 / 群体级),配 Writer-R1 用 SpeakerLevenshtein 和说话人条件化 GRPO 训练。我核了 v2 全文和榜单,有几处是转述压不出来的。
一、三个头条数字,不是一个配置跑出来的
帖里写"GroupMemBench、SocialMemBench、EverMemBench 分别为 47.9%、69.2%、61.9%"。核表后发现这三个数来自不同配置:
- 47.9% 是开启 ASK 的 GroupMemBench
- 69.2% 是关闭 ASK 的 SocialMemBench(开启时反而掉到 64.9%)
- 61.9% 是开启 ASK 的 EverMemBench(关闭时 60.5%)
二、61.9% 和 62.33% 也不能混
- 主实验 EverMemBench 61.9%:DeepSeek-V4-Flash 配置 + GPT-4o-mini judge
- 公开榜单 62.33%:另一套 answering / judging 配置,答对 1,496 / 2,400
而帖子里"在 EverMemBench 榜单取得 62.33%,为现有最佳"这句话读起来像"大幅领先"。实际是:榜上 EverOS 在 Single、Multi、Update、Skill、Role 五个类别里都还高于它,SpeakerMem-R1 只在 Temp、Const、Proact、Style 四类第一。加权总分赢了 2.25,分类上其实互有胜负。
【判断】这两个数都真,但都不支持"碾压"。2.25 个百分点在 2,400 题上是约 54 题的差距,配上 0.66% 的置信区间余量,这个领先还在统计口径的边缘。
三、这张表里最该看的一列是 Multi,不是总分
EverOS 那一栏里,Single 94.37、Multi 28.11;SpeakerMem-R1 是 Single 93.43、Multi 24.10。
两者的 Multi 都在 25% 上下,而 Single 都在 94% 上下。同一家方法,同一个"记住并回答"的系统,单跳问题几乎全对,多跳问题掉了七成。
这个落差在主实验里也看得到:LoCoMo 的分类别里,Single-hop 77.88%、Temporal 70.72%、Multi-hop 41.13%、Open-domain 40.62%。
帖里引的 70.85% 是 LoCoMo 总体(1,407 / 1,986),这个数把两类弱项平均掉了。而作者自己把 LoCoMo 定位为"两人长期对话边界测试",不替代多方对话验证——这句自我限定帖里没有。
【推论】所以这篇真正的论点是:多方记忆的瓶颈不在"存",在"跨成员、跨事件把证据串起来"。这跟论文自己的 Limitations 是一致的——它列的第一条就是"假设 roster 可靠且 source/owner 归因与时间识别能准确完成",而现实里别名、成员变化、隐含听众、并行事件这四类全都没解。
四、SpeakerLevenshtein 名字骗人
名字里带 Levenshtein,实际不用标准编辑距离。它是按 owner/source/layer 三重坐标门控的软匹配 + Hungarian 一对一对齐,总分里还有 20% 是"最差 owner 项":
ΦSL = 0.80 × 各 owner 宏平均 + 0.20 × min(各 owner)
那 20% 的设计意图很明确:防止高频说话者的表现掩盖低频说话者,防止 GROUP 层被个人层表现掩盖。这是为多方场景专门开的口子——两人对话里最常见的作弊是"把主角记得滚瓜烂熟"。
【直引】附录的 token accounting:SpeakerMem-R1+ASK 平均 9,713.36 tokens/question。论文自己说了这跟 BM25、Mem0 用的批处理和写入单位不同,不能当严格效率比。可这是唯一能跟 62.33% 放在一起看的成本数,2,400 题 × 9,713 token 的量级,落地时是要真掏钱的。
下一根钉子:LoCoMo 的 Multi-hop 41.13% 是这套系统现在最硬的天花板。等哪天这个数上到 50%+,榜上那 2.25 个百分点的领先才可能变成真领先。另一根:论文列的四种未解情形(别名、成员变化、隐含听众、并行事件),第三方先在哪个上做出可复现的失败样例,哪一类就该先进 Limitations 的必答题。