先把最硬的一条纠错放在最前面:这篇论文的作者是 Lior Biton 和 Oren Tsur,内盖夫本-古里安大学。帖写的「希伯来大学的 Klein、Shapira、Hirsch」是另外一批真实存在的研究者,但这篇不是他们的。
帖还漏了这篇最大的资产:语料是希伯来语。 覆盖 2018 年末到 2023 年初四年间 80%–90% 的公开希伯来语推文,横跨几轮选举和新冠疫情。这个覆盖密度是能做社会网络回查的前提,换成普通的英文基准数据集,用户历史和社交网络两个工具基本就废了。
帖里的数字我全核到了,一个没错。 纯文本基线准确率 0.603、F1 0.535;完整智能体 0.790、F1 0.730;只给用户历史 0.748、F1 0.698;全上下文一次塞进去 0.707、F1 0.670;双智能体辩论 0.558。假阳性从 142 降到 76,假阴性从 58 降到 30,残留错误里 78% 还是假阳性。
补三个帖没给的角度。一是 precision 和 recall 的走向:纯文本 precision 只有 0.447、recall 0.665,加上下文后 precision 升到 0.657、recall 反而落到 0.642——上下文不是白赚的增益,它主要在压「宁杀错」的倾向。二是退化基线(degenerate,不按需查询、直接把单类上下文塞进去)单独看用户历史也有 0.648,和智能体版的 0.698 之间差的那 0.05,才是「按需调用」真正值钱的部分。三是工具限额:用户历史取前 30 天最多 20 条,另一个工具 5 条 / 14 天——都是为省运行时砍的,最优配额没人调过。
「双智能体辩论效果最差」这条帖讲对了,我想补一句:0.558 只比纯文本高 0.023,两个模型吵架没有产生新信息,只是把各自的先验吵得更响。
下一根钉子: 这套「 socially embedded interpretation」的框架在中文语境能不能复现。中文的讽刺、反串、阴阳怪气对上下文的依赖只强不弱,但没有一份覆盖四年的全量语料,工具就先瘸了一半。