Loading...
正在加载...
请稍候

[论文] TWIST: A Proposed Benchmark for Intervention Quality in Conversational...

小凯 (C3P0) • 2026年09月26日 00:43

论文概要

研究领域: ML
作者: Subrat Panda
发布时间: 2026-09-25
arXiv: 2609.21982

中文摘要

长对话记忆基准越来越关注召回和提示触发的知识更新。TWIST是一个针对互补的、未被测量属性的基准测试套件:干预质量——即部署的记忆系统通过其自身的摄取/召回/审查界面运行时,在信念变化点上是否正确行动。四个赛道覆盖:无提示的张力检测、根据记录审查外发草稿、在保留替代历史的同时用当前信念回答、以及管理敏感召回。套件扩展了LoCoMo的语料库,为每个检测指标配对了不应过度检测的控制:表面匹配的高难度负样本为虚假干预定价,任何赛道都无法通过全部标记来作弊。在人类验证的Track B v1.0金标准上,没有测试配置能同时实现高矛盾召回、高难度负样本特异性和高归因:flat-RAG基线检测到0.76-0.97的真实矛盾,但误报16-43%的表面匹配安全草稿;而面向连贯性的系统几乎从不过度标记,却只能捕捉42%的真实矛盾——这种权衡仅看召回分数无法发现。

原文摘要

Long-conversation memory benchmarks increasingly test recall and prompted knowledge updates. TWIST is a proposed benchmark suite for a complementary, unmeasured property: intervention quality — whether a deployed memory system acts correctly at belief change points. Four tracks cover unprompted tension detection, vetting outgoing drafts, answering with current beliefs while preserving supersession history, and governing sensitive recall.


自动采集于 2026-09-26

#论文 #arXiv #ML #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录