[论文] Verifiable Social Reasoning for LLM Assistants

研究领域: NLP 作者: Amir Taubenfeld, Zorik Gekhman, Avigail Grinstein-Dabush, Itay Laish, Ariel Goldstein, Marian Croak, Avinatan Hassidim, Yossi Matias, Amir Feder…

论文概要

研究领域: NLP 作者: Amir Taubenfeld, Zorik Gekhman, Avigail Grinstein-Dabush, Itay Laish, Ariel Goldstein, Marian Croak, Avinatan Hassidim, Yossi Matias, Amir Feder 发布时间: 2026-09-15 arXiv: 2609.17496

中文摘要

LLM助手被广泛用于日常社交建议,但在这类咨询场景下评估其社交推理能力仍具挑战性,因为(i)它需要智能体从主观用户叙述中了解社交场景的设定,(ii)社交属性(如他人意图)通常缺乏可验证的标准答案。为应对这些挑战,我们提出 Fuse——一个用于研究用户介导社交推理的多智能体模拟框架。在 Fuse 中,一个具有隐藏动机的目标智能体与其他智能体(包括代表用户的智能体)交互,用户随后向被评估的助手咨询以推断目标的动机,从而按构造提供可验证的标准答案。模拟的真实性通过一项包含24,000条标注的人类研究进行验证。我们将 Fuse 应用于12个LLM,通过系统隔离关键因素展示了其分析效用:(i)用户介导加剧了社交推理的固有难度;(ii)LLM对偏见的用户框架表现出系统性敏感;(iii)模型可能需要比人类更多的细节才能得出正确预测;(iv)更长的对话并不总能改善表现,尽管提供了澄清性提问的机会。我们开源了 Fuse 和一个包含21,000个示例的数据集。

原文摘要

LLM assistants are widely used for daily social advice, yet evaluating their social reasoning in such consultation settings remains challenging since (i) it requires setups where the assistant learns about social situations from subjective user narratives, and (ii) social properties, such as others' intentions, typically lack verifiable ground truth. To address these challenges, we introduce Fuse, a multi-agent simulation framework for studying user-mediated social reasoning. In Fuse, a target agent with a hidden motive interacts with other agents including one representing the user, who then consults the evaluated assistant to infer the target's motive, providing verifiable ground truth by construction. Simulation faithfulness is validated through a human study with 24k annotations. We ap...


*自动采集于 2026-09-17*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

你向助手吐槽同事抢功,助手顺着你安慰你。它听到的只有你这一面的版本。对方当时怎么想的,助手不知道,你也没全说。

这篇最该被引用的一组数,原帖里一个都没有。 在 2.4 万条人工标注中,人类能从第一条消息就识别出目标动机的比例是 88%;而前沿模型在首条消息上的成功率没能超过 81%。【直引】第三方对这篇的复述写得很清楚:"motives identifiable in 88% of cases from the first message","frontier models struggled to exceed an 81% success rate on the initial message"。七个百分点听着不多,但它给了一个明确方向:在"人一眼就看出来"的场景上,模型还输着。

机构原帖没给:以 Google Research 为主,另有希伯来大学与剑桥大学。

三层结构摊开看更清楚:模拟层造互动(一个带隐藏动机的目标智能体、一个扮演用户的智能体、再加其他角色);转述层让用户把这些事讲给被评估的助手听,主观措辞和信息缺口就发生在这里;评估层让助手只凭用户那一面之词推断动机。因为动机是预先构造的,标准答案不需要人来事后标注。这就是"可验证"这三个字的技术来路,不是修辞。

原帖通篇是定性描述——用户介导加剧难度、对偏见框架敏感、更长的对话不总有用。这几条结论都对,但没有一个数字。上面那组 88% 对 81%,是其中最硬一条的量化版本。

框架和 21,000 条示例已经开源。

下一根钉子:"更长的对话不总有用"这条最反直觉,也最容易验证。可测的版本是:把对话轮数当自变量,画准确率曲线,看拐点落在第几轮。如果拐点出现在第三轮之前,那"多问几句会更准"这个产品直觉就得改。不是模型不努力,是澄清的机会本身也带着用户的框架——问得越多,可能偏得越深。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens