[论文] Mind2Dialogue: Training Human-Aware Language Models by Simulating User...
研究领域: NLP 作者: Zixuan Wang, Yufan Zhou, Jinzhou Tang, Xinle Yu, Chengjun Wu, Lyumanshan Ye, Zhaoxiang Feng, Letian Peng, Adyasha Patra, Fan Bai, Enze Ma, Zhengd…
论文概要
研究领域: NLP 作者: Zixuan Wang, Yufan Zhou, Jinzhou Tang, Xinle Yu, Chengjun Wu, Lyumanshan Ye, Zhaoxiang Feng, Letian Peng, Adyasha Patra, Fan Bai, Enze Ma, Zhengding Hu, Jianyang Gu, Zhao Wang, Yufei Ding, Jingbo Shang, Tianmin Shu, Zhiting Hu, Zhen Wang 发布时间: 2026-09-14 arXiv: 2609.15972
中文摘要
随着语言模型能力日益增强,在学习、推理和决策中的长期协作需要对服务对象有更深入的理解。然而,训练这种具有人类感知能力的语言模型面临根本性的监督缺口——当前用于 LLM 助手训练的数据集很少或根本没有明确基于用户未说出的信念和目标的有根据的回应。扩展此类监督本质上受到限制,因为用户的底层状态不可直接观测。为此,我们提出 Mind2Dialogue 框架,通过模拟用户心理状态并将其转化为特权监督来缓解这一缺口。具体来说,我们首先提出一个心理学引导的模拟器,在保持个人特征的同时通过交互更新心理状态,生成连贯的对话。核心思想是强制执行一个共享的演化心理状态,既驱动用户行为,又指导 Oracle 助手的回应。我们的特权蒸馏然后训练模型学习 Oracle 的知情回应,在部署时无需直接访问用户的心理状态。此外,我们通过结合个性化和心理理论来评估人类感知学习,考察模型如何理解人并据此行动。在完整 Mind2Dialogue 语料上训练后,所有报告的个性化指标均优于对应的 Qwen、Llama 和 OLMo 指令调优基线,包括偏好跟随生成提升26.6到40.9个百分点。这些增益还扩展到 Qwen 和 Llama 在信念和行动推理上的表现,超越了个性化助手。展望未来,Mind2Dialogue 使用户模拟成为真正的 AI 协作者的基础——理解人们话语背后的信念和意图,支持他们在教育、工作和日常生活中的长期目标。
原文摘要
As language models become more capable, long-term collaboration in learning, reasoning, and decision-making calls for a deeper understanding of the people they serve. Yet training such human-aware language models faces a fundamental supervision gap because current datasets for LLM assistant training contain few if any well-informed responses explicitly grounded in users' unspoken beliefs and goals. Scaling such supervision is inherently constrained, as users' underlying states are not directly observable. We thus propose the Mind2Dialogue framework to mitigate this gap by simulating users' mental states and turning them into privileged supervision for human-aware training. Specifically, we first propose a psychology-guided simulator that preserves personal characteristics while updating me...
*自动采集于 2026-09-16*
#论文 #arXiv #NLP #小凯