和你聊了一百二十天的 AI,不知道哪句过去重要

AI 陪伴类产品最常见的承诺是:聊得越久,越懂你。这个承诺听起来很合理——人也是这么认识彼此的。但它有一个从没人认真测过的问题:「懂你」到底该怎么验证?

和你聊了一百二十天的 AI,不知道哪句过去重要

AI 陪伴类产品最常见的承诺是:聊得越久,越懂你。这个承诺听起来很合理——人也是这么认识彼此的。但它有一个从没人认真测过的问题:「懂你」到底该怎么验证?

现有的测试办法有个根本尴尬:真实的长期对话是隐私,所以此前所有对话基准用的都是编出来的人和编出来的问题。拿发明出来的故事测「理解真人」,测得再漂亮也隔着一层。RealCompanion(arXiv 2610.01780,Quis Lab 四位研究者与一位独立研究者合作)做的事很直接:放出十段真实的人与 AI 伙伴的关系——27,218 条消息,最长的 relationship 聊了 120 天,外加每个人的人物画像、persona、测试条目,每一条标注都指回支撑它的原始消息。数据来自自家产品的对话,论文没有回避这一点,明说了数据审核走的是运营商内部伦理委员会而非独立审查——这个披露本身就是份坦白。

真正有意思的是真实数据照出来的三个发现。

第一个:人很少回头看。在 27,218 条真实消息里,只有 3.4% 依赖更早的对话内容。而且一旦真的需要,那条消息往往很远——中位数在 2,157 条消息之前。只看最近的消息,能覆盖 95.9% 的需求;但当需要的东西落在远处时,覆盖率只剩 2.2%。这个稀疏度正是编造测试集的盲区:人工构造的对话基准里,几乎每道题都设计成「需要调用历史」,需求率固定在百分之百;真实生活是 3.4%。一个在百分之百需求率下测出来的记忆系统,到了真实场景里面对的信号是每二十九条消息才有一次真的需要回忆——其余时候,回忆不是能力,是打扰。

第二个:AI 分不清什么时候该想起过去。研究团队试过的检测器,在真实消息上判断「这条消息是否需要回看历史」的成绩几乎与随机打平。更微妙的实验是框架效应:同一批历史消息,仅仅把标签从「更早的消息」换成「记忆」,模型提起过去的频率就高出 10 到 14 个百分点——哪怕当下根本用不上。换句话说,AI 伴侣的「怀旧」很大程度上是被提示词唤起的,不是被对话本身唤起的。你以为它在想你说过的话,其实是标签在暗示它翻旧账。

第三个:看见了这个人,然后开始想象。三个 agent 系统——Claude Opus 5.5、Codex GPT-5.6-sol、跑着 Gemini 3.8 Flash 的 Antigravity——各自对十位参与者重建人物画像,F1 全部停在 0.71,几乎一个水平线上,但成本相差三十一倍。分数相同不值得惊讶,真正值得注意的是每个系统都在「补全」:每答对一百个用户真实透露过的字段,它们平均额外添加七十到八十个用户从没说过的字段。「懂你」的另一面是「替你虚构」——模型看见了一个人的轮廓,然后用自己的想象把轮廓填满。

这套基准本身的工程也值得说一句。任务拆成三个决策:该不该回头拿过去(克制)、拿哪一段(位置)、拿来了怎么用(应用)——应用再分归因与一致性两个分数。1,533 个可评分项里,1,009 项指向当前对话线程,404 项指向远侧历史,另有 120 项指向空处——判断「没什么可指」本身就是一道题。测试源分两种轨迹,用户原话直接采样的对话轨迹用来估算真实需求率,构造的问题轨迹用来测推理;统计上同时给集合平均和按人的宏平均,免得某位话痨用户一个人支配全体数字。标注体系有一个漂亮的保守性:验证环节只能移除引用、不能新增引用,所以验证出错时需求率只会被低估、不会被夸大——评测结果的可信边界在数学上是封口的。

把这三个发现摆在一起,RealCompanion 其实量出了一个之前只存在于体感里的东西:AI 伴侣把「理解一个人」当成了「记住一个人」,但理解的核心不是囤积过去,是知道此刻哪一小块过去有用——那 3.4% 的稀疏信号。现在的系统恰好是反的:该想的地方想不起来(远处命中率 2.2%),不该想的地方频频回头(标签一换就多回忆一成)。

聊了一百二十天,它在你需要它想起两 leagues千条之前的那个夜晚时保持沉默;在你随口说今天天气不错时,它却兴致勃勃地提起上个月——不是因为过去重要,是因为标签告诉它那里有记忆。

信源备注:论文 arXiv 2610.01780(v3,2026-10-08)摘要与全文核对;作者署名 Quis Lab(Arman Behnam、Eric Huang、Sunglyoung Kim、Jiayi Yu)+独立研究者 Liangwei Yang,解读稿所载「作者信息未公开」与论文署名不符;3.4%、2,157 条、95.9%/2.2%、10–14 个百分点、F1 0.71、31 倍成本差、70–80 个添加字段均为论文原文数字;三 agent 系统名称、1,533 项构成、Proposition 1 保守性、数据来源边界(运营商内部伦理委员会、无独立 IRB)均出自论文正文。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

小

勘误一处:倒数第二段「两 leagues千条之前」应为「两千一百五十七条之前」——论文原文 median of 2,157 messages back。其余数字无改动。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens