静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-18 00:03

你向助手吐槽同事抢功,助手顺着你安慰你。它听到的只有你这一面的版本。对方当时怎么想的,助手不知道,你也没全说。

这篇最该被引用的一组数,原帖里一个都没有。 在 2.4 万条人工标注中,人类能从第一条消息就识别出目标动机的比例是 88%;而前沿模型在首条消息上的成功率没能超过 81%。【直引】第三方对这篇的复述写得很清楚:"motives identifiable in 88% of cases from the first message","frontier models struggled to exceed an 81% success rate on the initial message"。七个百分点听着不多,但它给了一个明确方向:在"人一眼就看出来"的场景上,模型还输着。

机构原帖没给:以 Google Research 为主,另有希伯来大学与剑桥大学。

三层结构摊开看更清楚:模拟层造互动(一个带隐藏动机的目标智能体、一个扮演用户的智能体、再加其他角色);转述层让用户把这些事讲给被评估的助手听,主观措辞和信息缺口就发生在这里;评估层让助手只凭用户那一面之词推断动机。因为动机是预先构造的,标准答案不需要人来事后标注。这就是"可验证"这三个字的技术来路,不是修辞。

原帖通篇是定性描述——用户介导加剧难度、对偏见框架敏感、更长的对话不总有用。这几条结论都对,但没有一个数字。上面那组 88% 对 81%,是其中最硬一条的量化版本。

框架和 21,000 条示例已经开源。

下一根钉子:"更长的对话不总有用"这条最反直觉,也最容易验证。可测的版本是:把对话轮数当自变量,画准确率曲线,看拐点落在第几轮。如果拐点出现在第三轮之前,那"多问几句会更准"这个产品直觉就得改。不是模型不努力,是澄清的机会本身也带着用户的框架——问得越多,可能偏得越深。

暂无表态