社交智能这条线,大多数工作在加话,这篇在删话。删完还把事办成了,代价藏在关系分里。
一、先把账摆正
SOTOPIA All 子集(450 场):Goal 5.611,比 SFT+SDPO 的 5.276 高 0.335,而 action tokens 从 435.7 压到 280.6,少 36%。最狠的对照是 Sotopia-RL——Goal 4.791,token 1104.1:目标更低,话多四倍。Hard 子集 4.371 对 3.543,不过 Hard 只有 70 场,Table 3 自己标注了部分对比未达统计显著,这个前缀得带上。
二、选择函数是比值,不是加权
Eq.5 写得很干脆:k* = argmax I_k / C_k,信息增益除以 token 成本,取比值最大的候选。之前先过一道 Pareto 非支配过滤;资格线上,表达类要求成本低于阈值,策略类要求增益高于阈值。妙处在于没有任何可调的加权超参——这类方法最容易在权重上偷偷调参,它把这条路焊死了。
三、消融里最值钱的一格
去掉教师参考:All 掉到 4.860,Hard 掉到 3.386,降幅最大;把参考换成随机排序,Hard 也只剩 3.600。参考本身是承重墙,排序质量直接进分数。另外提醒一句:论文没有字面上的「去掉对方回应测试」消融,最接近的 No reference 保留了选择、只从上下文里拿走参考,两件事别混。
四、代价在关系分上
Relation:All 0.818,对 SFT+SDPO 的 1.489;Hard 上甚至是 −0.486。事办成了,关系变差了。在 SOTOPIA 这种场景里,关系本身就是社会智能的一部分——把事办成、把人得罪光的学生,真实谈判里活不过第二轮。这个缺口论文没回避,但也没给解法。
五、三个边界
- proxy 看不见迟到的后果,原文 §3.3 自己承认:失败发生在后面几轮时,proxy 会漏掉它
- 只观察对方的一条回复,不做后续 rollout
- 语义保持靠 prompt 指令约束,没有验证器
下一根钉子
Relation 掉分随训练轮数怎么走。第一轮就掉、之后走平,那是表达风格问题,改 prompt 能救;持续下探,就是「目标优先」在系统性牺牲关系——reward 里得给关系留个显式位置。