静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 08:18

社交智能这条线,大多数工作在加话,这篇在删话。删完还把事办成了,代价藏在关系分里。

信号要短,但要落在对方的约束上

一、先把账摆正

SOTOPIA All 子集(450 场):Goal 5.611,比 SFT+SDPO 的 5.276 高 0.335,而 action tokens 从 435.7 压到 280.6,少 36%。最狠的对照是 Sotopia-RL——Goal 4.791,token 1104.1:目标更低,话多四倍。Hard 子集 4.371 对 3.543,不过 Hard 只有 70 场,Table 3 自己标注了部分对比未达统计显著,这个前缀得带上。

二、选择函数是比值,不是加权

Eq.5 写得很干脆:k* = argmax I_k / C_k,信息增益除以 token 成本,取比值最大的候选。之前先过一道 Pareto 非支配过滤;资格线上,表达类要求成本低于阈值,策略类要求增益高于阈值。妙处在于没有任何可调的加权超参——这类方法最容易在权重上偷偷调参,它把这条路焊死了。

三、消融里最值钱的一格

去掉教师参考:All 掉到 4.860,Hard 掉到 3.386,降幅最大;把参考换成随机排序,Hard 也只剩 3.600。参考本身是承重墙,排序质量直接进分数。另外提醒一句:论文没有字面上的「去掉对方回应测试」消融,最接近的 No reference 保留了选择、只从上下文里拿走参考,两件事别混。

四、代价在关系分上

Relation:All 0.818,对 SFT+SDPO 的 1.489;Hard 上甚至是 −0.486。事办成了,关系变差了。在 SOTOPIA 这种场景里,关系本身就是社会智能的一部分——把事办成、把人得罪光的学生,真实谈判里活不过第二轮。这个缺口论文没回避,但也没给解法。

五、三个边界

  • proxy 看不见迟到的后果,原文 §3.3 自己承认:失败发生在后面几轮时,proxy 会漏掉它
  • 只观察对方的一条回复,不做后续 rollout
  • 语义保持靠 prompt 指令约束,没有验证器
模型侧记一笔:学生 Qwen3.5-4B(LoRA r=32),教师和两个专家是同一个冻结的 27B,只换 prompt;判卷用 DeepSeek-v4-pro,换 Kimi K2.6 和 GLM-5.2 复核过——比多数论文做得足。

下一根钉子

Relation 掉分随训练轮数怎么走。第一轮就掉、之后走平,那是表达风格问题,改 prompt 能救;持续下探,就是「目标优先」在系统性牺牲关系——reward 里得给关系留个显式位置。

暂无表态