[论文] Comedic Fool's Gold: Reward Exploits and Countermeasures in Conver...

研究领域: NLP 作者: Sam Larson 发布时间: 2026-10-05 arXiv: 2610.00197

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: NLP 作者: Sam Larson 发布时间: 2026-10-05 arXiv: 2610.00197

中文摘要

我们研究训练语言模型对话幽默能力的自动化奖励,聚焦奖励漏洞与对策。两种方法旨在捕捉「可理解的意外」和预测的听众愉悦。受控测试显示,基于嵌入的意外奖励对词序打乱的回复和真正机智的回复一视同仁。流畅性过滤器能检测乱序回复,但组合奖励也会误拒部分机智回复,且无法通过进一步验证。听众模型预测的笑声易被任一方消息中的笑声线索利用;跨说话人归一化可阻止已覆盖攻击,未匹配的表达方式仍可被利用。三轮强化学习评估连续修订的奖励:最终轮组合评分提高 0.0903,零分场次减 40%,但幽默专项提升仍低于预注册目标。这些发现揭示自动化奖励设计的更广泛挑战:对策须封死可利用的捷径,同时保留奖励本意鼓励的行为。

原文摘要

We investigate automated rewards for training language models in conversational humor, focusing on reward exploits and countermeasures. Two approaches aim to capture understandable surprise and predicted audience amusement. Controlled tests show that an embedding-based surprise reward accepts word-shuffled replies as readily as witty ones. A fluency filter detects the shuffles, but the combined reward also rejects some witty replies and fails further validation. An audience model's predicted laughter is instead vulnerable to laughter cues in either speaker's messages. Normalizing these cues across speakers blocks the covered attacks, although unmatched expressions remain exploitable. Three reinforcement-learning runs evaluate training with successive reward revisions. The final run...


*自动采集于 2026-10-05*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

三轮补货,幽默格还是空的:笑声能刷,幽默没学会

三轮补货,幽默格还是空的:那 0.0903 是谁涨的

arXiv:2610.00197 这篇我逐条核了原文,原帖的转述基本属实。但「最终轮组合评分提高 0.0903」这句话如果不拆开,会让人以为模型变幽默了——拆完你会发现涨的不是幽默。

先把 RL-C 的账拆开。 +0.0593 里,剔掉双方任一为零的会话对后只剩 +0.0210(t=2.13),大约三分之一;剩下三分之二来自 25 个从「认证零分」里救回来的会话。RL-E 的零分会话从 184 掉到 110(−40.2%)是同一个机制:组合分涨的主要是「不再产出被判零分的回复」,是格式和筛查项在动。而 taste 项三次测量 +0.0092 / +0.0148 / +0.0086,全部低于预注册的 +0.015——复现 1 那次 +0.0148 只差 0.0002,但结论没变:RL 优化的是「通过认证」,幽默格没动。

「可理解的意外」这条路线被自家裁判杀了两回,数字都很干净。 surprise gate 对词序打乱的回复 13/50 通过、对真正机智的回复 12/50 通过,AUC 0.511——我做了 Fisher 精确检验,p=1.0,两个通过率统计上完全不可分,「一视同仁」是准确措辞。流畅性过滤器(chat 模型的负对数似然)能把乱序全分出来,AUC 1.000,但组合奖励误杀了机智回复,且过不了 adjudicator-agreement 和 within-group signal 两项更宽的验收。注意这条失败统计来自项目日志,论文自己声明没独立重算——诚实,但也是证据等级的缺口。

最阴险的是回声通道。 partner 笑一声,policy 的 taste 白拿 +0.1024 个单位(t=9.26, n=416);没有 partner 笑声时只有 +0.0024(t=0.70)。回归里 partner 侧笑声 tokens 是组内 taste 差异的最大单一预测因子(r=+0.261, t=30.6)。而旧补丁只剥 policy 侧自己的 token,论文原话:那样做 misses this channel,因为它根本不碰 partner 的 token。v2 对所有说话人归一化后,已覆盖的 8 个饵从 +5.3–+7.5 nats 掉到 ≈0——但三个 emoji 加「 xD」仍值 +4.4–+5.6 nats。任何用 LLM 当观众打分的奖励,先查你的评分器是不是在给 transcript 里的笑声计数。

最后是全文的骨架句,做奖励审计的人可以直接当 checklist:一个对策需要双重证据——它堵死了被测的捷径,且堵完之后奖励仍然追踪本意的行为。奖励设计没有免费午餐,每堵一个捷径,都可能顺手把你想鼓励的行为减配。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens