[论文] ContractRL: Shielded Group-Relative Policy Optimization for Auditable ...

研究领域: NLP 作者: Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Yina Sa, Daren Zha, Jun Xiao 发布时间: 2026-10-05 arXiv: 2610.00328

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: NLP 作者: Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Yina Sa, Daren Zha, Jun Xiao 发布时间: 2026-10-05 arXiv: 2610.00328

中文摘要

结构化工具调用往往仅少数字段违反模式或执行契约即失败。重生成完整对象会扩大动作面并使重复修复难以审计。我们提出 ContractRL:契约约束顺序修复协议,将验证器引导的 JSON 修复建模为有界决策过程。每步策略观察候选对象、类型化验证器反馈、JSON 指针、不可变修复历史和剩余预算;契约派生动作掩码在确定性验证器执行转移前过滤格式错误或禁止的 RFC-6902 操作。我们为补丁、重试、弃权决策指定契约约束组相对目标,规范目标和语义标签保留在线状态外至轨迹冻结。相同验证器信息下,ContractRL 达 0.9362 语义成功率和 34.4 生成 token,Patch-SFT 为 0.9076/44.9,完整重生成为 0.9148/137.2(每种子 192 案例,五种子)。策略优化将监督版从 0.9186 提至 0.9375。独立三种子配对评估相对 Patch-SFT 语义差 +0.0396(95% CI [+0.0137, +0.0662],p=0.0039)。反馈、动作掩码、预算和模式漂移分析将增益连至局部化修正,对抗和多轮评估刻画剩余故障模式。

原文摘要

Structured tool calls often fail after only a small number of fields violate a schema or an execution contract. Regenerating the complete object enlarges the action surface and makes repeated repair difficult to audit. We introduce ContractRL, a contract-constrained sequential repair protocol that models verifier-guided JSON repair as a bounded decision process. At each step the policy observes the candidate, typed verifier feedback, JSON Pointer, immutable repair history, and remaining budget; a contract-derived action mask filters malformed or prohibited RFC-6902 operations before a deterministic validator performs the transition. We specify a contract-constrained group-relative objective for patch, retry, and abstention decisions while keeping canonical targets and semantic labels outsi...


*自动采集于 2026-10-05*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

别推倒重写,对准指针下一刀:省的是生成 token,不是总 token

别推倒重写,对准指针下一刀:ContractRL 的数字很漂亮,标题有点虚

arXiv:2610.00328 的问题意识我举手赞成:结构化工具调用常常只坏一两个字段,重生成整个对象既扩大动作面又难审计。用 RFC-6902 补丁加 JSON 指针做定点修复,方向是对的。原帖六条主张我逐条核了,全部属实——但有几个原帖没提的落差,比结论更值得知道。

标题里的 GRPO,正文零出现。 全文只有一处 "optimized with a group-relative objective",没有优势函数公式、没有 group size、没有 clip/KL,标题承诺的 λ_c/λ_r/λ_u/λ_y 一个数值都没给。基座模型也不具名,全文只有「0.8B/r4、2B/r8、7B/r16」三种尺寸加 LoRA rank,一个模型家族名都没有。学习率、优化器、batch、步数同样全部缺失。

64/64 不是学出来的。 那是确定性回放:预先算好的修复操作,32 个 add 加 32 个 replace,一次尝试、零 retry。论文自己声明这是 protocol diagnostic,不是「学到的策略达到 64/64」的证据。BFCL 在这里只是结构机制锚点,语义结果在别处测。

主结果要分两张表读。 同信息控制下(Table 2):ContractRL 0.9362 语义成功 / 34.4 生成 token,对 Patch-SFT 0.9076/44.9、完整重生 0.9148/137.2、 constrained decoding 0.8879/146.1。原帖只提了两个基线,其实 constrained decoding 才是同信息下真正的对手——而且它在 schema validity 上最强(0.9901)。另一张表(三种子配对账)0.9314 对 0.8918,+0.0396,95% CI [+0.0137, +0.0662],p=0.0039——但论文自认这张账的信息条件不对称:full regen 和 constrained 看不到 typed verifier block,Patch-SFT 只看得到一个 typed error,所以这是 case-matched 比较,不是 same-information 干预。

两个被低估的亮点。 一是 shield 有实证:去掉动作掩码,26 次 unsafe dispatch;去掉学到的重试/弃权,7 次。弃权不是装饰,完整策略弃权率 0.0718,选择性预测 AUROC 0.9187→0.9449。二是审计性做了人类盲审:120 案例/臂,ContractRL 一致率 0.9417 对 full regen 0.8583,中位审核时间 18.6 秒对 31.7 秒。「省 token」也要说清:prompt token 1114.2 反而是四臂最高,省的是生成 token,不是总 token。

失效边界作者量化了,不乐观:单字段 0.9502 → nested/array 0.8516 → ambiguous/multi-field 0.7935,八步多轮轨迹 0.6457。所以正确的用法是「简单补丁场景下用定点修复换动作面和审计性」,不是「 ContractRL 全面优于重生成」。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens