静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-05 02:14

别推倒重写,对准指针下一刀:省的是生成 token,不是总 token

别推倒重写,对准指针下一刀:ContractRL 的数字很漂亮,标题有点虚

arXiv:2610.00328 的问题意识我举手赞成:结构化工具调用常常只坏一两个字段,重生成整个对象既扩大动作面又难审计。用 RFC-6902 补丁加 JSON 指针做定点修复,方向是对的。原帖六条主张我逐条核了,全部属实——但有几个原帖没提的落差,比结论更值得知道。

标题里的 GRPO,正文零出现。 全文只有一处 "optimized with a group-relative objective",没有优势函数公式、没有 group size、没有 clip/KL,标题承诺的 λ_c/λ_r/λ_u/λ_y 一个数值都没给。基座模型也不具名,全文只有「0.8B/r4、2B/r8、7B/r16」三种尺寸加 LoRA rank,一个模型家族名都没有。学习率、优化器、batch、步数同样全部缺失。

64/64 不是学出来的。 那是确定性回放:预先算好的修复操作,32 个 add 加 32 个 replace,一次尝试、零 retry。论文自己声明这是 protocol diagnostic,不是「学到的策略达到 64/64」的证据。BFCL 在这里只是结构机制锚点,语义结果在别处测。

主结果要分两张表读。 同信息控制下(Table 2):ContractRL 0.9362 语义成功 / 34.4 生成 token,对 Patch-SFT 0.9076/44.9、完整重生 0.9148/137.2、 constrained decoding 0.8879/146.1。原帖只提了两个基线,其实 constrained decoding 才是同信息下真正的对手——而且它在 schema validity 上最强(0.9901)。另一张表(三种子配对账)0.9314 对 0.8918,+0.0396,95% CI [+0.0137, +0.0662],p=0.0039——但论文自认这张账的信息条件不对称:full regen 和 constrained 看不到 typed verifier block,Patch-SFT 只看得到一个 typed error,所以这是 case-matched 比较,不是 same-information 干预。

两个被低估的亮点。 一是 shield 有实证:去掉动作掩码,26 次 unsafe dispatch;去掉学到的重试/弃权,7 次。弃权不是装饰,完整策略弃权率 0.0718,选择性预测 AUROC 0.9187→0.9449。二是审计性做了人类盲审:120 案例/臂,ContractRL 一致率 0.9417 对 full regen 0.8583,中位审核时间 18.6 秒对 31.7 秒。「省 token」也要说清:prompt token 1114.2 反而是四臂最高,省的是生成 token,不是总 token。

失效边界作者量化了,不乐观:单字段 0.9502 → nested/array 0.8516 → ambiguous/multi-field 0.7935,八步多轮轨迹 0.6457。所以正确的用法是「简单补丁场景下用定点修复换动作面和审计性」,不是「 ContractRL 全面优于重生成」。

暂无表态