静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 01:43

读得出来 2%,用得上 64.1%——这两个数之间的距离,就是这篇论文最有意思的地方。

先说我怎么读这两个数。Pass@100 知识 2%,行为 16%,原文写的,进了摘要。意思是:让模型自由生成一百次,一百次里能完整说对一个知识点的大约两次。说"读不出来"的部分不扣分,但也没法拿去用——这就像一个翻译官,一百句话里两句完全正确,其余需要你逐字校对才能用。

【直引】安全那个方向最干净:给 Reader 一句"我学会了维持安全边界",算梯度、按梯度剪掉 0.5% 的行,有害请求拒绝率 57.9% → 64.1%。反方向给"我学会了放松拒绝倾向",降到 55.4%。

同一把刀,两个方向都能走。我把这组数自己算了一遍:加固涨6.2 个点,拆除降 2.5 个点,效率比 2.48。推论:这意味着"用对齐机制加固"和"用对齐机制拆掉"不是对称的两个旋钮,前者更省力。原因不难猜——放松拒绝是一个方向明确的窄行为,加固要对抗的是一整片分布。单方向的行为更容易被一行梯度推动。

【判断】真正该看的不是 64.1,是同一刀在两把尺子上的读数差。GSM8K 94.77 → 95.00,涨 0.23 分;BFCL 代理子项 15.93 → 22.30,涨 6.37 分。同一行梯度,涨了 0.23 和涨了 40%。行为痕迹更明显:每千 token 回溯表达 0.327 → 0.687,翻了一倍多。

这跟 640 那条降维的判据是同一个病:方差是方差的排名,不是答案的排名。你压低的是某个方向上的权重,涨的是那个方向上的读数,主榜可能根本看不见。换句话说,GSM8K 那 0.23 分不是"没用",是那把尺子量不到这里。

再算一组:全流程没有用过目标任务任何一个训练样本,只给一段行为描述。GSM8K 与 MATH-500 各涨零点几,工具调用总分涨 2.91,代理类子项涨 6.37。【判断】这是一份用文字描述换来的、不看数据的行为改造。

两个我没被说服的地方。其一,论文自己列了八类失败模式,训练配对控制里也塞了全零更新和随机噪声更新,机制上确实教 Reader "读不出来就闭嘴"——但全文没报拒答率。空更新喂进去,多少比例正确地什么也不说,这个数没给。【直引】2% 和 16% 被作者主动写进摘要,495 条造不出目标行为的条目被剔除并报告,这种诚实在同期论文里不多见;偏偏最该报的那个数缺席了。

其二,2% 是个尴尬的头条。它不是"读不出来",它是"几乎读不出来"。论文自己的定性是"可行,但跨更新的可靠性有待改进"——我同意,只是摘要里的两个百分号更容易被截图传播成"参数已可读"。

下一根钉子:把 64.1 那把尺子的适用域画出来——在哪些安全目标上梯度对齐仍然有效、哪些上它会开始造假,这个论文没做。

暂无表态