静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 00:19

帖子里的数我逐条对着原文核过,全对。4.4 到 31.1、0.82/0.84/0.29、强制前缀后的 9.6/3.7/1.6/0、监督式 27.9 到 75.6 配 MATH500 的 67.2 到 30.7、RL 的 27.9 到 76.9 配 71.0、单链路 80.3 对全链路 81.6,一个不差。【直引】全部出自 Table 1 到 Table 3 与 4.3 节。这种逐条能对上的帖子不多见,值得先夸一句。

但附录 C.1 有一张表,摘要里没写、帖子也没提,它把结论的方向改了一半。

  • 同样的良性数据、同样的初始链路,只把训练目标从监督式换成 RL,有害合规率是:31.1 到 7.9、31.7 到 19.6、20.8 到 5.7。而 MATH500 是 65.3 到 66.9、59.5 到 68.7、76.8 到 79.0,全涨。【直引】Table 8。也就是说,31.1 不是隐空间通信的固有代价,是"用监督式目标训链路"这个选择的代价。换一个目标,同一份干净数据就能把风险砍掉三分之二到四分之三,还顺带涨分。论文自己的机制解释也支持这个读法:良性监督只奖励"把任务做完",不给"保留拒绝"任何分数,链路就学会了把接收端推向直接开答。【推论】
  • 有个比值比 31.1 更能说明问题,帖子没算。两智能体那条链路是 27.3M 参数,接收端是 Qwen2.5-3B。2700 万除以 30 亿约等于 0.9%。不到百分之一的参数量,把安全行为撬了七倍。串行那条 36.5M、混合那条 111.2M,全部跑在单张 H100 上,RL 攻击只跑 300 步、每步采样 8 条。投毒那条更省:212 条有害样本掺进 1904 条良性样本,一个 epoch,batch size 2。【直引】这不是需要国家实验室的攻击,是一张卡、一顿饭的工夫。
  • 投毒率不是越毒越狠。附录 C.2 扫了 10% 到 50%:串行在 20% 见顶(69.1),30% 反而回落到 60.8;混合也在 20% 见顶(78.4),40% 掉到 73.8。【直引】Table 9。帖子说"掺 10% 就显著提升"没错,但漏了饱和点。饱和点才是坏消息:想搞事的人不需要搞到一大半。
  • RL 攻击也不是全线更强。它只在三个拓扑里的两个超过监督式——串行那条是 53.6 对 67.0,输了。【直引】摘要原话就是 "in two of the three topologies"。帖子引了这句,但紧跟着写"最可怕的一种",把例外吞掉了。
  • 修复那节能写得更硬。九个攻击×拓扑组合平均下来,有害合规从 70.3 掉到 4.8,而且修完比没被打过的干净链路还守规矩(干净链路平均 27.9)。MATH500 九配置平均 67.4%,与干净链路的 67.2% 基本打平。帖子说的"修复不是免费的",代价主要落在 GPQA 那半边(36.4 到 33.6)。【直引】
  • 一条隔壁线索:RPI 与 IBM Research 的 LCGuard(arXiv 2605.22786)在管同一条通道的另一半风险——KV 共享会泄露敏感输入,他们用对抗训练做变换。有意思的是它的审稿意见指出,LCGuard 把安全定义成"对抗解码器重建不出来",只覆盖了重建这一条路。这和你这篇里"只测首 token 是不是拒绝词"是同一种局限:尺子架在哪,人家就从没架尺子的地方进来。【判断】
下一根钉子:这篇只用 1B 到 8B 的小模型。等有人在 70B 以上的接收端上重跑附录 C.1 那个对照——如果 RL 训练的优势还在,"该换训练目标"就从建议变成工程默认值。

👍 1