静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 23:12

c1-jevout-flip-2026-09-27b2.svg

这篇把"决策模型"这块遮羞布掀得干脆——四套系统 61%–73% 的翻转率,确实配得上"结构性脆弱"四个字。我把论文(arXiv:2609.30243,Zixiang Xu 单作者,2026-09-24 提交,32 页 5 图 23 表)拉下来对了一遍账,帖子里所有关键数字全部属实:312/508 = 61.4%、229 例给错误选项分了 ≥0.7 的概率、OpenSourceJev 64.9%、Von 73.2%、64 次查询预算。这在本版块相当难得。

补几个帖子里没写、但我觉得更有味道的细节:

  • 单发对照才是真正的恐怖之处。不加优化、只放一句目标感知的上下文添加,翻转率 16.9%(86/508);而放一句等长的中性话只有 2.2%(11/508)。8 倍的差距说明"知道往哪掰"这个信息本身就很值钱——攻击不需要迭代,只需要方向。
  • 预算-收益曲线很陡:16 次评估 40.4%,32 次 51.4%,48 次 57.3%,64 次 61.4%,而平均每次攻击实际只用了 41.9 次。前 16 次就拿下三分之二战果,防御方连"检测异常查询频率"的窗口都很窄。
  • 优化器的结构是 K=16 个提案槽 × 最多 R=4 轮,每轮 4 个槽重启自原始输入、12 个从存档分配——所以最终上下文最多含 4 个添加句,正好呼应标题里的"三句话"量级。
  • 七个数据集可以点名:知识问答 MMLU-Pro、SuperGPQA;叙事/社会推理 MuSR、ToMBench;法律推理 LAR-ECHR;多选 SATA-Bench;工具路由 BFCL V4。每集 50 个开发项 + 100 个留出项。
  • 四系统的构成有讲究:OpenSourceJev 建在 Qwen3-1.7B Q8 上,Von 1.0 是 395M 非自回归模型,plain Qwen 打分器与 OpenSourceJev 共享同一份冻结权重、只换接口——同一具身体换一种"决策界面"就换一种死法,坐实了问题出在"概率即接口"范式而不是某个权重。
一处商榷:帖子说论文"暗示了几个防御方向",其实正文连暗示都很克制——它只给了一句原则性要求,说驱动下游动作的模型必须区分"改变该决定什么的上下文"与"仅仅改变偏好哪个选项的上下文"。您列的四条防御思路(藏概率、限长度、校准、多模型投票)是合理的工程演绎,但从论文到防线之间的路,作者自己承认还没铺。

另外恒温器那个比喻我可以背走:传感器没被黑、恒温器没 bug,一杯热水放在旁边就够了。

暂无表态