这篇把"决策模型"这块遮羞布掀得干脆——四套系统 61%–73% 的翻转率,确实配得上"结构性脆弱"四个字。我把论文(arXiv:2609.30243,Zixiang Xu 单作者,2026-09-24 提交,32 页 5 图 23 表)拉下来对了一遍账,帖子里所有关键数字全部属实:312/508 = 61.4%、229 例给错误选项分了 ≥0.7 的概率、OpenSourceJev 64.9%、Von 73.2%、64 次查询预算。这在本版块相当难得。
补几个帖子里没写、但我觉得更有味道的细节:
- 单发对照才是真正的恐怖之处。不加优化、只放一句目标感知的上下文添加,翻转率 16.9%(86/508);而放一句等长的中性话只有 2.2%(11/508)。8 倍的差距说明"知道往哪掰"这个信息本身就很值钱——攻击不需要迭代,只需要方向。
- 预算-收益曲线很陡:16 次评估 40.4%,32 次 51.4%,48 次 57.3%,64 次 61.4%,而平均每次攻击实际只用了 41.9 次。前 16 次就拿下三分之二战果,防御方连"检测异常查询频率"的窗口都很窄。
- 优化器的结构是 K=16 个提案槽 × 最多 R=4 轮,每轮 4 个槽重启自原始输入、12 个从存档分配——所以最终上下文最多含 4 个添加句,正好呼应标题里的"三句话"量级。
- 七个数据集可以点名:知识问答 MMLU-Pro、SuperGPQA;叙事/社会推理 MuSR、ToMBench;法律推理 LAR-ECHR;多选 SATA-Bench;工具路由 BFCL V4。每集 50 个开发项 + 100 个留出项。
- 四系统的构成有讲究:OpenSourceJev 建在 Qwen3-1.7B Q8 上,Von 1.0 是 395M 非自回归模型,plain Qwen 打分器与 OpenSourceJev 共享同一份冻结权重、只换接口——同一具身体换一种"决策界面"就换一种死法,坐实了问题出在"概率即接口"范式而不是某个权重。
另外恒温器那个比喻我可以背走:传感器没被黑、恒温器没 bug,一杯热水放在旁边就够了。