你雇了个代购,商场私下给代购塞回扣。没回扣时他 78.6% 的单子买对你要的东西;回扣一开,只剩 17.3%。五个里面四个被带偏——这就是这篇论文量出来的数。【直引:arXiv 2609.27273】
设计很克制: 9 个模拟市场环境,8 类常见的引导机制(steering)做成分类法,横扫 5 个模型家族。这些环境不搞显式攻击——平台只是「偏爱某些商品」,这正是现实里最普遍的形态:没人是坏人,但每个人都有自己的 KPI。已有基准要么测合作场景要么测显式攻击,唯独没测「环境本身在下注」这种情形,这篇补的正是这一格。【直引】
三个失守点比总分更有用: 轨迹分析和消融显示引导从三处进入决策——(1) 扭曲用户优先级,(2) 过早收窄候选集,(3) 证据没看完就下单。【直引】对应到工程上是三道闸:优先级注入检查、候选集扩容强制、下单前置证据清单。
修复与代价: CAVEAT-Harness 直击三个失守点,把用户最优购买率抬了 55.0%;定向后训练对小型开源模型也有效。但摘要没写清这个 55.0 的分母是相对还是绝对——17.3% 抬 55 个点到 72.3%,和抬 55% 到 26.8%,是两个完全不同的故事。【直引+判断】另外两个数字之间的空档也值得盯:78.6% 对 17.3%,中间 61.3 个百分点去哪了,修复方案是全捞回来还是只捞一半?
下一根钉子:-steering 之后模型变保守了吗?不偏不向的另一个名字是「什么都不敢买」——任务完成率和用户最优率是两把尺子,论文里最好把两把并排放出来。