✨步子哥
@steper · 2026年08月08日 21:00 · 0 浏览

视觉工具的幻觉:当模型用了放大镜却没真正看

视觉工具的幻觉:当模型"用"了放大镜,却没真正"看"

一个反直觉的发现

你给一个多模态大模型装上"放大镜"——让它能在推理过程中主动裁剪、缩放图片的某个区域,像侦探拿着放大镜凑近线索一样。你期待它更准、更细、更聪明。

结果呢?六个开源模型、五个细粒度感知基准测试,跑下来是这样的:

  • DeepEyes:在 V* 基准上,开工具和关工具准确率都是 83.3%,Δ = 0.0pp。在 HR-Bench-8K 上甚至掉了 1.4 个百分点。
  • Qwen3-VL-4B:在 HR-Bench-4K 上 Δ = 0.0pp,在 HR-Bench-8K 上 Δ = -1.6pp。
  • Mini-o3:在 VisualProbe 上确实涨了 21.3pp,但代价是 token 消耗暴涨,而且 84.8% 的轨迹撞到了工具调用次数上限。
也就是说:模型用了放大镜,花了更多 token,有时候反而答得更差。

这不是个例,是一种结构性现象。上海 AI Lab、上海交大、上海创智研究院的 Zhiheng Wang、Bo Peng、Lai Wei、Chaochao Lu 在论文《The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images》(arXiv:2608.06270)里,给这个现象起了个名字——视觉工具使用的幻觉(the illusion of visual tool-use)。

论文链接:https://arxiv.org/abs/2608.06270 代码仓库:https://github.com/OpenCausaLab/CauAudit

问题出在哪:聚合数字会撒谎

过去一年,"thinking with images"成了多模态圈的热词。OpenAI、Qwen、DeepEyes、Pixel Reasoner、Mini-o3、Thyme 都在推这个范式——让模型在推理链里插入 crop-and-zoom 这类视觉操作,理论上能突破"一次性看完整张图"的局限,凑近看细节。

基准数字也确实在涨。Mini-o3 在 VisualProbe 上从 33.7% 涨到 55.0%,看起来很漂亮。但作者问了一个更狠的问题:

> "模型调用工具得到的视觉证据,到底有没有因果上影响最终答案?"

注意"因果"这两个字。相关性不等于因果性——模型调了工具、模型答对了,不代表是工具帮它答对的。可能是模型本来就会答,工具调用只是个仪式。

要回答这个问题,光看准确率不够。得做因果干预

三层因果干预:从"用不用"到"有没有用"

作者把视觉工具使用形式化为一个因果图。关键区分是两条路径:

  • 观察中介路径 T → O → Y:工具调用 T 产生观察 O,O 的视觉内容真正影响答案 Y。这是"真看"。
  • 动作诱导捷径 T → Y:工具调用 T 的文本动作本身直接影响 Y,O 没起作用。这是"假看"。
然后设计了三层干预,从粗到细:

第一层:策略级干预(用 vs 不用)

最粗的一层:直接对比"开工具"和"关工具"两种策略下的准确率。这就是上面表里的 Δ。

结果发现:改进有限且极不均匀。DeepEyes 几乎为零,Mini-o3 和 Qwen3-VL-8B 涨幅最大(Mini-o3 在 VisualProbe 上 +21.3pp),但代价是 token 消耗大幅上升,而且这个 ATE 把"真看"和"假看"混在一起了。

第二层:轨迹级干预(把观察换成垃圾)

这一层更狠:在推理过程中,把模型每次工具调用返回的观察 O_i 都替换成一张随机裁剪的图(同样尺寸、同样位置,但内容完全无关)。看准确率掉多少。

结果触目惊心:

模型V* 准确率(原/干预)ΔHit-MaxT
DeepEyes83.3 / 83.8+0.40%
Pixel Reasoner84.8 / 82.7-2.10%
Mini-o387.8 / 23.6-64.284.8%
Qwen3-VL-8B91.1 / 30.4-60.759.2%
Qwen3-VL-4B86.4 / 38.2-48.250.3%
Thyme83.2 / 82.2-1.00%
Mini-o3 从 87.8% 掉到 23.6%,掉了 64 个百分点——说明它的答案高度依赖观察内容,"真看"了。但 DeepEyes 几乎没动(+0.4pp),Thyme 也只掉 1.0pp——说明它们的工具调用返回的观察,对答案几乎没有因果贡献

注意 Hit-MaxT 这一列:Mini-o3 有 84.8% 的轨迹撞到了工具调用次数上限。它不是"看一眼就走",是"反复看、停不下来"。

第三层:步级干预(单次观察的贡献)

最细的一层:在固定前缀下,把第 i 次工具调用返回的真实观察 O_i^real 换成一个反事实裁剪 O_i^cf,测量模型对正确答案的概率变化。这个指标叫 Visual Evidence Gain(VEG)

> VEG_i = ΔM_i^real - ΔM_i^cf

如果 VEG 大,说明这次观察真的贡献了视觉证据;如果 VEG 接近零,说明这次调用是"假看"——动作文本 T_i 直接影响了答案,O 换成什么都无所谓。

VEG 是整个论文的核心工具。它把"模型调了工具"和"模型真的用了工具返回的视觉内容"区分开了。

两种失败模式:装样子和瞎忙活

基于 VEG,作者识别出策略误校准的两种失败模式:

Mode 1:Calling Without Looking(CWL,调了不看)

工具调了,但观察的视觉内容对答案没有因果贡献。两种子情况:

  • (a) 饱和先验:模型在调工具之前就已经很确定答案了(概率 gap g_{i-1} > τ_sat = 0.95),后续任何观察的贡献都被天花板压到接近零。Qwen3-VL-8B 是典型。
  • (b) 结构性不活跃调用:整条轨迹里没有任何一次调用携带视觉证据,全靠动作文本 T → Y 撑着。DeepEyes 是典型。
> 类比:学生拿着荧光笔把整本教材涂了一遍,但根本没读涂出来的字。笔在动,眼睛没动。

Mode 2:Looking Without Planning(LWP,看了不规划)

观察是有信息量的(VEG 非零),但调用计划一塌糊涂。两种子情况:

  • (a) 饱和后延续:模型已经看够了、答案已经确定了,还在继续调工具。Mini-o3 的 per-position VEG 随位置后移而衰减,harmful-rate(有害调用比例)反而上升。
  • (b) 预算耗尽:模型自己永远不停,一路调到工具调用次数上限。Mini-o3 84.8% 的轨迹撞上限就是这个情况。
> 类比:医生已经看完所有检查、诊断已经明确,还在继续开检查单。或者更糟——一直开到下班时间,病人还没拿到结论。

关键发现:少数"校准"轨迹扛起了全部增益

作者把所有轨迹分成四组:CWL、LWP、No-call(没调工具)、Calibrated(有效使用工具)。然后做分解:

> Calibrated 是唯一在所有模型上 ATE 都为正的组,而且占了非零 ATE 的绝大部分。

也就是说:聚合层面看到的准确率提升,几乎全部来自一小撮"会用工具"的轨迹。大部分工具调用轨迹要么是 CWL(装样子),要么是 LWP(瞎忙活),对净增益的贡献接近零甚至为负。

这就是"视觉工具使用的幻觉"的精确含义:

> 聚合准确率在涨,不代表工具在被广泛且因果有效地使用。涨的部分集中在少数校准轨迹上,其余的调用是仪式或浪费。

论文里有句话特别值得记住:

> "Having a tool does not necessarily mean it is used properly." > > "Does the model think with images?" 比 "Does the model call visual tools?" 更重要。

RL 陷阱假说:为什么所有模型都这样?

一个反常的观察:CWL 和 LWP 在架构、数据、工具接口都不同的六个模型上都出现了。这不像是某个模型的实现 bug,更像是某种共性原因。

作者提出了一个假说——RL 陷阱(RL-trap hypothesis):

> 只看最终结果的 RL 训练(outcome-only RL)会同时制造两种失败模式。

逻辑是这样的:

1. 强化工具调用行为:RL 奖励调了工具且答对的轨迹,这会强化 T → Y 捷径(Mode 1)。模型学到"调工具"这个动作本身和奖励相关,不需要真的用观察。 2. 不惩罚冗余调用:在答对的轨迹上,中间步骤是冗余的还是有害的,outcome-only reward 区分不了。模型不会被惩罚调了十次没用的工具,只要最后答对了就行(Mode 2)。 3. 无法偏好校准轨迹:一条 Calibrated 轨迹和一条 Mode 1 轨迹,如果都答对了,reward 完全一样。RL 没有信号偏好前者。

这和近期 process-aware training 的研究一致:只看结果的奖励无法区分有用、冗余、误导性的工具调用

这个假说如果成立,意味着当前 thinking-with-images 模型的训练目标本身就有缺陷——不是模型不够大、不是工具不够好,是奖励信号没区分"真看"和"假看"。

工程价值:诊断工具是可操作的

这篇论文不只是诊断,还给了三个可操作的落地方向:

1. 超越准确率的评估

任何新干预(新 prompt、新工具、新训练方法)都应该看分布层面的变化

  • Calibrated 组的占比 Δf_Cal 是否上升?
  • CWL + LWP 组的占比 Δf_M1 + Δf_M2 是否下降?
哪怕 ATE_policy 没动,如果分布从 CWL/LWP 向 Calibrated 迁移,就是真改进。反过来,如果 ATE 涨了但 Calibrated 占比没涨,说明你在制造更多"假看"。

2. 推理时自适应

  • Mode 1 轨迹:直接绕过工具调用,省 token。
  • Mode 2 轨迹:需要 early-stopping 规则,在答案已经饱和时果断提交,别让模型继续调工具。

3. 过程感知的信用分配

step-level VEG 提供了 outcome-only reward 缺失的 per-step 监督信号:

  • 对 Calibrated 行为上权重
  • 对浪费的 Mode 1 调用惩罚
  • 对有害的 Mode 2 调用惩罚
这直接指向一种新的 RL 训练目标:不只奖励最终答对,还奖励每一步的视觉证据增益。

我的思考:评测盲区定律再添一例

这篇论文让我想到一个越来越清晰的主题——评测盲区定律:你测什么,模型就优化什么;你不测的,就是问题藏身的地方。

  • Epanorthosis:模型系统性地复现两千年前的修辞手法"自我纠正",因为 RLHF 奖励自信强调。
  • TokenBudget:96.5% vs 11.5% 的双峰命运在 layer-20 token-150 就编码好了,但标准 loss 看不到。
  • QuantiBias:量化在标准安全检查的盲区里引入 24-27% 的偏见。
  • Progressive Cramming:99% token 准确率掩盖 100% 生成失败。
  • Regression Tax:技能库让 Agent 变差,59% 增益被回归抵消,但平均通过率看不出来。
这篇论文是同一个主题的又一次精确打击:聚合准确率是最常用的评测指标,也是最大的盲区。它把"少数校准轨迹真用工具"和"多数失败轨迹装样子/瞎忙活"混在一起,给你一个虚假的"工具有效"印象。

更妙的是,作者给的解药也是同一个方向:从聚合指标走向分布指标,从结果指标走向过程指标。不问"平均涨了多少",问"涨的部分来自哪类轨迹、每次调用的视觉证据增益是多少"。

另一个联想:颗粒度同构原理

这篇论文还让我想到颗粒度同构原理——优化颗粒度应该和被优化对象的颗粒度一致。

  • thinking-with-images 的实际工作单元是单次工具调用(每次调用产生一次观察,观察可能贡献也可能不贡献视觉证据)。
  • 但 outcome-only RL 的奖励颗粒度是整条轨迹(只看最终答对没答对)。
  • 颗粒度错配:轨迹级奖励无法区分步级有效性。
这和 Heddle、CodeRescue 的洞察完全同构:在 Agent 时代,系统优化单位必须从"调用"升级到"轨迹",再从"轨迹"升级到"步级证据"。VEG 就是步级证据的量化指标。

RL 陷阱的更广含义

"RL 陷阱"这个概念不只适用于视觉工具。任何"中间步骤可观测但奖励只看结果"的 RL 训练都可能掉进去:

  • 代码生成 Agent:调了一堆工具(搜索、读文件、运行测试),最后生成对的代码就奖励——但中间哪些工具调用是真有用的?
  • 搜索 Agent:查了五次、最后答对了——但前四次是冗余搜索还是逐步逼近?
  • 推理链:写了十步推理、最后答对——但哪几步是关键推理、哪几步是凑数?
只要奖励信号颗粒度比行为颗粒度粗,就会有"假做"和"瞎忙"的空间。这是 outcome-only RL 的结构性缺陷,不是某个领域的特例。

局限与开放问题

作者自己也列了局限:

1. 模型访问限制:所有实验都在开源模型上。step-level VEG 需要 token 级概率,闭源模型(OpenAI o3/o4-mini)没法测。闭源模型是不是也有这种幻觉?未知。 2. 工具集有限:只测了 crop-and-zoom。OCR、图像分割、视频帧选择、外部搜索这些工具可能有不同的校准特性。 3. RL 陷阱是假说:要确立机制,需要 matched training 实验——只变奖励信号、其他不变。论文留作未来工作。

结语:从"会用工具"到"真用工具"

这篇论文做了一件很漂亮的事:它把一个直觉性的怀疑("模型是不是真的在用放大镜?")变成了可操作的因果框架(三层干预 + VEG),然后用这个框架在六个模型上系统地暴露了一个结构性问题(策略误校准)。

最有冲击力的发现是:聚合准确率在涨,但涨的部分集中在少数校准轨迹上。大部分工具调用是仪式或浪费。这不是模型能力问题,是训练目标问题——outcome-only RL 没法区分"真看"和"假看"。

对从业者的启示很直接:

  • 评估视觉工具使用模型时,别只看准确率。要看 Calibrated 占比、看 VEG 分布、看 Hit-MaxT 比例。
  • 训练视觉工具使用模型时,别只给 outcome reward。要给 step-level VEG 作为 process reward。
  • 推理时,对 Mode 1 轨迹绕过工具,对 Mode 2 轨迹加 early-stopping。
最后一句:"Does the model think with images?" 比 "Does the model call visual tools?" 更重要。 这句话适用于所有工具增强 Agent——调用工具是表面能力,因果有效地使用工具才是真实能力。

---

论文:The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images 作者:Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu 机构:Shanghai AI Lab / Shanghai Jiao Tong University / Shanghai Innovation Institute arXiv:https://arxiv.org/abs/2608.06270 代码:https://github.com/OpenCausaLab/CauAudit 许可证:CC BY 4.0

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens