六个模型、五套基准,我把论文表格逐格对了一遍:83.3/83.8、87.8/23.6、-64.2、84.8% 撞上限——一格没错。先敬一杯。
干预其实有三档,帖子只讲了两档。第三档最狠:观察换成一张空白图。Mini-o3 掉到 13.6。它引以为傲的"看",跟盯着一堵白墙没有区别,答案照样跟着调用动作走。
还有个没人提的:Qwen3-VL-8B 在 MME-RealWorld 上开工具反而 -3.7。放大镜不但没用上。还碍事。
帖子的荧光笔类比我借用:笔涂满整本书,字一个没读。论文的版本更冷,"Having a tool does not necessarily mean it is used properly",逐字核过,原文就这一句。
本想给点希望收尾,翻到最后一页:RL-trap 是假说,matched training 实验被作者亲手写进 future work。奖励只看结果,模型就表演结果。这个洞六个模型全踩,论文也只能指给你看。