模型已经知道答案,只是被分辨率骗了:BAMI 如何用零训练解锁 GUI 定位能力
场景:一个被"分辨率"骗了的模型
你给一个多模态大模型看一张 AutoCAD 的截图,问它:"'Launch next step in design run in Vivado' 这个按钮在哪里?"
模型信心满满地输出一个坐标。你一看——偏了。不是偏了一点点,是偏了整个工具栏的距离。模型选了一个看起来很像、但功能完全不同的按钮。
奇怪的事情来了:你把这张截图裁剪一下,只保留模型预测位置周围的一小块区域,再问一次。这次模型答对了。
这说明什么?说明模型本来就知道答案。它只是在全分辨率的全屏截图上,被过多的视觉信息"骗"了——高分辨率反而成了负担。
这就是 BAMI 论文里揭示的核心问题之一:精度偏差(precision bias)。在 ScreenSpot-Pro 这个专门测试复杂专业软件 GUI 定位的基准上,当前 SOTA 模型的准确率普遍低于 50%。不是因为模型能力不够,而是因为高分辨率截图让模型的定位精度系统性偏移。
BAMI(Bias-Aware Manipulation Inference)的解法很反直觉:不重新训练模型,只在推理阶段做两件事——裁剪和选择。结果是把 TianXi-Action-7B 在 ScreenSpot-Pro 上的准确率从 51.9% 拉到 57.8%,把 OS-Atlas-7B 从 18.9% 拉到 41.6%——绝对提升 22.7 个百分点。
MPD 归因:给模型的错误做"CT 扫描"
BAMI 的第一步不是解决问题,而是诊断问题。作者提出了 MPD(Masked Prediction Distribution,掩码预测分布)归因方法——给模型的决策过程做一次"CT 扫描"。
MPD 的做法很巧妙:把输入截图切成 M×N 的网格,随机遮住一部分网格(填零),让模型在"残缺画面"上做预测。重复 K 次,每次遮不同的网格。最后统计每个网格被遮住时模型预测的变化幅度。
这相当于什么?相当于给每个像素做了一次"重要性评分"——如果遮住某个网格后模型预测大幅偏移,说明这个网格对模型决策很关键;如果遮住后预测几乎不变,说明模型根本没在看这个区域。
通过 MPD,作者发现了 GUI 定位错误的两大根源:
1. 精度偏差:高分辨率是诅咒
在 ScreenSpot-Pro 里,截图通常是高分辨率的专业软件界面——AutoCAD、Photoshop、IDE。这些界面元素密集、目标按钮很小。模型在这种高分辨率输入上做坐标预测时,预测坐标会系统性偏离真实位置。
MPD 显示,模型对高分辨率区域的注意力分布过于分散——它在"看"整个画面,但无法精确锁定到一个小按钮上。这就像让一个人在 4K 显示器上找一个 8 像素的图标——分辨率越高,目标越小,越难精确定位。
2. 歧义偏差:复杂界面让模型"选错"
专业软件界面里,很多按钮长得像——同样的图标、同样的颜色、同样的形状。模型能找到"正确的那一类按钮",但会选错"具体哪一个"。
MPD 显示,模型在多个相似候选之间犹豫不决——遮住任何一个候选,预测变化都不大。这说明模型没有学会区分"看起来像但功能不同"的元素。
BAMI 的两板斧:粗到细聚焦 + 候选选择
诊断完问题,BAMI 给出了两个对应的解法。
第一板斧:Coarse-to-Fine Focus(粗到细聚焦)
针对精度偏差,BAMI 做了一件直觉上很简单的事:先粗后细,逐步聚焦。
具体流程: 1. 模型在全屏截图上做第一次预测,得到一个粗略坐标 2. 以这个坐标为中心,裁剪出一小块区域(比如周围的 1/2 大小) 3. 模型在裁剪后的小图上再做预测,得到更精确的坐标 4. 重复这个过程若干次,每次裁剪范围更小,精度更高
这相当于把"在 4K 屏幕上找 8 像素图标"的问题,分解成"先找到大致区域→再放大→再精确定位"。每一步都在更小的画面上做预测,分辨率不再是负担。
消融实验显示,裁剪比例和迭代次数都有最优区间。裁剪比例太大(比如 0.8)聚焦不够,太小(比如 0.2)会丢失上下文。迭代次数在 3-5 次之间效果最好——再多就过度收敛了。
这个设计有一个深层洞察:高分辨率不是模型的能力上限,而是模型的输入格式陷阱。模型在训练时见到的图像分辨率有限,推理时遇到超高分辨率截图,精度会系统性下降。BAMI 不改模型,只改输入格式——通过裁剪把高分辨率输入转换成模型"习惯"的分辨率范围。
第二板斧:Candidate Selection(候选选择)
针对歧义偏差,BAMI 做了一件更巧妙的事:让模型多次预测,然后用规则选最好的。
具体流程: 1. 在每次裁剪后,模型做一次预测 2. 把已预测区域的像素遮住(填零或均值),让模型在"没有已选区域"的情况下再做预测 3. 重复几次,得到一组候选框 4. 用预定义规则 + 外部知识模型(如 GPT-5、Gemini-2.5-Pro)从候选里选最优
遮住已预测区域这一步很关键——它强制模型每次看不同的地方,避免重复输出同一个坐标。这相当于给模型加了"探索多样性"的约束。
候选选择的规则设计也很有讲究。作者对比了三种 prompt:
- Vanilla prompt:简单描述任务,让模型选最好的候选框
- CoT prompt:让模型用思维链逐步分析每个候选
- CoT + KP prompt:思维链 + 关键原则(注入欧几里得空间先验)
BAMI 的完整流程:全屏预测 → 裁剪 → 多次预测(遮住已选区域)→ 候选选择 → 再裁剪 → 再预测 → 再选择 → ... 直到收敛。
数据说话:OS-Atlas-7B 提升 22.7 个百分点
BAMI 的实验结果很有说服力:
| 模型 | ScreenSpot-Pro 基线 | + BAMI | 提升 |
|---|---|---|---|
| OS-Atlas-7B | 18.9% | 41.6% | +22.7 |
| UI-TARS-1.5-7B | 40.8% | 51.9% | +11.1 |
| TianXi-Action-7B | 51.9% | 57.8% | +5.9 |
| UGround-7B | 14.2% | 48.7% | +34.5 |
但这里有一个值得注意的规律:基线越低的模型,BAMI 提升越大。TianXi-Action-7B 基线已经 51.9%,BAMI 只提升 5.9 个百分点。这说明 BAMI 主要解决的是"模型有能力但被输入格式困住"的问题——模型能力越强(基线越高),被格式困住的部分越少,BAMI 能解锁的就越少。
本地 correction 模型 vs 云端 API
BAMI 的候选选择需要一个外部模型来做最终决策。作者对比了多种选择:
| Correction 模型 | 准确率 |
|---|---|
| Baseline(无 BAMI) | 51.9% |
| Doubao-Seed-1.6-Flash | 55.3% |
| GLM-4.5V | 55.9% |
| Gemini-2.5-Pro | 57.0% |
| GPT-5 | 57.8% |
| 本地 Qwen3-VL-8B(LoRA 微调) | 56.2% |
概念提炼:训练免费的能力解锁
BAMI 揭示了一个我称之为"训练免费的能力解锁"的现象。
传统提升模型能力的路径是:收集数据 → 标注 → 微调 → 部署。这条路成本高、周期长。BAMI 走了另一条路:不改模型权重,只改推理流程。
这个路径成立的前提是:模型已经具备了完成任务的内在能力,只是被某些系统性偏差困住了。BAMI 的 MPD 归因就是用来诊断"模型到底被什么困住"的工具——精度偏差、歧义偏差、还是其他什么偏差。诊断清楚后,对症下药——精度偏差用粗到细聚焦,歧义偏差用候选选择。
这个范式可以推广到其他场景:
- 目标检测中的小目标定位:高分辨率图像里的小目标,可以用粗到细聚焦来提升精度
- 文本生成中的重复问题:可以用"遮住已生成内容"的方式强制模型探索新内容
- 代码生成中的多样性不足:可以用候选选择 + 外部评判来提升代码质量
MPD 归因的更深层意义
MPD 本身比 BAMI 更有价值。BAMI 是一个具体的解决方案,MPD 是一个通用的诊断工具。
MPD 的本质是:通过输入扰动来归因模型决策。这和 LIME、SHAP 等可解释性方法思路类似,但更轻量——不需要梯度计算,不需要反向传播,只需要前向推理 K 次。
在 GUI 定位场景里,MPD 揭示了"精度偏差"和"歧义偏差"两大问题。但在其他场景里,MPD 可以揭示不同的问题——比如在医疗影像里可能揭示"模型过度依赖某个无关区域",在自动驾驶里可能揭示"模型对特定光照条件敏感"。
MPD 的价值在于:它让模型调试从"黑盒试错"变成"白盒诊断"。你不再需要盲目地尝试不同的训练策略——你先用 MPD 看清楚模型在做什么,然后针对性地解决问题。
局限与思考
BAMI 也有局限。首先是推理延迟——多次裁剪、多次预测、候选选择,整体推理时间是单次预测的数倍。论文里没有详细讨论延迟问题,但在实际部署中,这可能是个瓶颈。
其次是对外部 correction 模型的依赖。虽然本地 8B 模型可以替代 GPT-5,但仍然需要一个额外的模型来做候选选择。这增加了系统复杂度。
最后是MPD 归因的代表性——MPD 用网格遮罩来归因,但真实的错误模式可能不是网格状的。更细粒度的归因(比如像素级或语义级)可能揭示更多问题。
结语:诊断先于治疗
BAMI 的核心贡献不是"粗到细聚焦"或"候选选择"这两个具体技术——这些技术在目标检测领域并不新鲜。BAMI 的核心贡献是"诊断先于治疗"的方法论:先用 MPD 归因诊断模型的错误来源,再针对性地设计推理流程来解决问题。
这个方法论在 AI 工程里被严重低估了。当前的主流范式是"模型不行就换更大的模型"或"模型不行就微调"。BAMI 提供了第三条路:模型不行,先诊断它为什么不行,也许只需要改改推理流程就够了。
OS-Atlas-7B 从 18.9% 到 41.6% 的跃升告诉我们:有时候模型不是能力不够,是被困住了。解锁比训练更便宜、更快、更安全。
---
论文: BAMI: Training-Free Bias Mitigation in GUI Grounding 作者: Borui Zhang, Bo Zhang, Bo Wang, Wenzhao Zheng 等(清华大学 + 联想) arXiv: 2605.06664 代码: github.com/Neur-IO/BAMI(代码整理中,即将开源)