3B 打 32B?NVIDIA LocateAnything 把视觉定位做成 Agent 时代的原语
!locate-anything-3b.svg NVIDIA 又开源了一款 3B 模型——LocateAnything-3B。一句话能描述定位它:说一句话,它就在图/视频里精准框出目标。
任务面铺得异常宽:
| 能力 | 通俗解释 |
|---|---|
| 物体检测 | 给类名/描述 → 输出框 |
| 短语定位(phrase grounding) | 给自然语言短语 → 框出对应物体 |
| OCR / 文字定位 | 图里所有文字 + 位置 |
| 文档布局分析 | 段落 / 标题 / 表格区域 |
| GUI 元素定位 | 给按钮描述 → 框出 UI 控件 |
| 点定位 | 给描述 → 输出点坐标 |
信息源:
- 官方页:https://research.nvidia.com/labs/lpr/locate-anything
- 论文 PDF:https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
- HuggingFace:https://huggingface.co/nvidia/LocateAnything-3B(2026-05-26 发布)
- GitHub:https://github.com/gammahazard/locate-anything(
docker compose up即可跑)
几个我比较在意的点:
1. 本质上是把 YOLO 一类"专精模型"换成"统一 VLM" YOLO 在纯物体检测这条窄路上快得离谱(YOLOv10 / RT-DETR 已工业级部署),LocateAnything 3B 单任务吞吐量打不过专精模型。它的卖点是 一个模型干六件事——部署成本/工程复杂度下降一个数量级。这就是 RAG 时代"通用 LLM 干掉一堆 fine-tuned 任务模型"的视觉版。
2. "GUI grounding" 这一项是被严重低估的能力 给一句"那个蓝色的提交按钮",模型框出来——这正是 Anthropic Computer Use、OpenAI Operator、智澄 AgentMore 这种 GUI Agent 的底层原语。NVIDIA 把它和物体检测放同一个框架训练,等于在赌"Agent 视觉栈也会走向统一"。
3. NVIDIA 的开源策略依然在卖卡 跟 Nemotron、Llama-Nemotron 一个套路:模型免费,但要跑得快、跑得稳 → 买 NVIDIA 卡。"消费级显卡可跑" + "单 docker compose up" 降低了试用门槛,但生产化部署最后还是会导向 H100/H200。开源是生意,不是慈善。
4. 一个被忽视的细节:Parallel Box Decoding 传统 grounding 模型 auto-regressive 一个一个出框,并行解码一次出 N 个。在视频流(每帧都要框)场景下吞吐量优势会被放大。我赌一年内会出现"LocateAnything-Video"版本。
---
开放问题: 你们觉得"统一 VLM 干掉专精视觉模型"这条路会不会真的走通?还是 YOLO 这种"小而美"在工业部署里会像 RAG 一样——理论不优美但工程上跑得起来就行?