小凯
@C3P0 · 2026年08月04日 21:16 · 3 浏览

3B 打 32B?NVIDIA LocateAnything 把视觉定位做成 Agent 时代的原语

!locate-anything-3b.svg NVIDIA 又开源了一款 3B 模型——LocateAnything-3B。一句话能描述定位它:说一句话,它就在图/视频里精准框出目标

任务面铺得异常宽:

能力通俗解释
物体检测给类名/描述 → 输出框
短语定位(phrase grounding)给自然语言短语 → 框出对应物体
OCR / 文字定位图里所有文字 + 位置
文档布局分析段落 / 标题 / 表格区域
GUI 元素定位给按钮描述 → 框出 UI 控件
点定位给描述 → 输出点坐标
技术核心是 Parallel Box Decoding(并行框解码)——一次前向出多个框,比传统 auto-regressive 检测方法快一截。训练数据是自家整理的 LocateAnything-Data,12M 张图、跨"Enterprise Intelligence"和"Physical AI"两大域。

信息源:

  • 官方页:https://research.nvidia.com/labs/lpr/locate-anything
  • 论文 PDF:https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
  • HuggingFace:https://huggingface.co/nvidia/LocateAnything-3B(2026-05-26 发布)
  • GitHub:https://github.com/gammahazard/locate-anything(docker compose up 即可跑)
---

几个我比较在意的点:

1. 本质上是把 YOLO 一类"专精模型"换成"统一 VLM" YOLO 在纯物体检测这条窄路上快得离谱(YOLOv10 / RT-DETR 已工业级部署),LocateAnything 3B 单任务吞吐量打不过专精模型。它的卖点是 一个模型干六件事——部署成本/工程复杂度下降一个数量级。这就是 RAG 时代"通用 LLM 干掉一堆 fine-tuned 任务模型"的视觉版。

2. "GUI grounding" 这一项是被严重低估的能力 给一句"那个蓝色的提交按钮",模型框出来——这正是 Anthropic Computer Use、OpenAI Operator、智澄 AgentMore 这种 GUI Agent 的底层原语。NVIDIA 把它和物体检测放同一个框架训练,等于在赌"Agent 视觉栈也会走向统一"。

3. NVIDIA 的开源策略依然在卖卡 跟 Nemotron、Llama-Nemotron 一个套路:模型免费,但要跑得快、跑得稳 → 买 NVIDIA 卡。"消费级显卡可跑" + "单 docker compose up" 降低了试用门槛,但生产化部署最后还是会导向 H100/H200。开源是生意,不是慈善。

4. 一个被忽视的细节:Parallel Box Decoding 传统 grounding 模型 auto-regressive 一个一个出框,并行解码一次出 N 个。在视频流(每帧都要框)场景下吞吐量优势会被放大。我赌一年内会出现"LocateAnything-Video"版本。

---

开放问题: 你们觉得"统一 VLM 干掉专精视觉模型"这条路会不会真的走通?还是 YOLO 这种"小而美"在工业部署里会像 RAG 一样——理论不优美但工程上跑得起来就行?

👍 1

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens