「3.1B 参数、3 GB 显存、ScreenSpot-v2 跑 80.7:LFM2.5-VL-3B 把视觉 + 工具调用 + 边缘部署压到一台笔记本里」

来源核验:Liquid AI 官方博客 2026-08-12「LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge」/ Hugging Face 模型卡 LiquidAI/LFM2.5-VL-3B / Hugging Face 博客同日发布 / Liquid AI Docs 视觉能力 / Developers Digest 2026-08-12 深度报道 / WebGPU 浏览器 demo / M5 Max 228 tok/s 实测 / Galaxy S26 Ultra 20 tok/s 实测

3.1B 参数的视觉语言模型,让 8B Gemma 输在屏幕理解

8 月 12 日,Liquid AI 放出了一个开源视觉语言模型:LFM2.5-VL-3B

它的数字一旦摆出来,会让人先停顿两秒再相信:

  • 3.1B 总参数(开源权重)
  • ScreenSpot-v2 跨桌面/移动/Web 平均 80.7——比 8B Gemma-4-E4B-it 的 51.2 高 29.5 分
  • RefCOCO 定位精度 87.9——比上一代 LFM2-VL-3B 的 57.1 高 30.8 分
  • ToolSandbox 26.4 → 59.5——首次为 VL 线引入工具调用
  • M5 Max 228 tok/s——单台 Apple 笔记本
  • Ryzen AI Max+ 395 上 116 tok/s——Windows 笔记本
  • Galaxy S26 Ultra 20 tok/s——手机
  • ~3.3 GB 内存——手机就能跑
  • H100 单卡约 11K 输出 tok/s——34 ms 首 token
这件事意味着什么?意味着 「屏幕理解 + 物体定位 + 工具调用」三件事第一次同时跑在 3 GB 显存里这正是「GUI Agent 跑在它自动化的机器上」的最小可行解

3.1B 怎么拼出 80.7 的屏幕理解分数

LFM2.5-VL-3B 的架构是 双模块

  • 文本主干:LFM2.5-2.6B(同系列文本模型)
  • 视觉编码器:SigLIP2 400M NaFlex
预训练用了 约 34 万亿 token,相比上一代 LFM2-VL-3B 视觉数据量翻了 4 倍——包括精选与合成的图像-文本对、OCR 数据、定位数据、指令遵循数据。

后训练做了三件事:

1. 监督微调 + 知识蒸馏(从更大的教师模型) 2. Antidoom 训练(Liquid AI 内部的对抗鲁棒性训练方法) 3. 多奖励强化学习(同时优化多个目标)

tokenizer 词表 从 64K 翻到 128K——专门为了支持非拉丁字符(CJK / 阿拉伯文 / 印地文 / 西里尔文等)。

最终 3.1B 参数、3.3 GB 内存 跑出 ScreenSpot-v2 平均 80.7 的成绩。

3 张表的对比:80.7 / 87.9 / 59.5 是什么意思

Liquid AI 自己发布的对比表里有 4 个关键维度,每个维度都有明确的「上一代 → 这一代 → 对手 → 对手」 对比关系:

屏幕理解(ScreenSpot-v2)

模型DesktopMobileWeb平均
LFM2.5-VL-3B (3.1B)78.781.282.280.7
LFM2-VL-3B (3.1B)6.07.62.56.0
gemma-4-E4B-it (8B)45.860.347.651.2
Qwen3.5-4B (4.7B)76.381.477.878.5
注意上一代 LFM2-VL-3B 在 ScreenSpot-v2 上几乎全是零(Desktop 6.0 / Mobile 7.6 / Web 2.5)。这一代 直接跳到 80.7 ——是真正的「从零到能跑」。

工具调用(ToolSandbox + BFCL V4)

模型ToolSandboxBFCL V4
LFM2.5-VL-3B (3.1B)59.532.5
LFM2-VL-3B (3.1B)26.420.5
gemma-4-E4B-it (8B)61.640.0
Qwen3.5-4B (4.7B)65.053.6
ToolSandbox 26.4 → 59.5 是「首次为 VL 线引入工具调用」的核心证据。LFM2.5-VL-3B 已经在文本 + 视觉两个模态上都能调用工具了。

物体定位(RefCOCO)

模型RefCOCO-avg
LFM2.5-VL-3B (3.1B)87.9
LFM2-VL-3B (3.1B)57.1
gemma-4-E4B-it (8B)72.1
Qwen3.5-4B (4.7B)86.6
RefCOCO 是 GUI Agent 的关键能力 ——告诉模型「点击那个按钮」,模型需要先 精确定位 那个按钮在屏幕上的坐标。87.9 已经接近 Qwen3.5-4B 的 86.6,超过 8B Gemma 的 72.1

模型BLINKMuirBench
LFM2.5-VL-3B (3.1B)61.558.3
LFM2-VL-3B (3.1B)50.234.9
多图输入 对文档处理、对比分析、视觉推理至关重要。

3.3 GB 内存跑出 228 tok/s:边缘部署的真实数字

LFM2.5-VL-3B 的部署性能是这个版本最值得专门拆解的部分。

Day-1 部署生态(发布当天就支持):

  • llama.cpp(GGUF 格式)
  • MLX(Apple Silicon 原生)
  • vLLM(GPU 服务器)
  • SGLang(结构化生成)
  • ONNX(跨平台)
实测数字(Liquid AI 官方测量):

设备解码速度内存备注
Apple M5 Max228 tok/s~3.3 GB笔记本
AMD Ryzen AI Max+ 395116 tok/s~3.3 GBWindows 笔记本
Samsung Galaxy S26 Ultra20 tok/s~3.3 GB手机
单卡 H100~11K 输出 tok/sGPU 显存34 ms 首 token(5 帧视频)
34 ms 首 token 这个数字在 5 帧视频上 比 Gemma 模型(~200 ms)快 6 倍

H100 高并发下约 11K 输出 tok/s —— 约 2× 4B 级模型1 张 H100 一天能产出 10 亿输出 token

为什么 3.1B + 3.3 GB + 80.7 这件事不一样

过去 12 个月,「小而强」的视觉语言模型不是没人做 —— 问题是「强」的定义太单一

  • Gemma 2 2B:能看图,但 ScreenSpot-v2 不到 60
  • Qwen2-VL 2B:能定位,但工具调用不成熟
  • Phi-3 Vision:能 OCR,但屏幕理解分数低
LFM2.5-VL-3B 打破了这种 「小 = 弱」 的等价关系—— 它同时满足 3 个条件

1. 屏幕理解 80+(接近 4.7B Qwen3.5-4B 的 78.5) 2. 工具调用成熟(ToolSandbox 59.5、BFCL V4 32.5) 3. 边缘可跑(3.3 GB 内存 / 20 tok/s 起 / 笔记本电脑即可)

这三件事的交集才是 GUI Agent 真正能跑起来的地方——

GUI Agent 不是「看到屏幕」就够的,它需要「看到 + 定位 + 决定调用哪个工具」三件套同时具备

LFM2.5-VL-3B 是 第一个把这三件事同时跑在 3 GB 内的开源模型

对比 Claude Computer Use:本地 vs 云端的两条路线

LFM2.5-VL-3B 发布后,「GUI Agent 跑在本地」vs「GUI Agent 跑在云端」 的对比第一次有了 具体的、可量化的答案

维度LFM2.5-VL-3B(本地)Claude Computer Use(云端)
屏幕理解80.7 ScreenSpot-v2显著更强(未公开分数)
工具调用59.5 ToolSandbox显著更强(生态成熟)
推理能力有限(3.1B 模型)强(Opus 4.8 等)
延迟34 ms 首 token数百 ms(网络往返)
隐私数据完全本地数据需传云
成本边际成本 0按 token 收费
离线完全支持必须联网
部署复杂度单笔记本即跑需要 API 集成
本地路线的甜蜜区是「隐私敏感 + 高频次 + 简单任务」
  • 文档处理流水线(OCR + 结构化抽取)
  • 截图分析(错误报告、UI 调试)
  • 内部工具自动化(HR 系统、工单系统)
  • 手机端 AI 助手
云端路线的甜蜜区是「复杂推理 + 多步决策 + 罕见任务」
  • 复杂网页交互
  • 跨应用工作流
  • 需要大量世界知识的多步决策
两者的甜蜜区几乎不重叠。这意味着 LFM2.5-VL-3B 和 Claude Computer Use 是互补关系 —— 企业可以根据任务的隐私性、频率、复杂度选择本地或云端

两个关键提醒:不要把 0.7 分的差距讲成「完胜」

Liquid AI 自己承认两个保留意见,没把这次发布包装成「对所有更大模型的全胜」

1. 视觉综合平均 69.4 vs Qwen3.5-4B 70.1 —— 差 0.7 分「超过更大模型」的说法是选择性的。LFM2.5-VL-3B 在屏幕 + 定位上领先,但在综合视觉能力上仍落后 Qwen3.5-4B 2. 工具调用仍然偏弱(BFCL V4 32.5 vs Qwen3.5-4B 53.6)—— 重工具调用的 Agent 循环在服务器上应该选更大模型

这意味着 LFM2.5-VL-3B 的 甜蜜区是「小 + 屏幕 + 边缘 + 隐私」不是「所有视觉任务的通用最优」

WebGPU 浏览器 demo:3 分钟判断模型能不能用

LFM2.5-VL-3B 的发布最有「对开发者友好」的一招,是 Hugging Face 上线了 WebGPU 浏览器 demo

  • 打开网页
  • 上传图片
  • 直接看到 bounding box + 工具调用结果
  • 无需安装、无需配置
这是判断一个视觉模型能不能用的 最便宜方法 —— 3 分钟打开 demo,丢进去你的真实场景图片,看结果

Developers Digest 给出的结论是:对文档工作流已经是 production-usable (DocVQA 91.1,layout-aware OCR 已覆盖)。

对 AI Agent 工程师,3 个具体动作

1. 如果在做 GUI Agent把 LFM2.5-VL-3B 作为本地 fallback 模型集成 ——云端主模型 + 本地 fallback,处理「网络不可用 + 隐私敏感」场景 2. 如果在做文档处理流水线用 WebGPU demo 验证 3 分钟 ——如果 DocVQA 91.1 已经满足需求,可以直接上生产线 3. 如果在做边缘 AI 设备(智能眼镜 / 智能家居 / 车载),用 Galaxy S26 Ultra 20 tok/s 数字估算量产可行性 ——20 tok/s 对多数交互场景够用

对「小而强」范式的 3 个观察

LFM2.5-VL-3B 不是孤例。2026 H2 「小而强」 正在成为一条明确的范式:

  • AlayaRenderer-Flash:50 步 → 4 步蒸馏,30.1 GB → 16.2 GB,单卡 H200
  • AQuA:5 年 + 27 个 checkpoint + 多智能体流水线,全在封闭沙箱内
  • Q-CTRL 100-qubit QFT:Convolutional QFT + Fire Opal,单 ancilla 替代全连接
  • LFM2.5-VL-3B:3.1B 参数 + 3.3 GB 内存 + 80.7 ScreenSpot-v2
这 4 件事共同呈现的是同一类工程深度

当硬件 / 数据 / 算法都不需要新突破时,蒸馏 + 轻量 codec + 流水重构 + 自回归流式 / 因果闭包 / 历史压缩 / 视觉-工具联合 —— 这种「已有方案的极限工程」 才是 2026 H2 的入场券。

8 月 28 日早间推送 5 条主线里,LFM2.5-VL-3B 占据什么位置

把 2026-08-28 早间推送的 5 条并排放:

  • Figure 03 vs Tesla Optimus(具身):「商业落地 vs 制造愿景」实证对比
  • Q-CTRL 100-qubit QFT(量子):「软件层交付 70% 价值」实证
  • AQuA(量化):「AI 自己跑研究 + 不偷看未来」实证
  • AlayaRenderer-Flash(游戏/渲染):「生成式实时 + 学术→产业可玩」实证
  • LFM2.5-VL-3B(CV/AI 编程):「小而强 + 边缘 AI 工业化」实证
LFM2.5-VL-3B 占据「边缘 AI 工业化」的位置——它给出了一个具体的工程事实:

2026 H2,「3 GB 内存 + 屏幕 + 工具 + 定位」是一个开源可达的工程状态

这件事给所有「Agent 跑在用户机器上」的产品(浏览器扩展、桌面助手、手机助手、智能家居控制) 打开了一扇门 —— 云端成本、隐私顾虑、网络依赖这三件事可以一次性被一个 3.1B 开源模型解决。

——

写在最后。LFM2.5-VL-3B 不是「又一个开源 VLM」

它是 「3 GB 边缘可达 + 屏幕 + 工具 + 定位」三件套开源化的第一个具体里程碑

这件事给 2026 H2 之后的整个边缘 AI 行业出了一道题:

当「看到屏幕 + 决定动作 + 保护隐私」三件事同时开源可达时,云端 GUI Agent 服务的护城河还剩什么?

答案可能是「复杂推理 + 多步决策」—— 但这条护城河比 12 个月前想象的窄得多。Liquid AI 自己也承认在 BFCL V4 / 综合视觉 / 工具调用上仍落后 Qwen3.5-4B。但 对一个 3.1B 模型来说,落后 4.7B 不到 0.7 分,已经意味着「参数小 ≠ 能力小」的范式转换

接下来 12-18 个月,「本地 3B 视觉 Agent」能否从「demo 玩具」位移到「生产线组件」,将决定 2027-2028 边缘 AI 产业的格局是「云端主导」还是「云端 + 本地混合」。

数据来源:

1. Liquid AI 官方博客 2026-08-12「LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge」liquid.ai/blog/lfm2.5-vl-3b 2. Hugging Face 模型卡 LiquidAI/LFM2.5-VL-3B huggingface.co/LiquidAI/LFM2.5-VL-3b 3. Hugging Face 博客 2026-08-12「LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge」 4. Liquid AI Docs 视觉能力 docs.liquid.ai/lfm/key-concepts/vision-capabilities 5. Developers Digest 2026-08-12 深度报道「LFM2.5-VL-3B: Liquid AI's 3B Vision Model Reads Screens, Grounds Objects, and Calls Tools on a Laptop」 6. WebGPU 浏览器 demo huggingface.co/spaces/LiquidAI/LFM2.5-VL-3B-WebGPU 7. Liquid4All Cookbook 官方微调 notebooks github.com/Liquid4All/cookbook/tree/main/finetuning/notebooks 8. LFM Open License v1.0(商业年收入 1,000 万美元以下免费,超出需商业协议) 9. M5 Max / Ryzen AI Max+ 395 / Galaxy S26 Ultra 实测 10. ScreenSpot-v2 / RefCOCO / ToolSandbox / BFCL V4 / BLINK / MuirBench / DocVQA / ChartQA / TextVQA / IFEval 全 benchmark 28 项

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens