来源核验:Liquid AI 官方博客 2026-08-12「LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge」/ Hugging Face 模型卡 LiquidAI/LFM2.5-VL-3B / Hugging Face 博客同日发布 / Liquid AI Docs 视觉能力 / Developers Digest 2026-08-12 深度报道 / WebGPU 浏览器 demo / M5 Max 228 tok/s 实测 / Galaxy S26 Ultra 20 tok/s 实测
3.1B 参数的视觉语言模型,让 8B Gemma 输在屏幕理解
8 月 12 日,Liquid AI 放出了一个开源视觉语言模型:LFM2.5-VL-3B。
它的数字一旦摆出来,会让人先停顿两秒再相信:
- 3.1B 总参数(开源权重)
- ScreenSpot-v2 跨桌面/移动/Web 平均 80.7——比 8B Gemma-4-E4B-it 的 51.2 高 29.5 分
- RefCOCO 定位精度 87.9——比上一代 LFM2-VL-3B 的 57.1 高 30.8 分
- ToolSandbox 26.4 → 59.5——首次为 VL 线引入工具调用
- M5 Max 228 tok/s——单台 Apple 笔记本
- Ryzen AI Max+ 395 上 116 tok/s——Windows 笔记本
- Galaxy S26 Ultra 20 tok/s——手机
- ~3.3 GB 内存——手机就能跑
- H100 单卡约 11K 输出 tok/s——34 ms 首 token
这件事意味着什么?意味着 「屏幕理解 + 物体定位 + 工具调用」三件事第一次同时跑在 3 GB 显存里。这正是「GUI Agent 跑在它自动化的机器上」的最小可行解。
3.1B 怎么拼出 80.7 的屏幕理解分数
LFM2.5-VL-3B 的架构是 双模块:
- 文本主干:LFM2.5-2.6B(同系列文本模型)
- 视觉编码器:SigLIP2 400M NaFlex
预训练用了 约 34 万亿 token,相比上一代 LFM2-VL-3B 视觉数据量翻了 4 倍——包括精选与合成的图像-文本对、OCR 数据、定位数据、指令遵循数据。
后训练做了三件事:
- 监督微调 + 知识蒸馏(从更大的教师模型)
- Antidoom 训练(Liquid AI 内部的对抗鲁棒性训练方法)
- 多奖励强化学习(同时优化多个目标)
tokenizer 词表 从 64K 翻到 128K——专门为了支持非拉丁字符(CJK / 阿拉伯文 / 印地文 / 西里尔文等)。
最终 3.1B 参数、3.3 GB 内存 跑出 ScreenSpot-v2 平均 80.7 的成绩。
3 张表的对比:80.7 / 87.9 / 59.5 是什么意思
Liquid AI 自己发布的对比表里有 4 个关键维度,每个维度都有明确的「上一代 → 这一代 → 对手 → 对手」 对比关系:
屏幕理解(ScreenSpot-v2)
| 模型 | Desktop | Mobile | Web | 平均 |
|---|---|---|---|---|
| LFM2.5-VL-3B (3.1B) | 78.7 | 81.2 | 82.2 | 80.7 |
| LFM2-VL-3B (3.1B) | 6.0 | 7.6 | 2.5 | 6.0 |
| gemma-4-E4B-it (8B) | 45.8 | 60.3 | 47.6 | 51.2 |
| Qwen3.5-4B (4.7B) | 76.3 | 81.4 | 77.8 | 78.5 |
注意上一代 LFM2-VL-3B 在 ScreenSpot-v2 上几乎全是零(Desktop 6.0 / Mobile 7.6 / Web 2.5)。这一代 直接跳到 80.7 ——是真正的「从零到能跑」。
工具调用(ToolSandbox + BFCL V4)
| 模型 | ToolSandbox | BFCL V4 |
|---|---|---|
| LFM2.5-VL-3B (3.1B) | 59.5 | 32.5 |
| LFM2-VL-3B (3.1B) | 26.4 | 20.5 |
| gemma-4-E4B-it (8B) | 61.6 | 40.0 |
| Qwen3.5-4B (4.7B) | 65.0 | 53.6 |
ToolSandbox 26.4 → 59.5 是「首次为 VL 线引入工具调用」的核心证据。LFM2.5-VL-3B 已经在文本 + 视觉两个模态上都能调用工具了。
物体定位(RefCOCO)
| 模型 | RefCOCO-avg |
|---|---|
| LFM2.5-VL-3B (3.1B) | 87.9 |
| LFM2-VL-3B (3.1B) | 57.1 |
| gemma-4-E4B-it (8B) | 72.1 |
| Qwen3.5-4B (4.7B) | 86.6 |
RefCOCO 是 GUI Agent 的关键能力 ——告诉模型「点击那个按钮」,模型需要先 精确定位 那个按钮在屏幕上的坐标。87.9 已经接近 Qwen3.5-4B 的 86.6,超过 8B Gemma 的 72.1。
多图输入(BLINK + MuirBench)
| 模型 | BLINK | MuirBench |
|---|---|---|
| LFM2.5-VL-3B (3.1B) | 61.5 | 58.3 |
| LFM2-VL-3B (3.1B) | 50.2 | 34.9 |
多图输入 对文档处理、对比分析、视觉推理至关重要。
3.3 GB 内存跑出 228 tok/s:边缘部署的真实数字
LFM2.5-VL-3B 的部署性能是这个版本最值得专门拆解的部分。
Day-1 部署生态(发布当天就支持):
- llama.cpp(GGUF 格式)
- MLX(Apple Silicon 原生)
- vLLM(GPU 服务器)
- SGLang(结构化生成)
- ONNX(跨平台)
实测数字(Liquid AI 官方测量):
| 设备 | 解码速度 | 内存 | 备注 |
|---|---|---|---|
| Apple M5 Max | 228 tok/s | ~3.3 GB | 笔记本 |
| AMD Ryzen AI Max+ 395 | 116 tok/s | ~3.3 GB | Windows 笔记本 |
| Samsung Galaxy S26 Ultra | 20 tok/s | ~3.3 GB | 手机 |
| 单卡 H100 | ~11K 输出 tok/s | GPU 显存 | 34 ms 首 token(5 帧视频) |
34 ms 首 token 这个数字在 5 帧视频上 比 Gemma 模型(~200 ms)快 6 倍。
H100 高并发下约 11K 输出 tok/s —— 约 2× 4B 级模型。1 张 H100 一天能产出 10 亿输出 token。
为什么 3.1B + 3.3 GB + 80.7 这件事不一样
过去 12 个月,「小而强」的视觉语言模型不是没人做 —— 问题是「强」的定义太单一:
- Gemma 2 2B:能看图,但 ScreenSpot-v2 不到 60
- Qwen2-VL 2B:能定位,但工具调用不成熟
- Phi-3 Vision:能 OCR,但屏幕理解分数低
LFM2.5-VL-3B 打破了这种 「小 = 弱」 的等价关系—— 它同时满足 3 个条件:
- 屏幕理解 80+(接近 4.7B Qwen3.5-4B 的 78.5)
- 工具调用成熟(ToolSandbox 59.5、BFCL V4 32.5)
- 边缘可跑(3.3 GB 内存 / 20 tok/s 起 / 笔记本电脑即可)
这三件事的交集才是 GUI Agent 真正能跑起来的地方——
GUI Agent 不是「看到屏幕」就够的,它需要「看到 + 定位 + 决定调用哪个工具」三件套同时具备。
LFM2.5-VL-3B 是 第一个把这三件事同时跑在 3 GB 内的开源模型。
对比 Claude Computer Use:本地 vs 云端的两条路线
LFM2.5-VL-3B 发布后,「GUI Agent 跑在本地」vs「GUI Agent 跑在云端」 的对比第一次有了 具体的、可量化的答案:
| 维度 | LFM2.5-VL-3B(本地) | Claude Computer Use(云端) |
|---|---|---|
| 屏幕理解 | 80.7 ScreenSpot-v2 | 显著更强(未公开分数) |
| 工具调用 | 59.5 ToolSandbox | 显著更强(生态成熟) |
| 推理能力 | 有限(3.1B 模型) | 强(Opus 4.8 等) |
| 延迟 | 34 ms 首 token | 数百 ms(网络往返) |
| 隐私 | 数据完全本地 | 数据需传云 |
| 成本 | 边际成本 0 | 按 token 收费 |
| 离线 | 完全支持 | 必须联网 |
| 部署复杂度 | 单笔记本即跑 | 需要 API 集成 |
本地路线的甜蜜区是「隐私敏感 + 高频次 + 简单任务」:
- 文档处理流水线(OCR + 结构化抽取)
- 截图分析(错误报告、UI 调试)
- 内部工具自动化(HR 系统、工单系统)
- 手机端 AI 助手
云端路线的甜蜜区是「复杂推理 + 多步决策 + 罕见任务」:
- 复杂网页交互
- 跨应用工作流
- 需要大量世界知识的多步决策
两者的甜蜜区几乎不重叠。这意味着 LFM2.5-VL-3B 和 Claude Computer Use 是互补关系 —— 企业可以根据任务的隐私性、频率、复杂度选择本地或云端。
两个关键提醒:不要把 0.7 分的差距讲成「完胜」
Liquid AI 自己承认两个保留意见,没把这次发布包装成「对所有更大模型的全胜」:
- 视觉综合平均 69.4 vs Qwen3.5-4B 70.1 —— 差 0.7 分。「超过更大模型」的说法是选择性的。LFM2.5-VL-3B 在屏幕 + 定位上领先,但在综合视觉能力上仍落后 Qwen3.5-4B
- 工具调用仍然偏弱(BFCL V4 32.5 vs Qwen3.5-4B 53.6)—— 重工具调用的 Agent 循环在服务器上应该选更大模型
这意味着 LFM2.5-VL-3B 的 甜蜜区是「小 + 屏幕 + 边缘 + 隐私」,不是「所有视觉任务的通用最优」。
WebGPU 浏览器 demo:3 分钟判断模型能不能用
LFM2.5-VL-3B 的发布最有「对开发者友好」的一招,是 Hugging Face 上线了 WebGPU 浏览器 demo:
- 打开网页
- 上传图片
- 直接看到 bounding box + 工具调用结果
- 无需安装、无需配置
这是判断一个视觉模型能不能用的 最便宜方法 —— 3 分钟打开 demo,丢进去你的真实场景图片,看结果。
Developers Digest 给出的结论是:对文档工作流已经是 production-usable (DocVQA 91.1,layout-aware OCR 已覆盖)。
对 AI Agent 工程师,3 个具体动作
- 如果在做 GUI Agent,把 LFM2.5-VL-3B 作为本地 fallback 模型集成 ——云端主模型 + 本地 fallback,处理「网络不可用 + 隐私敏感」场景
- 如果在做文档处理流水线,用 WebGPU demo 验证 3 分钟 ——如果 DocVQA 91.1 已经满足需求,可以直接上生产线
- 如果在做边缘 AI 设备(智能眼镜 / 智能家居 / 车载),用 Galaxy S26 Ultra 20 tok/s 数字估算量产可行性 ——20 tok/s 对多数交互场景够用
对「小而强」范式的 3 个观察
LFM2.5-VL-3B 不是孤例。2026 H2 「小而强」 正在成为一条明确的范式:
- AlayaRenderer-Flash:50 步 → 4 步蒸馏,30.1 GB → 16.2 GB,单卡 H200
- AQuA:5 年 + 27 个 checkpoint + 多智能体流水线,全在封闭沙箱内
- Q-CTRL 100-qubit QFT:Convolutional QFT + Fire Opal,单 ancilla 替代全连接
- LFM2.5-VL-3B:3.1B 参数 + 3.3 GB 内存 + 80.7 ScreenSpot-v2
这 4 件事共同呈现的是同一类工程深度:
当硬件 / 数据 / 算法都不需要新突破时,蒸馏 + 轻量 codec + 流水重构 + 自回归流式 / 因果闭包 / 历史压缩 / 视觉-工具联合 —— 这种「已有方案的极限工程」 才是 2026 H2 的入场券。
8 月 28 日早间推送 5 条主线里,LFM2.5-VL-3B 占据什么位置
把 2026-08-28 早间推送的 5 条并排放:
- Figure 03 vs Tesla Optimus(具身):「商业落地 vs 制造愿景」实证对比
- Q-CTRL 100-qubit QFT(量子):「软件层交付 70% 价值」实证
- AQuA(量化):「AI 自己跑研究 + 不偷看未来」实证
- AlayaRenderer-Flash(游戏/渲染):「生成式实时 + 学术→产业可玩」实证
- LFM2.5-VL-3B(CV/AI 编程):「小而强 + 边缘 AI 工业化」实证
LFM2.5-VL-3B 占据「边缘 AI 工业化」的位置——它给出了一个具体的工程事实:
2026 H2,「3 GB 内存 + 屏幕 + 工具 + 定位」是一个开源可达的工程状态。
这件事给所有「Agent 跑在用户机器上」的产品(浏览器扩展、桌面助手、手机助手、智能家居控制) 打开了一扇门 —— 云端成本、隐私顾虑、网络依赖这三件事可以一次性被一个 3.1B 开源模型解决。
——
写在最后。LFM2.5-VL-3B 不是「又一个开源 VLM」。
它是 「3 GB 边缘可达 + 屏幕 + 工具 + 定位」三件套开源化的第一个具体里程碑。
这件事给 2026 H2 之后的整个边缘 AI 行业出了一道题:
当「看到屏幕 + 决定动作 + 保护隐私」三件事同时开源可达时,云端 GUI Agent 服务的护城河还剩什么?
答案可能是「复杂推理 + 多步决策」—— 但这条护城河比 12 个月前想象的窄得多。Liquid AI 自己也承认在 BFCL V4 / 综合视觉 / 工具调用上仍落后 Qwen3.5-4B。但 对一个 3.1B 模型来说,落后 4.7B 不到 0.7 分,已经意味着「参数小 ≠ 能力小」的范式转换。
接下来 12-18 个月,「本地 3B 视觉 Agent」能否从「demo 玩具」位移到「生产线组件」,将决定 2027-2028 边缘 AI 产业的格局是「云端主导」还是「云端 + 本地混合」。
数据来源:
- Liquid AI 官方博客 2026-08-12「LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge」liquid.ai/blog/lfm2.5-vl-3b
- Hugging Face 模型卡 LiquidAI/LFM2.5-VL-3B huggingface.co/LiquidAI/LFM2.5-VL-3b
- Hugging Face 博客 2026-08-12「LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge」
- Liquid AI Docs 视觉能力 docs.liquid.ai/lfm/key-concepts/vision-capabilities
- Developers Digest 2026-08-12 深度报道「LFM2.5-VL-3B: Liquid AI's 3B Vision Model Reads Screens, Grounds Objects, and Calls Tools on a Laptop」
- WebGPU 浏览器 demo huggingface.co/spaces/LiquidAI/LFM2.5-VL-3B-WebGPU
- Liquid4All Cookbook 官方微调 notebooks github.com/Liquid4All/cookbook/tree/main/finetuning/notebooks
- LFM Open License v1.0(商业年收入 1,000 万美元以下免费,超出需商业协议)
- M5 Max / Ryzen AI Max+ 395 / Galaxy S26 Ultra 实测
- ScreenSpot-v2 / RefCOCO / ToolSandbox / BFCL V4 / BLINK / MuirBench / DocVQA / ChartQA / TextVQA / IFEval 全 benchmark 28 项
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。