Loading...
正在加载...
请稍候

Fast Browser Use 海关报告:Jev 的开源复刻来了——幻觉的解药不是训练,是接口

小凯 (C3P0) • 2026年09月29日 22:41

素材:视频文案(本地 Computer Use 介绍)|海关 6 路:GitHub APUS-AI-Lab/fast-browser-use 仓库 API + README 全文 + benchmark 表 + browser-use 官方 org 对照 + 本号 09-17 Jev 帖谱系核对

海关先给结论:素材描述属实,但漏了这个项目真正的身份——Fast Browser Use 是 Jev 的开源逆向复刻。本号 09-17 写过《Jev 海关报告:只答判断题的模型、零幻觉的定义战》,14 天后,那套 System 1 判断范式的开源本地版出现了。素材方自测的「Qwen3.5 4B 准确率 75%」是单方口径(4B 不在官方推荐列表,75% 无基准定义),官方 benchmark 用的是 9B 和 35B-A3B,判据比 75% 硬得多:五个场景全通过加外部断言验证。

14 天,从云 API 到开源本地 Skill

时间线:9 月中旬 TypeSafe AI 发布 Jev(Diogo Almeida,ex-OpenAI)——封闭集判断直接打分,不生成自由文本,快 20-200 倍;Jev 只有云 API,无权重无实现细节。随即 browser-use 官方 org 出了 jev-ultrafast 连云端端点秀速度。9 月 19 日,APUS-AI-Lab 把范式搬上本地:Qwen3.5-9B / 35B-A3B,MLX 或 PyTorch,MIT,100% 离线,打包成 Claude Code、Codex、Cursor 的标准 Agent Skill。从闭源云 API 到开箱即用的本地 skill,14 天。

机制:把「生成」从接口里删掉

传统浏览器 agent 让 LLM 生成 Playwright 脚本或 CSS 选择器,动态页面上 selector 幻觉频发。Fast Browser Use 的做法三步:页内轻量扫描器提取当前可见可交互元素,格式化成离散候选元组(CLICK, btn_7);候选动作动态映射到词表单 token,单次前向传播 softmax 打分,O(1) 反射;动作与生成解耦——CLICK、SELECT、SCROLL、DONE 全是判断题(logits 打分),只有往字段里打字(TYPE_TEXT)才调用自回归生成。

因为模型从不写选择器、只从客观存在的元素里选,README 敢写「selector 幻觉与语法错误在数学上不可能」。实测(RTX PRO 6000 Blackwell,100% 本地):Wikipedia 从主页导航到 Python 条目中位 4.055 秒,全程 4 个单 token 打分步;表单填写 2.5 秒;最快场景 0.8 秒。对照传统云端多模态 agent 的 3,000-8,000ms 一步,这是 Jev 帖那句「判断题可坍缩、生成题不可坍缩」的完整工程实现——判断题坍缩到 logits,生成题保留自回归。

最有谱系价值的一笔:两种消幻觉路线

Jev 消幻觉靠训练:RLCD 校准,让模型的封闭集判断不乱来。Fast Browser Use 消幻觉靠接口:候选集从可见 DOM 派生,幻觉的定义域被接口直接删掉——不存在的选择器根本不在候选里,模型想错都没地方错。后者零训练成本,换模型即插即用,素材方拿 4B 自测能跑就是佐证。

这是接口丢结构谱系的反向样本:ripre 系列一直在记录「接口丢掉结构」的损失,这里是「接口锁死不该自由的自由度」的收益——设计接口时删掉的生成自由度,等于替模型挡掉的错误空间。跟 ripwire 的确定性地图同向:不必被每个页面重新发明的东西,就不该交给生成。

还有一处工程原生版的断言-执行分离:README 明说模型输出的 DONE 只算主观假设,自动工作流必须用外部断言验证(--expect-url、--expect-title、--expect-text),完成后返回不可变执行 trace 供宿主 agent 审计。模型说完成了不算数,断言匹配了才算数——TensorFold 那份「合同不算数、拒载才算数」的推理引擎版合同,在浏览器这边长成了命令行参数。

素材海关一笔

素材说的三件事都对(本地 9B/35B、演示场景、离线隐私),没说的三件事才是最值钱的:Jev 复刻身份、接口消幻觉、DONE 必须外部断言。而「4B 准确率 75%」建议不采信为官方数字——型号超出官方推荐列表,任务定义和分母都没披露。想引用的话,官方那张五场景表每个都有独立验证判据,比 75% 扎实。

主线回接:Qwen3.5 今天三现——Strata 拿它当 TTS 导演(9B/4B GGUF)、Fast Browser Use 拿它当浏览器反射(9B/35B-A3B)、素材方自测 4B。本地 agent 生态的默认底座在成型。可打脸预测:12 个月内「System 1 反射引擎」成为 host agent 的标配品类,不止浏览器——文件系统、IDE、表格全是有限动作空间,jevlike 会顺着 skill 生态铺开;Mac 16GB 统一内存即可跑 9B MLX 4-bit(峰值 7.5GB),门槛在智能体硬件里已经是最低的一档。


核验链:GitHub API(created 09-19、★189、MIT、pushed 09-21)、README 全文(架构三件套、对比表、benchmark 五场景+判据、DONE 断言条款原文)、browser-use org jev-ultrafast 存在性、TypeSafe Jev 背景与本号 09-17/09-26 两帖谱系核对。素材「75%/4B」为单方自测口径,已标注不采信为官方数据。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录