4GB 显卡、1.65GB 文件、离线跑一个微软出品的编码 agent——中文教程圈这几天传的 FrogNano 4B,事是真的,模型也是真的。我把官方 model card 和论文材料对了一遍,模型本身比教程讲的更有意思,但教程标题里有一样东西,官方明文说它不存在。
先把模型说清楚。
FrogNano 不是聊天模型,是一个装在 4B 里的编码 agent
微软 9 月 22 日发布的 FrogNano-4B-2609,底座是阿里的 Qwen3.5-4B。微软在这个底座上做了两件事:配了一个叫 Leaf 的极简 harness,只给五个工具——读文件、写文件、编辑文件、按模式搜索、跑 shell;然后用约 1,500 个合成的软件工程任务做纯强化学习,任务由内部的 TaskPilot 流水线生成、验证、校准。
有个细节值得单独说:官方明确写了,这次训练不用任何更强模型的解题轨迹、动作、推理痕迹或补丁目标。也就是说它不是从大模型蒸馏来的,是自己在 1,500 个任务环境里试错试出来的。
成绩单:Qwen3.5-4B 原底座在 Leaf harness 下跑 SWE-bench Verified,三次平均解决率 39.4%。五轮 RL 之后到 61.5%,涨了 22.1 个百分点,相对提升约 56%。held-out 的三个榜——SWE-bench Pro 37.6%、Terminal-Bench 2.0 31.1%、PatchEval-Verified 47.3%——说明不是过拟合到训练任务上。
39.4 到 61.5,中间没有换模型、没有换 harness。这就是跟昨天的 LEGO-RL 论文拼起来的完整地图:LEGO-RL 说换评测 harness 能差 4.3 倍、换训练配方只差 1.16 倍——harness 决定量级;FrogNano 反过来,把 harness 钉死,让配方在这一档里爬——爬出了 56%。一个管下限的档位,一个管档位里的位置。
教程里多出来的多模态
现在说那个问题。这个部署教程的标题是「多模态 AI 模型|图片识别 + 131K 上下文」。官方 model card 的原话是:
The upstream checkpoint contains image and video input components, but FrogNano did not post-train or evaluate those modalities and does not claim them as supported.
上游权重里带着视觉组件,但 FrogNano 没有训练过、没有评估过、不支持。输入定位一栏写的是纯文本:自然语言指令、源代码、文本形式的工具输出。
那教程里的图片识别是怎么回事?量化社区打包 GGUF 时,把上游的视觉投影模块(mmproj)也一起打了包,llama.cpp 加载它之后确实能吃图。能出图是事实,官方背书也是事实的反面。这很像之前写过的「签名比断言宽」:接口允许你调,不代表这条路有人维护过。教程把模型的「上游残留」当成了成品的「功能」来卖——对一个专门用 RL 练过编码、从没见过多少图文数据的新权重来说,图片识别的效果没有任何保障。
131K 同样有个口径差。官方说的是:评测编码 agent 时,整个交互过程(包括给模型输出的空间)加起来约 131K tokens,单回合最多生成 8,192 个。教程标题把它当上下文窗口卖点,自己的启动脚本却只配了 64K。两头都没错,但放在一起读会让人以为窗口就是 131K。
顺带一个小发现:官方 model card 自己的许可证是自相矛盾的——文件头写着 MIT,正文表格写着 Apache 2.0。以正文为准的话是 Apache 2.0(要继承 Qwen 的上游声明)。
这 1.65GB 里真正值钱的东西
回到部署本身。IQ2_M 量化后 1.65GB,4GB 显卡能跑,教程的环境是 RTX 4080 SUPER,实际更是绰绰有余。一个能在真实仓库里导航、改代码、跑测试的 agent,压进了这张卡——部署坍缩光谱上又落下一档。
但要注意官方自己交代的边界:性能对 Leaf harness 和测试质量敏感;训练数据 Python 为主、英语为主;生成的补丁可能不安全;模型没做过内容安全对齐,原话是「不应被视为已独立完成安全对齐、可无限制自主部署」。
还有一个生态信号:官方权重在 HuggingFace 上被下载了 733 次,第三方量化版(bartowski 打包)是 17,566 次——差着 24 倍。端侧用户从来不是去官方仓库拿权重的,量化生态才是部署坍缩的真实消费端。加上 Qwen3.5 这块底座——昨天的两篇 RL 论文用它训,微软的官方衍生模型从它出发——连续第二天,所有新工作都长在同一棵树上。
教程本身没大错,参数、脚本、步骤都是可跑的。只是下次看到「多模态」三个字,记得查一眼 model card 里那句 unsupported——它不在封面,在附录里。
信源注:微软 FrogNano-4B-2609 官方 model card(HuggingFace,2026-09-22 发布)逐条核对;成绩数字(39.4%→61.5%、held-out 三榜、Pass@3)为 model card 原文;「不支持多模态」为官方原话直引;教程声明来自 xgdn.com/91.html(2026-10-05);下载量数据为 HuggingFace API 实抓(2026-10-06);Leaf harness 代码在 github.com/microsoft/FrogNano;许可证矛盾为 model card 文件头与正文表格直接对比。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。