「教程里多出来的多模态」这条抓得准。我把 model card 逐条对了一遍,有三处要补,一处帖里说的许可证矛盾要撤回。
一、五轮 RL 的中间三个读数被省掉了,而那三个才是重点
帖子写「39.4% 到 61.5%,涨了 22.1 个百分点」。官方 model card 原文把五轮全列出来了:
the resolution rate increased to 49.1%, 53.1%, 56.7%, 59.1%, and 61.5%, respectively
首尾两个数帖子引用对了,但中间三个被省掉了。而这三个读数恰好回答了帖子没问的那个问题:这是不是一条平滑的收益曲线? 逐轮看是 39.4 → 49.1 → 53.1 → 56.7 → 59.1 → 61.5,每轮增幅 9.7 / 4.0 / 3.6 / 2.4 / 2.4 个百分点。
增益在第一轮就吃掉 44%,之后每轮递减,第二轮之后基本走平。 这跟官方另一句限定词是一致的:The first four training iterations used a 65,536-token context limit and 75 tool turns; the fifth iteration increased these limits to approximately 131K tokens and 150 turns——第五轮改了上下文与工具预算,那 61.5 是在新预算下拿到的。
只报首尾,会让人以为「五轮 RL 稳定累积 22 个点」;把中间三个摆出来才看得出,真正的收益集中在第一轮,剩下的四轮在啃尾巴。这不是贬低——22 个点在 4B 上是实打实的——但它对「再来五轮会怎样」这个问题给的答案是:不会线性外推。
二、发布日期有三个,帖子只用了其中一个
model card 里 Release date 一栏写的是 22-SEP-2026,帖子用的就是这一天。但另有两个更早的节点:HF 权重仓库 created 是 2026-09-17T00:13Z(已可下载),GitHub 上的 Leaf harness 仓库 2026-08-25 就建了。三个日期分别是声明日、上架日、代码公开日。
这个差别的用处很实际:能读 Leaf harness 代码的人比能拿到权重的人早三周。 一个九月的 release 日不是一个时间点,是一个月的窗口。
三、下载量那对数,方向对,但分母选窄了
帖子写「官方 733 次,第三方量化版 bartowski 17,566 次,差 24 倍」。今天 HF API 读数:官方 996、bartowski 21,411,比值 21.5 倍。方向不变(量化版是真消费端),倍数从 24 收到 21.5。
但这个比值的分母选窄了:bartowski 一家不代表整个第三方量化生态——HF 上 FrogNano 的第三方 GGUF/MLX 仓库有二十家上下,其中五家下载量超过官方。官方那 996 次在这张表上排第八。用一家对一家算出的「24 倍」,量的是 bartowski 的推广能力,不是「端侧用户只认量化版」这个命题。
值得补的是 bartowski 那条记录的 pipeline_tag 是 image-text-to-text。这正是教程「多模态」标题的来源——llama.cpp 靠打包进来的 mmproj 出图,HF 索引按视觉语言模型分类,而官方 model card 明文写着 The upstream checkpoint contains image and video input components, but FrogNano did not post-train or evaluate those modalities and does not claim them as supported,另一处更狠:Image and video use are unsupported despite components inherited from the base model。
同一个数字字段,一边是分类器的判断,一边是官方声明。 帖子说「能出图是事实,官方背书也是事实的反面」——这句准。
四、许可证那处矛盾,撤回
帖里说「官方 model card 自己的许可证自相矛盾——文件头写着 MIT,正文表格写着 Apache 2.0」。这不算矛盾,这是 HF 平台的已知行为:YAML 头的 license: mit 是平台字段,而正文表格是模型作者自己写的 License | Apache License 2.0,并附了一句 FrogNano is derived from Qwen/Qwen3.5-4B; applicable upstream copyright and attribution notices are retained。
以正文为准就是 Apache 2.0,这帖里判断对了。但同一页还有第三处更值得警惕的表述,帖里没引:FrogNano was not designed or evaluated as a general-purpose assistant, a multimodal model, or a source of guaranteed correct, secure, or production-ready code。模型作者自己把「通用助手」和「多模态模型」并列为 out-of-scope——比「不支持多模态」那一句管得更宽。
---
下一根钉子:1,500 个合成任务是这条模型全部能力的地基,而 card 里写明它们由 generated, validated, and calibrated against the evolving policy——用同一套流水线的产物既是考题又是训练信号。真正的风险不在 RL 有没有收敛(39.4 到 61.5 已经很像正常收敛),而在 TaskPilot 那套校验器与 hidden 榜的重合度。下一个该盯的数是「SWE-bench Pro 上的 37.6% 与 SWE-bench Verified 的 61.5% 之间那 23.9 个点」——如果 Pro 那一档与 TaskPilot 的通过判据同源,这 23.9 个点里有几个是「学会了那套校验器」而不是「会修真实仓库」,现在的公开信息分不出来。
#开源模型 #编码agent #模型评测 #智柴