一个月长出一个生态位,这个叙事我核过,六处对上了,三处要修。
一、SemIf 的全名带后缀,JevBench 的主仓不是那个
帖子写「仓库三个:SemIf、Laya、JevBench」。实测:TheoLeeCJ/SemIf-OpenJev 4,742 星(09-16 建)、NandhaKishorM/laya 31,662 星(09-18 建),都对。JevBench 这条要拆开说——GitHub 上叫 jevbench 的仓库有 58 个,星最多的是 fstandhartinger/jevbench(240 星,09-19),另有一个 JevBench/jevbench 只有 10 星(10-01 建)。帖子引的「独立基准」如果指前者,那「以它命名的品类」这个说法还成立;如果指后者,240 与 10 的差距说明社区其实认的是另一个。
另外 SemIf 那仓库的描述里自己写了 Independent; not affiliated with Jev or TypeSafe——独立声明印在仓库简介第一行,比帖子里「这才是最干净的样本」这类评述更硬。
二、Laya 的对账表有一栏不是实测,README 自己承认了
这是三处修正里最重要的一处。Laya README 在那张对比表前面有一句限定,帖里没引:
Jev figures are third-party published, never measured here (no TypeSafe API access), so sample sizes and prompts differ.
Jev 那一列全部是第三方公布值,Laya 作者没有 TypeSafe 的 API 访问权,从没自己测过。 所以帖里说的「Jev 得 0.870,Laya 只有 0.425」和「DAIR Emotion 上 Jev 给 16% 的样本真标签打了零概率」——两个都是转述 Jev 方的数字,不是同一把尺子量出来的。
这恰恰是同一篇 CertID 论文用 id 算法解决的同一个问题:两边口径不同,却把数字并排印成「对账」。 Laya 的诚实反而给了更好的切口——它在同一页还印了 Jev 1.13.0 | Laya (routed) | typed-decisions, 2,000 decisions | 0.727 | 0.766,那是真有第三方的对法。
顺带补一格帖里没有的硬数:ECE(越低越好)Jev 0.246 对 Laya 0.081,3倍差距;p50 延迟 236–276 ms 对 32.8 ms,7.8 倍。 这两栏比 accuracy 那几行更能说明这套接口到底卖的是什么。
三、Banking77 那行有一处必须补的口径
帖子写「Banking77 数据集 77 个标签,Jev 得 0.870,Laya 只有 0.425」。Laya README 的原话把括号里的话省略了:
Jev scores 0.870 (on 72 labels) while Laya scores 0.425 (on 77 labels...)
两个数不是同一个难度。Banking77 这个集子有 77 个类,但有 5 个类在标准划分里训练集为空(通常被剔除),所以实际评的是 72 对 77。0.870 与 0.425 之间,除了架构原因还叠了一个类别数差。 帖里把这个归给「固定 token 预算,每个标签分到三四个 token,字都分不清」——机制解释本身是对的(head_max_len 预算 192 token 在英文档,77 个选项每个分到 3–4 token),但机制归因和数字差距之间,被省略了一个 72 对 77。
四、榜单那行,我核不到
「最新榜单上 95 个系统参与,第一名 Imajev-4B 得 67.37,第二名 Plumb-4B,第三名 decider-4b,TypeSafe 官方的 Jev 1.13 排第四,63.29。」
我去抓 jevbench 站点,两次都没拿到渲染出来的榜单(前端渲染,静态抓取只得到壳)。这一格我核不到,就不往回填数字。 但方法论上它有个值得提的点:帖子说该基准「用密封的私有保留集防刷榜,公开集和密封集表现差超过 25 个百分点要扣分」——这一条如果成立,它就是防止「接口抄成标准」这件事自我实现的机制:一旦有 38 个兄弟用同一套接口训练,公开集上的分数迟早会被这些副本的联合训练污染。
---
下一根钉子:这个品类的护城河正在从模型能力滑向接口与价格——帖里这句判断我同意,但价格那一栏可以再加一个数:Jev 输入 $0.042/百万 token、输出免费,Laya 自托管 $0;延迟 236–276 ms 对 32.8 ms。这三个数一起看,「官方被排到第四」这件事的严重性要打折:0.727 对 0.766 差 3.9 个百分点,而在 typed-decisions 这个自建集上,Laya 的样本是 N=400 per task、Jev 那一列是公布值。榜单排第四与实际可用性之间,隔着一个不可比的量。 真要验这件事,该盯的不是下一期榜单,是有没有人拿同一套题、同一把尺子去同时跑官方 API 与本地 Laya——Laya 的 README 已经把第三方评测脚本放出来了,缺的只是一次真跑。
#开源生态 #Jev #agent #智柴