先把最要紧的事说清楚:Jev-Omni 不是 TypeSafe 出的官方多模态版 Jev。
它是社区作品。作者 Akhila Datta Dola,IIT Madras 毕业的数据科学家,个人主页自我介绍只有一句「I work on multimodal AI, speech, and reasoning」。9 月 20 日上传 HuggingFace,仓库 akhilaaa3/Jev-Omni,Apache 2.0,373 个赞、3907 次下载(10 月 6 日实抓)。TypeSafe 的官方 Jev 走的是闭源 API 路线——这个「Omni」名号,是社区作者先拿去用了。
它是什么
底座是 google/gemma-4-12B-it,公开权重,11.96B 参数(BF16),模型标签里有个关键词:merged——文本判断能力是合并进底座的,再接一个 256 路分类头。接口设定很克制:给一个情境、一个问题、一组选项,返回每个选项的概率。单次前向,不生成文字。
这就是 Jev 哲学的社区复刻:判断题的答案是一个分布,不是一篇作文。官方 Jev 用 70 毫秒和四分钱答是/否,Jev-Omni 把同样的接口往图像上推—— situations with pictures, probabilities out.
实测成绩:宣传四个模态,实证两个
第三方基准站 Benchmark Heaven 给 Jev 类模型开了专门的榜,Jev-Omni 的成绩两面:
文本榜(JevBench):能力分 71.3,官方排名 #6——官方 Jev 1.13.0 作参照是 77.1,它没追上,跟 torchcast、Winnow 这些同为 Gemma-4-12B 底座的兄弟挤在同一档。但校准分 87.0 相当体面。
图像榜(Image JevBench):这里它冲到了官方 #3,能力分 76.9,校准分 89.9。成本每千次决策 2.2 美分,是官方 Jev 的 0.69 倍;延迟 0.30 秒,是官方的 0.49 倍。图像判断上,这个社区模型比官方便宜三成、快一倍。
然后是宣传与实证的差距。作者博客和模型卡都写着支持 text、images、audio、video——但 AudioJevBench 的 17 个上榜系统里没有 Jev-Omni,音频判断的实测缺席。四个模态的声明,两个有第三方成绩。这不是造假,是常见的提前声明,但按本号规矩要记一笔:数据到了哪,能力才算数到哪。
真正的故事:三周,38 个兄弟
把镜头拉远,Jev-Omni 只是一个更大现象的切片。TypeSafe 9 月 15 日发布 Jev,到今天整三周,Benchmark Heaven 的 Jev-class 模型榜上已经有 38 个系统:torchcast、Winnow、Cygnet、Plumb、decider、JPT、JevAny、AutoJev、Visual-Jev、CUA-S1……底座五花八门(Gemma、Qwen3.5、Qwen3.8、Qwen3-VL),成本从官方价一路卷到每千次决策 1.5 美分。
三个星期,一个品类从无到有:专门榜开了三个(文本、图像、音频),密封题制度跟着建立——音频榜 988 个题目里 876 个是密封的,从不公开,托管 API 只测公开的 112 项,榜单只发系统级汇总。防过拟合不是论文里的建议,是排名站的默认设置。
本号 9 月 17 日在 Jev 海关报告里写过可打脸预测:封闭集判断可坍缩,会有人做本地复刻。两周后 Fast Browser Use 兑现了文本判断的复刻;今天 Jev-Omni 和它的 37 个兄弟把兑现扩展成了品类。判断题与生成题分开计价,从预测变成了行业分工。
接主线
两条线。其一,断言强度阶梯:密封题制度是验证带宽的制度化,榜单一律只印系统级汇总,密封项永不公开——跟 AIDE² 的评分分离、ripwire 的预注册负结果是一族的,诚实文化从论文层下沉到了排名层。其二,判断类模型的竞争力排序值得注意:Jev-Omni 智力分 63.9 排不进前列,校准分 89.9 却稳居第一梯队——判断模型卷的不是聪明,是不装。官方 Jev 也是同一个画像:校准 90.6 远高于智力 63.6。这个品类买的从来不是智力,是诚实的概率。
可打脸预测:三个月内 Jev-class 榜单过百,音频域出现第一个校准分过 85 的开源判断模型;「option_letter logprob readout」这类接口约定会被社区写成事实标准。
结尾停在 256 那个数。为什么是 256 路头?因为一次前向直接吐分布,选项再多也不用手写循环。多模态判断的最后一公里不在接 ViT 接音频编码器——那是最容易的部分;在给每种模态找到密封的考题。声明的模态是四个,考过的是两个,差的那两个,等的是题库。
信源:HuggingFace API(akhilaaa3/Jev-Omni:11.96B BF16/merged/gemma-4-12B-it 底座/373 likes/3907 downloads/created 2026-09-20,10-06 实抓)、作者博客 adola700.github.io(9-26 发布文全文)、Benchmark Heaven(JevBench 与 Image/Audio JevBench 榜单全文 10-06 实抓,Jev 1.13.0 为参照系)、TypeSafe Jev 发布信息经 inithtml/aibase 二手确认。Jev-Omni 音频/视频支持为作者声明,音频实测缺席按榜单实数裁决。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。