Jev 生态一个月:官方自曝、开源抄接口、独立基准把官方排到第四

「Jev 海关报告」第三篇。第一篇在 09-17,讲它只答判断题的定义战;第二篇在 09-26,讲四个可以直接抄的用法。这次是一包链接:官网、发布博客、官方易错文档、三个开源平替、一场五百多条评论的 HN 讨论。全部读完后,最值得讲的不是 Jev 本身,而是它落地一个月里长出来的生态——官方在自曝,开源在抄接口,独立…

「Jev 海关报告」第三篇。第一篇在 09-17,讲它只答判断题的定义战;第二篇在 09-26,讲四个可以直接抄的用法。这次是一包链接:官网、发布博客、官方易错文档、三个开源平替、一场五百多条评论的 HN 讨论。全部读完后,最值得讲的不是 Jev 本身,而是它落地一个月里长出来的生态——官方在自曝,开源在抄接口,独立基准把官方排到了第四。

先把话说直:Jev 是 TypeSafe(创始人 Diogo Almeida,前 OpenAI,自述做过 ChatGPT 背后的指令跟随研究)九月十五号发布的「System One 模型」。不聊天,不生成文本,吃进一段非结构化状态,吐出一组带类型的概率判断:Noul 是是不是,Choice 是选哪个,Score 是几分。输入定价 0.042 美元每百万 token,输出免费,典型延迟 70 到 500 毫秒。HN 上那条发布帖拿了 1989 分、518 条评论,是九月讨论度最高的事件之一。

评论区的第一条热评把定义权抢了:这基本上就是个零样本分类器,吃原始文本,吐类别,准确率号称追平前沿大模型。热评下面的回复更有意思——署名 CompleteSkeptic 的账号回了一句 exactly right,然后接住这个词往上加了一层:「zero-shot + general == programmable」,零样本加通用等于可编程。这个账号在帖子下面回了二十四条,是全场最活跃的人;后续楼层里有人把它在 X 上的同款回应贴出来,标注是创始人的答复(身份链是社区转引,HN 上发帖的 albelfio 全程零评论)。被社区用最朴素的词定义,然后借这个词把故事讲得更大——这是这个月生态里第一件值得记的事。

第二件是官方的自曝。TypeSafe 的文档里有一页叫 model jaggedness,专列 Jev 1.13 的已知缺陷,页眉写着「许多问题会在后续版本修复」。八类失败模式摆在明面上:字面读题(你以为它懂你的意图,它只懂你的字);数学和数数不行,这一类下面还挂着四个子条,官方的原话是「Jev is not a calculator」,算数请用代码;日期是文本不是有序量;状态里塞无关细节会拖垮精度(官方自己管这个叫 context rot);状态里的注入内容能改变答案,因为它默认状态是数据不是敌人;标准与指令冲突时会出乱子;选项顺序影响答案,且偏向第一个;最后一条最直白——需要生成文本的话,用别的模型去。

这份清单里藏着一整门方法论。数数用代码、算术用代码、日期运算用代码——判断归模型,计算归代码,分工写成了明规则。这正是九月本号那篇实操报告里「判断题和生成题分开」的官方版。而清单里一半的病(字面读题、context rot、选项顺序偏差)是语言模型的老病,说明这个「非自回归新物种」的底子仍然是 transformer 式的语义理解——HN 上有人追问引擎盖下是不是还是 transformer,官方没有回答,但这八条自曝已经画出了轮廓。

第三件是开源圈的动作,这条最猛。仓库三个,建仓时间连着排:SemIf,九月十六号,四千七百星,口号是「在你家的 3090 上跑 semantic ifs」;Laya,九月十八号,三万一千星;JevBench,九月十九号,独立基准。注意 09-17 本号那篇 Jev 报告里放过一个预测:TypeSafe 云 API 会被开源逆向复刻,十四天内兑现。实际兑现得比预测还快还狠——三天三个仓库,一个月后 Laya 三万一千星。而且复刻的不是壳,是接口:choice、score、noul 三个原语名照搬,Laya 的 HTTP 服务直接兼容 Jev 的线上协议,路径名都是同款 /v1/systemone/batch,老客户端换个地址就能跑。Jev 的 API 在一个月里成了事实标准,跟它竞争的产品在向它对表。

三个仓库各有各的诚实。Laya 的 README 专门有一节叫 Where Jev leads:高基数标签上它崩——Banking77 数据集七十七个标签,Jev 得 0.870,Laya 只有 0.425,原因是自己的架构把选项塞进固定 token 预算,每个标签分到三四个 token,字都分不清。同一节里也反向记了 Jev 的账:DAIR Emotion 数据集上 Jev 给 16% 的样本的真标签打了零概率。自己的短板和对手的长处印在同一页上,这是「双向数字都印」的工具级样本。SemIf 更学术:冻结一个 40 亿参数的 Qwen,一次前向直接读选项位置的 logits,零 token 生成,3090 上 21 个判断一秒出头跑完;对着 TypeSafe 公开评测的子集,4B 模型一致性 0.845,Jev 公布值 0.883,换成 270 亿参数的底座能到 0.958。它把话说得很清楚:复现的是接口模式,不是那个未公开的模型和训练。

第四件,独立基准来了。JevBench 用密封的私有保留集防刷榜,公开集和密封集表现差超过 25 个百分点要扣分,成本按每一千次决策计价——注意,不是按 token,是按决策。最新的榜单上 95 个系统参与,第一名 Imajev-4B 得 67.37,第二名 Plumb-4B,第三名 decider-4b,TypeSafe 官方的 Jev 1.13 排第四,63.29。官方模型在一个「以它命名的品类」的基准上被开源 4B 模型压到第四。基准作者也留了一句给自己的话:公开的那半会被拿来训练,私有的那半会跟着领域一起进化。

把官方的评测站也放进来对账。TypeSafe 自己的工作流评测页摆了十四个模型配置跑四个真实任务:Jev 平均 67.8% 准确率,每案 0.0004 美元,0.4 秒。精度比它高的有——sol 74.1%,opus 5 73.1%,前者每案 8.4 美分慢 58 倍,后者每案 17.6 美分慢 94 倍;精度跟它几乎持平的 terra 也要 3 美分、慢 25 倍。所以 Jev 卖的从来不是精度冠军,是单位成本上的精度。博客首页那两个「193.6 倍更快、444.6 倍更便宜」,按评测站的平均口径算是 94 倍和 440 倍——首页数字是官方自己标注的「偏高估计」。还有一条被忽略的普遍律藏在同一张图里:每一个模型,工作流模式都比裸提示模式更准、更便宜、更快,haiku 4.5 从 18.1% 跳到 53.6%。结构化拆解这一手,谁用谁涨。

最后是谱系。HN 的考古队翻出来的不是新鲜事:BART、DeBERTa 那一代 NLI 模型做零样本分类好几年了,有人直接甩了 deberta-v3-large-zeroshot 的链接说「他们底下用的就是类似的东西,博客里跟大模型的对比有水分」。这个谱系再往上走一步就是 BERT——素材包延伸阅读里那篇 1810.04805。从 BERT 到 encoder 零样本分类,再到今天 Laya 在 ModernBERT 上用强化学习直接把「判断」训练成优化目标,三十毫秒的单次前向,这条路走了八年。Jev 的贡献不是发明了判断,是把判断做成了有类型、有价格、有 SLA 的接口。而 Laya 作者的先发主张要打个对折来看:他 2025 年三月的 arXiv 论文(SalesRLAgent,2503.23303)是真的,但那是垂直的销售转化预测,离水平通用的 typed 决策还有距离;第二篇论文的 arXiv 标题是置信感知路由,和他在文章里说的「schema 决策框架」也对不上口径。核心思想的先发成立,同一件事的先发不成立。

一个月,一个模型长成了一个生态位:官方文档教你怎么避开它的边界,三个开源仓库把接口抄成标准,独立基准用防刷榜机制把官方排到第四,HN 用八个字给它定了性、创始人借这八个字把故事讲大。JevBench 榜单上那个数字值得再读一遍:63.29 对 67.37,官方对开源 4B。判断这个动作的护城河,正在从模型能力滑向接口和价格。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens