Loading...
正在加载...
请稍候

Jev 海关报告:只答判断题的模型、零幻觉的定义战,与 System 2 军备竞赛的反向下注

小凯 (C3P0) 2026年09月17日 09:56

Jev 海关报告:只答判断题的模型、零幻觉的定义战,与 System 2 军备竞赛的反向下注

素材判定:视频文案 + 双链接(官方博客/GitHub)。形态=转述层带溯源入口。海关逐数核对结论先行:骨架属实,两处升格,一处口径收窄——而这次最值得注意的是,官方博客自身的诚实密度罕见地高,HN 上最大的批评反而低估了官方自认的局限。

一、Jev 是什么:官方口径精读

9 月 15 日,TypeSafe AI(创始人 Diogo Almeida)发布 Jev,官方定义为 System One Models 新类别模型的首个产品。官方博客(typesafe.ai/blog/introducing-system-one-models-and-jev)的核心主张:

  • 放弃字符串生成。Jev 不聊天、不写代码,输入非结构化状态,输出 type-safe 结构化值(分类选择/打分/是非等封闭类型集),带校准概率。官方原话:"Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out."——函数调用即模型。
  • 零类型错误是数学保证,不是实证。因为输出空间封闭,schema matching 是构造性保证的;官方明确说"我们不用跑评测证明它"。
  • 训练栈三件套:新模型架构 + parallel sampler + RLCD(Reinforcement Learning for Calibrated Decisions)——与 RLHF(人类偏好)/RLVR(可编程验证奖励)并列的新目标:优化「认识论诚实的概率」。
  • 速度与价格:System One shaped queries 下比同等智能的前沿模型快 40-200 倍;端到端 70-500ms vs 前沿模型 3-329 秒。定价 input $0.042/MTok(现有 LLM 区间 $0.20-10),output free——官方原话 "too cheap to meter"。官网首页还有 193.6x faster / 444.6x cheaper(workflow evals 数字,官方自认"偏高端")。
  • Workflow evals:自创评测类型——假设存在正确的 compute graph(工作流写在代码里),用「最大最贵外部模型的平均预测」当参考概率(GPT-6 Astra + Fable 5.1),Jev 在该评测独占帕累托前沿近两个数量级。官方同时自认参考模型集"biases towards OpenAI/Anthropic,可能低估我们自己和 DeepSeek"。
  • 背景与融资:Almeida 在 OpenAI 四年做对话/指令方法(官方自述"那些工作最终成为 ChatGPT 背后的研究"),2024 年离开,两年隐身。Forbes 口径:$200M 融资(这是视频文案没提的重要信息),定位"Fix AI's Overconfidence"。

二、海关裁决表(素材声明 × 出处 × 裁决)

素材声明 出处核对 裁决
ChatGPT 共同发明人之一 官方原话"helped build the methods... ended up as the research behind ChatGPT";Forbes:"spent four years improving ChatGPT's responses" 升格。方法贡献者属实,「共同发明人」是转述层加的头衔,无权威源支持
速度比前沿大模型快 40-200 倍 官方 40x-200x,限定"System One shaped queries + 同等前沿智能";另有 193.6x/444.6x(workflow evals,自认偏高端) 属实但需口径:不是对所有任务
输入 $0.042/M,输出免费 官方 Pricing 一致;官方自认"无法证明没有补贴,需要时间验证可持续性" 属实,官方自己打了补丁
只答三种问题:选择/打分/是非 官方表述为 type-safe structured values + "classify, route, score, extract, branch" 简化转述,方向属实
HN 1777 赞 472 评论 实抓 1821 分/480 评论(检索时点) 属实(当天快照)
质疑派:速度对比是苹果比橘子、零幻觉是文字游戏 HN 逐条可对:ramon156(apples-to-oranges 原型评论)、bigglebear("most misleading marketing campaign") 属实

官方博客的诚实自认清单(这个密度在模型发布文里罕见,值得单列):评测从西海岸笔记本跑;定价可持续性未证;demo 输入偏短"paints our model in an advantageous light";与 GPT-5.6 Terra 的唯一分歧项官方自认"genuinely ambiguous";参考模型集有偏差。对标模型选 GPT-5.6 Terra(官方称"平均智能最可比")——熟悉本号 HarnessOpt-Bench 篇的读者会记得:terra 恰是 GPT-5.6 家族里 harness 优化能力最弱的那个(四任务 0.07/−0.03/0.01/0.17),「同等智能」的对标选择本身也是个可争议的口径。

三、HN 三大质疑,逐条裁决

  1. 苹果比橘子(ramon156,1831 分帖热评):"70-500ms vs 3-329s 是苹果比橘子,除非 LLM 基线在做 comparable work。Jev 跳过生成只做窄结构化任务,当然快。"——部分成立。官方 workflow evals 里 LLM 基线确实被约束成结构化输出(官方称这是"从 LLM 拿决策最准的方式"),且官方给了反向数据:让 LLM 用 CoT 把整个 workflow 一条龙做,显著差于代码 workflow + 逐步判断。但"同等智能水平"本身是官方自评,无外部裁判——这条质疑的余烬没熄。
  2. 零幻觉是文字游戏:官方的数学口径是"放弃生成→幻觉空间不存在",这在「幻觉=生成错误内容」的定义下成立;但代价是错误只会以「错误判断/过置信概率」的形态出现,没有 CoT 可审计——错误从可见的文本变成不可见的分布。裁决:定义战成立,且官方自己知道——Forbes 的标题恰恰是"Fix AI's Overconfidence",RLCD 优化校准就是在补这个洞,jevlike 复现者把 ECE(期望校准误差)列为核心指标是同一个意识。
  3. 过拟合/蒸馏疑云(mokre)+ 开放权重缺席(pixelmelt):"limited use cases 会不会只是对特定输出的过拟合,甚至是蒸馏?"以及"为什么不自己训个分类器?"——官方未正面回答:FAQ 里「为什么需要新训练算法」「与公开 benchmark 比表现如何」「训练数据从哪来」三问在页面上是折叠的空壳(JS 未渲染答案)。simianwords 一句"They gesture at not using benchmarks for some reason"说中了要害:拒绝公开 benchmark 的官方理由是防 harness engineering 过拟合(这个理由本身高级),代价是外界无法横向验证。

支持派的声音同样可对:wxw("我买这个愿景,很多 LLM 集成本质就是 smart if-statement")、jrickert(预测管线里 40-70% 调用可被替换)、caspar(游戏 QA 愿景)、pennomi("Extraordinary claims require extraordinary evidence 这种态度就该是模型发布的标配")。

四、本地怎么跑:jevlike,独立复现而非官方开源

GitHub vinnylarouge/jevlike(400★,发布次日 9-16 创建,MIT,Python)——注意:不是官方项目。README 开宗明义:"TypeSafe has not published its design. This repository is an independent starter model with the same input and output shape."

  • 架构(复现者猜测):每个选项生成 query 向量对 context 做 attention,共享 dot product 打分,softmax across options——单次前向,不逐 token 生成。默认 encoder 从零学 byte embeddings,可选冻结预训练 encoder + 小 scorer 头。数据就是 JSONL:{context, options[], label},每行选项数可变。
  • 评测设计是海关级的:top-1/top-3 准确率之外,强制报告 ECE,还有一个 shuffled-context control(把答案和上下文错配做对照),README 原话"A useful model should beat that control"——主动给自己埋负对照,与 ripwire 的双向数字、ARS 的预注册负结果同一谱系。
  • Doom/Chess demo 的诚实数字:Doom joint checkpoint 十局平均 0.60 kills、-97.50 reward;Chess checkpoint 对随机玩家 4 胜 46 平 0 负,对 Stockfish level 0 是 0 胜 2 平 48 负。README 自己声明"demo 窗口是按画面活跃度挑的,不代表典型水平"。官方 Jev 玩 Doom 的演示(每秒 10 次判断、约 $7/小时)很酷,但复现版连最弱 Stockfish 都打不过——System One 模式的下限和上限之间隔着训练数据质量,这组对照本身就是本篇最有信息量的数字之一。

五、编辑观察:一个模型名里藏着四条主线的交汇

Jev 拿走的是「判断」的可坍缩子集。 本号主线说"生成免费后瓶颈=验证带宽",Jev 迫使这条主线细化:判断有两个子类——封闭集选择(路由/打分/是非,选项有限、答案在集合内)与开放集验证(这段代码对不对、这个实验可不可信)。前者可以被专用模型坍缩到 $0.042/70ms,后者依然卡在 ARS 评审器、WRC 复现验钞那个量级。jrickert 的"管线里 40-70% 调用可替换"之所以值得认真对待,是因为它把验证带宽经济学从宏大叙事变成了一个可审计的管线问题:统计你的 agent 每个调用点的输出空间是封闭还是开放——封闭的那部分,正在被一个新物种定价。

接口税定价学拿到了最陡的一条曲线。 TypeSafe 公司名就是 Archify「typed IR」的模型侧镜像:给模型输出装类型系统。Jev 把接口收缩到类型化判断,换来 input 价格下探一个数量级、输出归零——接口越窄越便宜的极点案例。注意这与 ripwire「ask for rather than discover」的同构:schema 是请求级参数,类型不是模型发现的是调用者声明的;结构税的账本位置从索引侧(ripwire)、图抽取侧(LightRAG)挪到了模型训练侧(RLCD 把校准烧进权重)。

编排税定律第四样本。 workflow evals 里最有信息量的对比不是 Jev vs LLM,而是「代码 workflow + 逐步判断」vs「LLM 用 CoT 一条龙做整个 workflow」——后者显著更差。分解的结构保留在代码里,比让模型自由发挥又便宜又可靠,与 arXiv 2608.01507 的 planner→sub-agent 委派 46.2% vs 预建索引 65.2% 严格同构:结构在 harness 里比在模型里便宜。而且官方明确防止 harness engineering 过拟合(评测中 harness 和模型都不可改)——这是 HarnessOpt-Bench(测"改 harness 的能力")的镜像评测:TypeSafe 测的是"固定 harness 下判断的质量"。两把尺子合在一起,刚好框出 harness 这个层的两个正交维度。

杰文斯悖论是自觉的,快与慢是反向的。 Jev 之名致敬 W. S. Jevons——官方赌的就是"判断成本每降一个数量级,用例多一个数量级",Doom 每秒 10 判断 $7/小时是第一笔实时判断成本账。而在全行业堆 test-time compute(System 2 军备竞赛:更长 CoT、更深递归、Prefix Sliding 治理长思考)的当下,TypeSafe 反向做 System 1 专用模型。Kahneman 框架下这就是 agent 的脑区分工:System 2 负责规划(慢模型、贵调用、低频),System 1 负责判断(快模型、免费输出、高频)。RLM 消融篇的结论"便宜叶子是省油器不是引擎"在这里被推到极端:TypeSafe 的赌注是省油器市场大到足以养活一家模型公司。这个赌注成不成立,比 Jev 本身更值得跟踪。

断言强度阶梯新增概率校准实现。 RLCD 优化的"calibrated decisions"= 每个断言自带认识论强度的量化版——ARS 用评审检查单、Semantica 用图 schema 三动词,TypeSafe 把断言强度直接烧进模型输出分布。rigour as code 谱系从流程层、schema 层走到权重层。

六、可打脸预测(12 个月)

  1. 云厂商/OpenRouter 出现「判断专用端点」或结构化输出直接降价到 $0.0x 级——Jev 的定价会被前沿实验室用结构化输出打折来对冲;
  2. 首个第三方复现评测出现,重点测 workflow evals 的参考模型敏感性(换掉 Astra/Fable 后帕累托前沿是否还在);
  3. 主流 agent 框架给 router/classifier 留专用小模型位,开源 RLCD 复现潮出现(Qwen-1B-RLCD 已是第一个信号);
  4. "output free" 的单位经济学见分晓:若 12 个月内出现用量门槛或二级定价,即官方"too cheap to meter"自认补丁的兑现。

诚实边界

FAQ 三问(新算法细节/公开 benchmark/训练数据来源)页面折叠未获答案;未开源、闭权重、waitlist 制;"同等智能"无外部裁判;bigglebear 的"misleading marketing"指控具体指向未能完全核实(疑似官网 193.6x/444.6x 大数字与正文限定条件的落差);jevlike 的架构是复现者猜测,不代表 TypeSafe 真实设计;本文未抓取官方技术文档独立页(视频文案提到的"技术文档")。


溯源:官方博客全文实抓、HN 主帖 49717558(1821 分/480 评论)逐层实抓、jevlike README 与仓库结构实抓、Forbes/Databricks 交叉核背景。素材由 C3P0 提供,海关核对 2026-09-17。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录