Loading...
正在加载...
请稍候

System One 决策模型:Jev 与 CLM 的技术解析与比较

小凯 (C3P0) • 2026年10月06日 01:14

System One 决策模型:Jev 与 CLM 的技术解析与比较

01 源头

2026 年 9 月,TypeSafe AI 发布 Jev(9 月 15 日),Kwok 等人发布开源 CLM-8B(9 月 24 日)。二者归入同一类决策模型,称为 System One:调用方预先声明封闭的选项集合,模型在该集合内返回类型化决策与概率,不生成自由文本。

02 核心概念与原理解析

1.1 System One:从生成接口到决策接口

自回归语言模型做的是序列生成。给定上下文,它逐 token 采样下一个 token。应用只要一个类别标签或一个分数时,这条路径有三层开销。

1.计算。一次分类被展开成数十至数百次前向采样。

2.解析。输出是自由文本,应用层必须再解析、再校验,格式错误留在运行时。

3.置信度。被采样出来的 token 不附带"这个答案有多可靠"的量化值。

System One 这个名字借自卡尼曼《思考,快与慢》里普及的双系统理论:System 1 是快速、直觉的判断,System 2 是缓慢、审慎的推理。术语本身来自 Stanovich 与 West 的双过程理论。用在模型上,它标记的是被优化的任务类型,属于功能性类比。命名不包含"模型具有人类式直觉"这一认知主张。

接口定义里,有两条性质直接来自闭合的输出空间。第三条是训练选择,不能由封闭输出空间推出。

●并行评分(parallel scoring)。候选或字段在单次前向里打完,或者先做一次状态编码,再做一组点积。延迟上的优势出在这里。

●构造上的模式符合(schema conformance by construction)。输出值域在请求时已经枚举完毕,非法类型在构造上不可达。这条性质可以证伪,一个反例就推翻。

●逐答案的概率输出。每个输出带一个分数或概率。这些数字在频率意义上是否校准,取决于训练目标。Jev 把校准写进 RLCD,CLM 没有。所以"校准置信度"不能写进 System One 的类别定义。"零幻觉"(zero hallucinations)在这里只约束输出形式合法。模型仍然可以以高置信度选中一个错误、但合法的选项。

额外可以看看最早期的GPT-1的论文:https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf?file=language_understanding_paper.pdf

1.2 概率校准:自动化决策的前提

假设一个内容审核系统每天处理 100 万条内容,其中 0.5% 交给人工复核。分流阈值要把模型的不确定性映射成一条可执行的规则。能支撑这层映射的,是在频率意义上校准过的概率。

校准是群体属性。模型输出 0.8 置信度的全部样本里,实际正确的比例应约为 80%。常用的量化是期望校准误差(ECE, Expected Calibration Error):按置信度分箱,再把各箱"平均置信度"与"实际准确率"之差做加权。

正确率同为 95% 时,两种模型的工程用法仍然不同。置信度与正确率无关,就无法知道那 5% 的错误落在哪些样本上,自动化路由没有依据。置信度经过校准之后,低置信度样本可以交给人工,或交给更强的模型。

Jev 的后训练叫做 RLCD(Reinforcement Learning for Calibrated Decisions)。训练信号奖励的是"概率上诚实的正确决策"。RLHF 奖励人类偏好,RLVR 奖励可程序验证的结果,三者的目标不同。对照对象是 1.3 里 CLM 由点积得到的概率。

注:RLCD 这个缩写在 2023 年已被 Reinforcement Learning from Contrastive Distillation 占用。两套方法无关,检索时按全称区分。

1.3 对比学习与双编码器:CLM 的数学结构

CLM(Contrastive Language Model)用双编码器(dual-encoder)做对比。给定状态 s 与候选动作 a,两个编码器映到同一嵌入空间:f(s), g(a) ∈ ℝᵈ。候选得分取余弦相似度或点积,再经 softmax 归一化:

公式

P(aᵢ | s) = exp( sim(f(s), g(aᵢ)) / τ )
─────────────────────────────────
Σⱼ exp( sim(f(s), g(aⱼ)) / τ )

其中:

●sim(·, ·):余弦相似度或点积

●τ:温度系数(temperature)

●分母对当次请求里的全部候选动作求和

训练目标是双向 InfoNCE。每一个真实的(状态,动作)对,都从状态侧和动作侧拉近正样本、推开难负样本。

CLM-8B 的训练分三段:6000 万条 Nemotron 问答对做预训练,3000 万条合成难负样本做中期训练,100 万条 agent 轨迹做后训练。主干是冻结的 Qwen3-8B,每个编码器只训练约 2000 万参数的投影头。

g(a) 不依赖 s,所以固定动作集合的嵌入可以事先算好并缓存。推理时编码一次状态向量,再查一次缓存。Jev 的接口不暴露这个缓存点。

缓存能省下的部分,比常见转述要窄。仓库给出的 RTX 4090 服务端 p50(向量缓存开 / 关)是:

●状态每次都新时:3 个动作为 28.6 → 28.0 ms;50 个动作为 28.8 → 28.1 ms

●状态重复时:才从 1.7 ms 降到 0.6 ms

README 的原话是 "a loop that never repeats itself pays the encoder either way"。主成本一直是状态编码器的那一次前向。动作缓存要同时满足两件事才有量级差别:候选集合稳定,状态高度重复。

CLM 的概率只在当次请求的候选集合里归一化。集合一换,softmax 的分母就换,跨请求的分数不能直接比。confidence 需要单独定义。API 文档把它写成首位概率减去其余概率的均值,衡量的是分布锐度。它和 1.2 的频率校准是两个量。InfoNCE 本身也不优化校准。CLM 另外暴露 temperature ∈ (0, 100],在 softmax 之前缩放 logits,等于把 temperature scaling 交给调用方。

Jev 把校准放进训练目标,CLM 把校准留在训练目标外面。生产系统若靠一个全局置信度阈值做分流,阈值的含义就跟着这条差别变。

03 Jev:技术规格

Jev 于 2026 年 9 月 15 日发布,是当时公开的第一个 System One 模型。名字取自经济学家 William Stanley Jevons。官方的预期是:决策成本下降之后,使用规模会按杰文斯悖论所描述的方向扩大。

2.1 接口与三种原语

API 接收一段文本状态(state),以及一组类型化问题。问题原语有三种。

原语 输入约束 输出
Choice 候选集合,上限 255 项 所选选项、全部分布、置信度
Score 2–10 级有序量表 概率加权分数(可落在相邻等级之间)、分布、置信度
Noul 一个是非命题 P(yes) ∈ [0, 1],无独立置信度字段

同一请求里的多个问题共用一份状态,彼此独立、并行计算。每增加一个问题,边际成本大约是数十个输入 token,延迟变化可以忽略。一次提交多个问题、再在代码里丢弃不用的答案(speculative fan-out),因此成为默认用法。

255 这个上限还对应一条性能路径。发布博客写明,高基数 Choice 先对每个候选单独打分,再做一次显式选择。两阶段会偶发变慢。4.1 里 WikiRacing 的 Jev 延迟高于同表其他任务,和这条路径相符。

2.2 规格表(官方报告)

指标 数值 备注
当前版本 jev-1.13.0(别名 jev-latest / jev-preview) 官方建议生产环境固定版本号
端到端延迟 70–500 ms 非 SLA;官方注明系在服务所在地美国西岸自测
计费 $0.042 / 百万输入 token,输出免费 输出是少量浮点数,输入与输出的计费不对称
上下文预算 请求合计 64K;state 加最长单问 32K OpenRouter 以单一数字标注 32K,对的是官方的单问上限
速率限制 250,000 token/s;1,200 请求/分钟 早期访问阶段会调整
开放性 权重不开放;不可微调;无逐客户训练 官方声明客户请求与响应不用于训练;零数据留存(ZDR)只对企业账户提供

两组延迟对应的链路不同。Cloud First Consulting 于 2026 年 9 月 19 日从伦敦调用 jev-1.13.0,三问题邮件 0.68 s,十一问题请求约 0.7 s。

哈哈哈,官方的 70–500 ms 测在美国西岸,如果要较真,差额主要是跨洋往返。异地部署按"官方数字 + 自身链路 RTT"估计。

另外,"不用于训练"和"不留存"覆盖的范围不同。官方声明的是前者:请求与响应不进入训练,也不做逐客户微调或 LoRA。零数据留存写在企业合同里,但普通早期访问账户的数据仍然留存。数据不能出域时,看的是合同项,训练声明不够。

04 CLM:技术规格

3.1 结构、训练与开放性

CLM-8B 出自 Jacky Kwok 等七人(Hangoo Kang、Tarun Suresh、Jon Saad-Falcon、Marco Pavone、Christopher Ré、Azalia Mirhoseini),斯坦福阵容,博客挂在 Notion 上。模型 9 月 21 日上 HuggingFace,24 日定稿,Apache 2.0,权重、推理代码、评测样例全部可下。截至 10 月 6 日,HF 侧 740 赞、3700 余下载。

结构和 1.3 一致:Qwen3-8B 冻结底座,状态头与动作头各约 2000 万参数。三段训练的数据规模(60M / 30M / 1M)在模型卡与 README 均有标注。训练成本换来的开放性是 Jev 没有的:权重可下、头可微调、服务可自托管,一张 RTX 4090 起步。

接口形状与 Jev 收敛到了同一套:state 加一组类型化问题,原语同名——noul / choice / score,返回分布加置信度。这不是巧合。两家在互相引用对方做基准(CLM 的零样本对比对象就是 Jev),API 形状已经成了这个类别的公共契约。

3.2 规格与零样本性能

指标 数值 来源
当前版本 clm-latest(模型卡为 CLM-v0.1-8B) HF / GitHub
服务端延迟 RTX 4090 p50 ≈ 28 ms(状态新);0.6 ms(缓存命中) README 实测表
零样本对比 与 Jev 在 T-Rex、BFCL v4、WikiRacing、Super Mario 四任务打平,延迟最高低 9× README Results
加速最大处 候选最多的 WikiRacing、动作跨状态复用的 T-Rex README Results
计费 自托管,无按量费用;底座与权重均 Apache 2.0 模型卡
上下文 编码器为 Qwen3-8B 原生窗口 模型卡

零样本四任务覆盖了三类场景:工具调用(BFCL v4)、游戏(T-Rex、Super Mario)、高基数链接选择(WikiRacing)。README 只给了 9× 上限和加速分布的定性描述,图内的逐任务数字没有文本化,本节不替图表编数。

3.3 判断器之外:verifier 身份与 35B 预告

CLM 有第二个身份。轻量微调之后,它作为 verifier 在两个 agent 编程基准上拿到 SOTA:Terminal-Bench 2.1 为 87.6%,DeepSWE 为 81.6%,延迟比 Jev 低 4–6×。也就是说,同一个双塔结构,零样本是 System One 判断器,微调头之后可以塞进 RL 循环当奖励模型或过程验证器。

候选集合大时缓存红利扩大:约 1000 个候选时,CLM 对 Jev 的延迟优势到 13×。

官方 Limitations 自列四条:底座锁定(头需要 Qwen3-8B 的 last-token 池化嵌入,换底座要重训);无生成能力(概率只相对当次候选集合有意义);verifier 身份需要微调,零样本 checkpoint 对不上微调后的 SOTA 数字;泛化性待验——CLM-35B(多模态,更多数据与算力)官方预告十月初发布。本稿发于 10 月 6 日,正落在预告窗口里。

05 比较

4.1 五轴对照

维度 Jev CLM-8B
开放性 闭源 API,不可微调,无逐客户训练 Apache 2.0,权重可下,头可微调,可自托管
校准位置 写进训练目标(RLCD) 训练目标(InfoNCE)不优化校准;temperature 作为接口参数交给调用方
缓存 接口不暴露缓存点 状态/动作分离,动作嵌入可缓存;状态常新时收益近零
计费 $0.042/百万输入 token,输出免费 自托管,付 GPU 时间(单卡 4090 起步)
延迟 端到端 70–500 ms(美国西岸自测,非 SLA);伦敦实测约 0.68–0.7 s 服务端 p50 ≈ 28 ms(4090);零样本最高 9×、verifier 4–6×、约 1k 候选 13× 低于 Jev

WikiRacing 是 2.1 里那条两阶段路径的现场证据:Jev 在这个高基数任务上的延迟高于同表其他任务,与"先逐候选打分、再显式选择"的实现相符。CLM 的加速也恰好在候选最多的任务上最大——同一个性能特征,Jev 的实现付延迟税,CLM 的缓存结构吃红利。

4.2 校准放在哪一层

两个模型都输出概率,但校准契约不同。Jev 用 RLCD 把"概率上诚实"写进训练目标;CLM 的 InfoNCE 不优化校准,置信度字段衡量的是分布锐度,温度缩放留给调用方。对靠单一阈值做分流的生产系统,这是实质差别:Jev 的 0.8 和 CLM 的 0.8 不是同一个量,阈值的语义跟着训练目标走。

4.3 开放性换到了什么

CLM 的开源不只是许可条款,它换到了 Jev 结构上到不了的位置:微调头进 RL 循环当 verifier,拿下两个 agent 编程基准的 SOTA。Jev 的不可微调、零数据留存是产品决策——判断即服务,不留客户痕迹。CLM 是基建姿态——权重给你,训练管线给你,自己搭。两条路线对应两类买家:要省心买 Jev,要做 RL 或要数据不出域拿 CLM。

06 谱系与观察

一个月内出现了第三家。Bongard-mini 于 9 月 30 日上 HuggingFace(论文 10 月 1 日挂 arXiv),open-weight,底座换成 T5Gemma2——encoder-decoder 路线,与 CLM 的 decoder-only 双塔不同,但类别声明一致:封闭集合、类型化答案、校准概率。更值得注意的是标准化速度:已有 agent 框架把 /v1/systemone 做成了 API 路径名,把问题编译成 prompt、给单 token 答案码打分。9 月 26 日,"开源 Jev 决策模型"登上 Hacker News 十大。类别名从论文词汇变成接口路径,只用了两周。

谱系上,1.1 引的 GPT-1 论文是起点:2018 年的分类做法就是"生成主干 + 线性判别头"。System One 没有发明这个形状,它做的是把判别头从微调副产品升格为产品本体,再把生成那一半整个裁掉。

回接本号 9 月 17 日的 Jev 报告,当时给的两个判断——封闭集判断可坍缩、开放集不可;判断题与生成题应分开计价——一个月内被三家供应商做成了独立品类。System 1 反向下注从方向判断变成了被跟随的方向。

两个可打脸的预测。其一,CLM-35B 官方说十月初,本文发稿时是 10 月 6 日,两周内见分晓:按时兑现,说明双塔结构吃得下 scaling ladder;跳票,说明瓶颈在数据或评测而非参数。其二,12 个月内主流 agent 框架会把 System One 端点纳入默认路由——判断题走决策接口、生成题走 LLM。若路由发生在框架层而非供应商层,"分开计价"就从卖点是默认,接口税的账本会多出一个新分栏。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录