Jev 实操报告:四个可以直接抄的用法,和一条被实测否定的路

上篇讲了 Jev 是什么:只答判断题、不写文字、TypeSafe 的 System One 模型。这篇不讲是什么,讲怎么用。材料是四份一手文档,全部读完,包括两份社区实测。有数字,有踩坑,有一条被实测否定的路。

四份一手材料全读:TypeSafe 设计文档、hermes-jev-skills、fast-jev-compaction、LangChain 集成 | 跑分均为厂商口径,实测数据标注来源 | 上接 9/17 海关报告(topic 178634914)

上篇讲了 Jev 是什么:只答判断题、不写文字、TypeSafe 的 System One 模型。这篇不讲是什么,讲怎么用。材料是四份一手文档,全部读完,包括两份社区实测。有数字,有踩坑,有一条被实测否定的路。

先把价签钉住。官方口径:输入 $0.042/百万 token(传统 LLM 输入价 $0.20-$10),输出免费,端到端延迟 70-500 毫秒。LangChain 转述厂方数据:分类任务上比同类 LLM 快 200 倍、便宜 400 倍。问题就三种:Choice(选项里挑一个)、Score(有序等级打分)、noul(是/否概率)。最反直觉的一点:一次请求里所有问题并行评估,加十个问题几乎不增加延迟,只加 token 钱。「写代码本身只占 token 的 4-10%」是视频口径;硬出处是微软 fastcontext 团队对 GPT-5.4 轨迹的分析:读和搜索占工具调用轮次的 56.2%、主 agent 总 token 的 46.5%。

一、设计文档的核心:KV cache 暴政

TypeSafe 的设计文档最值钱的不是产品介绍,是开篇那个问题:如果 LLM 没有 KV cache,你会怎么设计 coding agent?

答案是一份清单,文档管它叫 KV cache 的暴政,六件事。这里说最狠的三件。

路由不工作。文档算了笔账:opus 单价 $5/$25,sonnet $3/$15。一条会话里先 opus 再切 sonnet 再回 opus,比全程 opus 更贵。原因是上下文要被大模型重新处理一遍,KV cache 作废。按典型负载比例算,纯 opus 只要三分之二的钱。路由的隐藏成本不是模型差价,是 cache 重建。上下文越长,切换越贵。

工具调用是奇怪的权衡。工具要预先塞进 system message,不管这轮用不用得上;参数占上下文;模型在高基数、偏离策略的工具调用上不可靠。这也是 skills 优于裸 MCP 的原因。

compaction 存在,是因为大家默认未来所有轮次共享单一状态。文档问:为什么这么假设?压缩很难,而且大概率不如查询感知的压缩——如果你知道要找什么,压缩就容易得多。

TypeSafe 自己的答案叫 Meta-attention:把「上下文是静态的」这个假设整个拆掉,每个查询重新给每段上下文打分,四档处理——不显示、小摘要、长摘要、全文。文档里这还是愿景,不是 shipped 功能。但方向和下面两个社区实测项目完全一致。

二、四个可以直接抄的用法

用法一:模型路由。 hermes-jev-skills(社区项目,非官方)把 Jev 接进 Hermes/Claude Code/Codex,每轮决定用哪个模型,实测约 0.4 秒。LangChain 官方出了 ModelRouterMiddleware,从最新用户消息选模型贯穿整个 run。关键不在选,在落地方式:先跑 shadow mode——只决策、只记录、不切换,跑一天看日志再上线。hermes 的护栏也值得抄:风险词(production、delete、migration、payment、legal)永不路由到最便宜档;大上下文永不中途降级。

用法二:上下文筛选。 fast-jev-compaction 的思路简单粗暴:不用 Jev 写摘要,让它决定删什么。每个工具调用和结果打两个分——这条调用该留吗(知道做过+参数还重要吗)、这个结果该原样留吗(内容还需要+重跑拿得回来吗)。低于阈值的删掉,留下的一字不动。用户和助手文本永不碰。摘要是有损的:文件路径、精确报错、约束、命令会在总结里消失。删除是无损的:留着的东西保证原样。实测有一条工程纪律:压缩比不足四分之一就别跑了,不值得。

用法三:技能选择。 377 个已装 skill 里挑本轮需要的,约 2.8 秒。配合设计文档里的条件 AGENTS.md 思路更好用:别把所有说明常驻上下文,按条件动态加载——前端任务挂 style guide,子目录挂 footguns 文件。文档有句话:每个子目录都该有 gotchas 文件。

用法四:工具调用护栏。 LangChain 的 AutoModeMiddleware 用 Jev 在工具执行前拦截风险调用。博客里有句话说得直白:这类安全分类器步骤以前被锁在闭源 harness 里(Claude Code、Codex、Cursor 内部),现在有了便宜够快的分类器,所有 agent 都能用同一套模式。hermes 的版本更严:Jev 只能返回预定义动作表里的 id,封闭集护栏,选错的爆炸半径被锁死。

三、边界,和一条被否定的路

边界先说三条硬的。第一,概率不是证明:fast-jev-compaction 的 Limitations 原话是「a probability is not a proof that a result is safe to delete」——好在 agent 永远可以重跑工具,这是删除式压缩的安全垫。第二,精度换成本:DataCamp 的复述是「trades peak accuracy for cost and latency savings」,高峰值精度不是它的卖点。第三,隐私默认档仍然出境:routing 默认把脱敏后的用户轮次发给 Jev(2500 字符上限,读头尾);敏感 profile 要配 private_profiles,只发长度、有没有代码、风险词这类粗特征。

被否定的路是会话交接摘要。hermes 实测让 Jev 做 keep/summarize/drop 的会话压缩,召回反而不如纯转录:单查询,纯转录 58.7% 对 Jev 摘要版 37.5%;带一次搜索,75.0% 对 68.3%。两档都输。他们最后发布的是全文方案:交付 1200 词完整对话加回溯路径。社区项目把负结果写进 README,这个值得尊敬。

这个负结果跟上篇的结论严丝合缝:封闭集判断可外包,开放集判断不可。会话摘要是开放集问题,路由和分拣是封闭集问题。Jev 的适用面恰好是前者之外的那一圈。

还有个工程分歧值得看:hermes 全线 fail-open(Jev 挂了就维持现状,最多损失 2.5 秒),fast-jev-compaction 是 fail-loud(抛异常,让调用方决定回退到 Claude Code 内置摘要)。同一个模型,两种失败哲学,取决于错误的代价是「一轮变慢」还是「上下文悄悄丢东西」。失败会静默的地方,宁可响。

四、回接

delete-only compaction 是「别压缩压缩过的东西」的第三个样本:斯坦福 Prefix Sliding 的丢弃级、CliffCompaction 的残差传播、fast-jev-compaction 的打分删除——三家在两周内用不同实现说了同一句话:中间产物重写必有损,只删不写。KV cache 暴政那笔账则是接口税定价学的新账本位置:上下文是前缀结构,换模型等于换接口,全部前缀税重付。路由省的不是智力,是税。

可打脸预测一条:12 个月内,主流 agent 框架会把「判断题路由」做成默认中间件层(LangChain 已经起步),判断题和生成题在 harness 层面分开计价——到那时候回看 $0.042 这个价签,它定义的是一个新品类,不只是一款便宜模型。


*材料:TypeSafe 设计文档(Google Docs)、github.com/kerpopule/hermes-jev-skills、langchain.com/blog/building-a-harness-with-jev(9/17)、github.com/tamaratran/fast-jev-compaction、typesafe.ai 官方博客。hermes-jev-skills 与 fast-jev-compaction 均为独立社区项目。跑分厂商口径,实测数据出自两 repo 的 evals 文档。*

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

删掉的那一行,和写坏的那一行

这篇最值钱的不是四个用法,是那条被实测否定的路。我顺着价签做了一遍算术,顺手核对了几处。

自洽性检查:$0.042 × 444.6 = 18.67

TypeSafe 官方:输入 $0.042 / 百万 token,输出免费。这两个可以对账,没问题。

问题在「便宜 400 倍」。厂方原始数字是 444.6 倍(还有个 193.6 倍快)。按单价反推:

  • 0.042 × 444.6 ≈ $18.67 / 百万 token
而 TypeSafe 自己在发布帖里给的对手区间是 $0.20–$10。反推值在区间外,超出上沿将近一倍。

所以 444.6× 不能当单价差用,它是工作流级的账(含输出 token,而前沿模型的输出价通常是输入的五倍)。这个区分不是抠字眼:拿 444.6× 去估「我把路由换成 Jev 能省多少」,会高估一个量级。

还有一处更能说明问题:TypeSafe 自己主页那个并排 demo,同一个任务 Jev 是 0.114 秒 / $0.000081,LLM 是 8.566 秒 / $0.013880——75 倍快,171 倍便宜。

同一家公司的两套自有数字,头条是 demo 的 2.6 倍。厂方自己的说明是「on the higher end of real world gains」,说的是实话,但这句话得跟着数字一起走。

(另有一条:TypeSafe 主页称比某家前沿模型输入价低 238 倍,反推对手约 $10/百万,正好是它自己区间的上沿。这一条自洽。)

一条你没提、但很关键的边界

TypeSafe 明确不发布公共 benchmark 分数。

原话大意是他们刻意不做,理由是 System One 类任务比开放式生成好评估,团队应该自建评测。这个立场我认同,但它的直接后果是:今天没有任何外部的人能告诉你 Jev 在你的活儿上有多准。

产品 2026-09-21 才公开托管 API,一周龄。社区估模型约 30 亿参数。上下文 64K(其中 state 32K)。这些都要跟着「一周」这个前提一起读。

那条被否定的路,我认为是这篇的核心

hermes 的实测:让 Jev 做 keep/summarize/drop 的会话压缩,召回反而不如纯转录。

  • 单查询:纯转录 58.7% vs Jev 摘要版 37.5%
  • 带一次搜索:75.0% vs 68.3%
两档都输。

原因不在 Jev 不行,在任务性质。摘要是开放集问题:你得决定生成什么,而生成出来的每一句都是新的承诺。路由、分拣、删除是封闭集问题:选项表在那儿,选一个就行,选错的爆炸半径被锁死。

项目把负结果写进 README 并且最后发布的是全文方案(1200 词完整对话 + 回溯路径),这一手我给满分。

跟今天的另一条账是同一条曲线

EvoOntology 那篇:每轮输入 3.2K → 4.6K,总账 52.6K → 42.0K,轮数 14.6 → 8.4。

Jev 这套:每轮多问一次(几乎不增加延迟),总共少跑。

两边说的是同一件事:索引侧付一次,查询侧反复收。 差别只在付钱的是本体图还是一次 0.4 秒的判断题。

一句话收口

失败会静默的地方,宁可响。

hermes 全线 fail-open(挂了就维持现状,最多损失 2.5 秒),fast-jev-compaction 是 fail-loud(抛异常让调用方决定)。同一个模型,两种失败哲学,取决于错误的代价是「一轮变慢」还是「上下文悄悄丢东西」。

判断题可以外包,生成题不行。这条线画在哪,决定了那 0.4 秒是杠杆还是坑。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens