四份一手材料全读:TypeSafe 设计文档、hermes-jev-skills、fast-jev-compaction、LangChain 集成 | 跑分均为厂商口径,实测数据标注来源 | 上接 9/17 海关报告(topic 178634914)
上篇讲了 Jev 是什么:只答判断题、不写文字、TypeSafe 的 System One 模型。这篇不讲是什么,讲怎么用。材料是四份一手文档,全部读完,包括两份社区实测。有数字,有踩坑,有一条被实测否定的路。
先把价签钉住。官方口径:输入 $0.042/百万 token(传统 LLM 输入价 $0.20-$10),输出免费,端到端延迟 70-500 毫秒。LangChain 转述厂方数据:分类任务上比同类 LLM 快 200 倍、便宜 400 倍。问题就三种:Choice(选项里挑一个)、Score(有序等级打分)、noul(是/否概率)。最反直觉的一点:一次请求里所有问题并行评估,加十个问题几乎不增加延迟,只加 token 钱。「写代码本身只占 token 的 4-10%」是视频口径;硬出处是微软 fastcontext 团队对 GPT-5.4 轨迹的分析:读和搜索占工具调用轮次的 56.2%、主 agent 总 token 的 46.5%。
一、设计文档的核心:KV cache 暴政
TypeSafe 的设计文档最值钱的不是产品介绍,是开篇那个问题:如果 LLM 没有 KV cache,你会怎么设计 coding agent?
答案是一份清单,文档管它叫 KV cache 的暴政,六件事。这里说最狠的三件。
路由不工作。文档算了笔账:opus 单价 $5/$25,sonnet $3/$15。一条会话里先 opus 再切 sonnet 再回 opus,比全程 opus 更贵。原因是上下文要被大模型重新处理一遍,KV cache 作废。按典型负载比例算,纯 opus 只要三分之二的钱。路由的隐藏成本不是模型差价,是 cache 重建。上下文越长,切换越贵。
工具调用是奇怪的权衡。工具要预先塞进 system message,不管这轮用不用得上;参数占上下文;模型在高基数、偏离策略的工具调用上不可靠。这也是 skills 优于裸 MCP 的原因。
compaction 存在,是因为大家默认未来所有轮次共享单一状态。文档问:为什么这么假设?压缩很难,而且大概率不如查询感知的压缩——如果你知道要找什么,压缩就容易得多。
TypeSafe 自己的答案叫 Meta-attention:把「上下文是静态的」这个假设整个拆掉,每个查询重新给每段上下文打分,四档处理——不显示、小摘要、长摘要、全文。文档里这还是愿景,不是 shipped 功能。但方向和下面两个社区实测项目完全一致。
二、四个可以直接抄的用法
用法一:模型路由。 hermes-jev-skills(社区项目,非官方)把 Jev 接进 Hermes/Claude Code/Codex,每轮决定用哪个模型,实测约 0.4 秒。LangChain 官方出了 ModelRouterMiddleware,从最新用户消息选模型贯穿整个 run。关键不在选,在落地方式:先跑 shadow mode——只决策、只记录、不切换,跑一天看日志再上线。hermes 的护栏也值得抄:风险词(production、delete、migration、payment、legal)永不路由到最便宜档;大上下文永不中途降级。
用法二:上下文筛选。 fast-jev-compaction 的思路简单粗暴:不用 Jev 写摘要,让它决定删什么。每个工具调用和结果打两个分——这条调用该留吗(知道做过+参数还重要吗)、这个结果该原样留吗(内容还需要+重跑拿得回来吗)。低于阈值的删掉,留下的一字不动。用户和助手文本永不碰。摘要是有损的:文件路径、精确报错、约束、命令会在总结里消失。删除是无损的:留着的东西保证原样。实测有一条工程纪律:压缩比不足四分之一就别跑了,不值得。
用法三:技能选择。 377 个已装 skill 里挑本轮需要的,约 2.8 秒。配合设计文档里的条件 AGENTS.md 思路更好用:别把所有说明常驻上下文,按条件动态加载——前端任务挂 style guide,子目录挂 footguns 文件。文档有句话:每个子目录都该有 gotchas 文件。
用法四:工具调用护栏。 LangChain 的 AutoModeMiddleware 用 Jev 在工具执行前拦截风险调用。博客里有句话说得直白:这类安全分类器步骤以前被锁在闭源 harness 里(Claude Code、Codex、Cursor 内部),现在有了便宜够快的分类器,所有 agent 都能用同一套模式。hermes 的版本更严:Jev 只能返回预定义动作表里的 id,封闭集护栏,选错的爆炸半径被锁死。
三、边界,和一条被否定的路
边界先说三条硬的。第一,概率不是证明:fast-jev-compaction 的 Limitations 原话是「a probability is not a proof that a result is safe to delete」——好在 agent 永远可以重跑工具,这是删除式压缩的安全垫。第二,精度换成本:DataCamp 的复述是「trades peak accuracy for cost and latency savings」,高峰值精度不是它的卖点。第三,隐私默认档仍然出境:routing 默认把脱敏后的用户轮次发给 Jev(2500 字符上限,读头尾);敏感 profile 要配 private_profiles,只发长度、有没有代码、风险词这类粗特征。
被否定的路是会话交接摘要。hermes 实测让 Jev 做 keep/summarize/drop 的会话压缩,召回反而不如纯转录:单查询,纯转录 58.7% 对 Jev 摘要版 37.5%;带一次搜索,75.0% 对 68.3%。两档都输。他们最后发布的是全文方案:交付 1200 词完整对话加回溯路径。社区项目把负结果写进 README,这个值得尊敬。
这个负结果跟上篇的结论严丝合缝:封闭集判断可外包,开放集判断不可。会话摘要是开放集问题,路由和分拣是封闭集问题。Jev 的适用面恰好是前者之外的那一圈。
还有个工程分歧值得看:hermes 全线 fail-open(Jev 挂了就维持现状,最多损失 2.5 秒),fast-jev-compaction 是 fail-loud(抛异常,让调用方决定回退到 Claude Code 内置摘要)。同一个模型,两种失败哲学,取决于错误的代价是「一轮变慢」还是「上下文悄悄丢东西」。失败会静默的地方,宁可响。
四、回接
delete-only compaction 是「别压缩压缩过的东西」的第三个样本:斯坦福 Prefix Sliding 的丢弃级、CliffCompaction 的残差传播、fast-jev-compaction 的打分删除——三家在两周内用不同实现说了同一句话:中间产物重写必有损,只删不写。KV cache 暴政那笔账则是接口税定价学的新账本位置:上下文是前缀结构,换模型等于换接口,全部前缀税重付。路由省的不是智力,是税。
可打脸预测一条:12 个月内,主流 agent 框架会把「判断题路由」做成默认中间件层(LangChain 已经起步),判断题和生成题在 harness 层面分开计价——到那时候回看 $0.042 这个价签,它定义的是一个新品类,不只是一款便宜模型。
材料:TypeSafe 设计文档(Google Docs)、github.com/kerpopule/hermes-jev-skills、langchain.com/blog/building-a-harness-with-jev(9/17)、github.com/tamaratran/fast-jev-compaction、typesafe.ai 官方博客。hermes-jev-skills 与 fast-jev-compaction 均为独立社区项目。跑分厂商口径,实测数据出自两 repo 的 evals 文档。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。