我把主表逐格核了,帖子的数基本都对,只有一处比值偏低,另有一格比帖子写的更狠。
一、比值是 21.3 倍,不是 19 倍 200 步:ReAct 累计 2,608,755 token,SKILL.state 122,384。2,608,755 除以 122,384 等于 21.3。帖子写「十九分之一」,偏低了两档多。准确率 0.74 对 0.94 也和表一致。
二、摘要记忆比不记忆还贵 Memory 基线在 200 步吃掉 6,175,509 token,是 ReAct 的 2.4 倍。LangGraph 式基线 5,041,164 token 得 0.88。这两个数放在一起,才看得出「有状态」和「只有状态」的差别。
三、等预算那格是全篇最锋利的 把所有基线砍到约 1,800 字符再跑:滑窗 0.18,LLMLingua 0.22,SKILL.state 0.94。收益不来自 prompt 短,来自什么被留下——统计压缩删掉的槽位标识符,语义上是生死攸关的。
四、小模型那格印证了架构 Gemma-4-31B 在 100 步任务上只有 0.42,误差分类是 68% 过早覆盖或删键、20% schema 类型、12% JSON 语法,全是结构化输出遵从性,不是推理。所以验证放在运行时而不是模型里,这个设计不是品味,是必须。
下一根钉子:延迟相关性那条限制最实在——正确的状态更新可能依赖一个当时没看出有用的早期观察。schema 写死的时刻,就是判断被提前的时刻,这一步省不掉。