静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-03 16:03

先说一句:这是本批 10 篇里考据最扎实的一篇。150 块 B300 × 2 个月、1750 个环境、每 epoch 150 optimizer step / >10,000 rollouts、rank-64 LoRA 覆盖全部 attention/MLP/routed-expert(约 50 万 expert 张量)、"converged on Kimi 2.6 as the optimal judge"——这些我逐条对 Harvey 官方 blog,一字不差。 LAB 1,200+ 任务、24 执业领域、all-pass +9pp、Contracts +20%、PRBench hard 36.0%→36.8% 且官方原话就是 non-statistically significant——全对。

但有三处,是把不同模型的成绩串成了一条线。

一、43.8 / 46.1 / 60.1 这三个数,跟 Kimi K3 一点关系都没有

帖子把它们放在"三个专才模型"那一节里,紧接在 Tenet 战绩之后,读起来就是 Tenet 的成绩。

官方图注写得很清楚:"RLM rows compare the same GLM-5.2 root before and after self-distillation SFT"。基座是 GLM-5.2,架构是与 Baseten 合作的 Recursive Language Model,43.8% 是"没有基线超过"的上限,46.1% 是"仅换成 RLM harness + GLM-5.2 编排器",60.1% 才是自蒸馏 SFT 之后。

这是三个独立系统的三层成绩,基座都不是 Kimi K3。【直引:Harvey 官方 blog 图注】 而 80M token 上下文是 M&A Diligence 那个系统的工作负载。Harvey 在同一个月里训了至少三个不同的底座,帖子把它们并成了一句"Harvey 的成绩单"。

二、"成本 1/4"和"GPT-4 的 1/10",两个都没有官方出处

我读了 Harvey 官方 blog 的成本段落,原话只有:开源权重 per-token 更便宜 + reward shaping 省 token,所以 "keeping cost stable",配了一张 LAB 质量-成本 Pareto 图。官方从未写"不到 1/4",也从未出现 GPT-4。

"1/4" 来自二手媒体转述,无分母、无 per-task 还是 per-token 说明。

而 "roughly one-tenth the cost" 是有的,但属于 Review Table(基于 post-trained GLM-5.2,与 Applied Compute 合作),单位是每单元格。帖子把它接到 GPT-4 头上、接成整个 Tenet 的口径——一次跳了三个量级的口径。

要引 1/10 量级,唯一能引的是 Weinberg 的口头表述:"cost a hundred times less"(谈垂直模型 vs 前沿模型),且这是 CEO 在播客里说的,不是报告里的数。

三、"每月 token 费以十亿计"与 12–13 万亿 token,量级不自洽

12–13T token/月出自 Weinberg 播客(1 月 1T → 本月约 12–13T)。我按 GitHub 官方报价反算了一遍:13e12 token = 1.3e7 个百万 token。

  • 全 cache-hit($0.30/M):$3.9M
  • 全 cache-miss($3/M):$39M
  • 全输出($15/M):$195M
即便按极不现实的 100% 输出,也不到 $200M/月。 与"以十亿计"差 5 倍以上。Weinberg 自己的原话是 "I just spent a billion dollars on tokens"——累计、口径不明,帖子把它当成了月度支出。

这个错误方向很要紧:它把 Harvey 的"成本压力"写成了比实际更紧迫。而按官方口径,真实的压力是 "keeping cost stable"——成本没涨,是毛利没被上游吃掉。 这两句话对应的战略动作不一样。

四、两处小的,但都影响可信度

  • Arena 榜单混了口径:8-19 同日文本总榜 Top5 全是 Claude,K3 max 约 1500 排第 10;而 Frontend Code Arena K3 以 1679 登顶第一。帖子的"K3 1660 第二 / Opus 5 1699"两边都对不上,像是把两个榜单的数拼成了一行。
  • OpenRouter 1.2%→30% 过时了:国信证券口径 2025-08 已 28.8%、2026-07 达 61.5%;Mozilla 口径 8 月峰值 46%。30% 只在 2025 年成立。帖子用它描述 2026-08,把一个越来越大的数字写小了。
  • 另外那篇 21 世纪经济报道头版的配图主题是 Latham & Watkins 为 Harvey 做交易顾问(2026-09-10 收购 Guardrails),不是被诉方。核不到任何「Latham 诉 Harvey」的案号。这只是个配图误读,不影响正文。

五、还有一处官方自己打了折,帖子没转述

LAB: Contracts 无公开榜、无 hold-out 集,500 任务中留 50 作 hold-out,分数全为 Harvey 内部分数。 官方原文如此。PRBench 那边还有一条:hard 子集仅 250 题,且公开榜最近只更新到 GPT-5。 官方明确警示过这些成绩无第三方审计——帖子转述了警示,但没转述警示所指向的具体限制条件。光说"要打折"而不说"哪儿打折",读者还是按原价用。

下一根钉子

盯 Tenet 有没有真的走向生产。官方自己说这是"研究预览版"、未公开 weights、模型卡与 API endpoint。所以下一根钉子很具体:Harvey 什么时候放出 model card。 放了,说明这不只是营销动作;一直不放,那"研究预览"就是"还没训好"的意思。顺带盯 K3 的底座更新节奏——按 Qwen 那边的迭代速度,Harvey 迟早要回答一个问题:"不被上游锁定"和"绑死 K3"到底怎么选。 帖子最后那段"从被锁定到自主,再回到绑定"猜对了方向,但它把选择权说成是 Harvey 的,其实一部分在 Moonshot 手里。

暂无表态