深度研究|Claude Fable 5.1:把「长程 agentic」从加分项做成主战场

研究日期:2026-09-02 | 对象:Anthropic Claude Fable 5.1 / Mythos 5.1(2026-09-01 发布)

文本版 · 供搜索与朗读

深度研究|Claude Fable 5.1:把「长程 agentic」从加分项做成主战场

深度研究|Claude Fable 5.1:把「长程 agentic」从加分项做成主战场

研究日期:2026-09-02 | 对象:Anthropic Claude Fable 5.1 / Mythos 5.1(2026-09-01 发布)

一手材料:Anthropic 官方 benchmark 对比表(七道基准 × 四模型,含四条脚注)

旁证:Laude Institute / Stanford Terminal-Bench-Science 0.1 官方榜、Zapier AutomationBench 官方榜、Cursor CursorBench 3.2 官方榜、Artificial Analysis GDPval-AA v2 与 AutomationBench-AA、OSWorld 2.0 论文与 Snorkel 榜、CAIS/Scale AI HLE 官方口径

数据分级:CONFIRMED 官方榜/论文可查 | VENDOR 厂商自跑未独立复现 | RUMOR 客户证言/第三方转述

52.6%Terminal-Bench-Science 0.1
较 Fable 5 翻 1.13 倍

60.9%HLE 无工具
公开模型首破 60%

1853GDPval-AA v2 Elo
唯一失手(Opus 5 1861)

−75%缓存读取单价
$1.00 → $0.25/百万

−45%高度 agentic 负载
综合成本降幅

12 周Fable 5 的旗舰寿命
5/20 → 9/1

一句话定性

Fable 5.1 不是「Fable 5 + 0.1」的补丁。它是 Anthropic 第一次把「能自己把一整件事干完」摆到产品主张的正中央——七道 agentic 基准里拿下六道第一,唯一失手的那道(GDPval-AA v2)只输 8 个 Elo 点,落在抽样误差里。

更狠的是它在「科研自主性」这一项上的跃迁:Terminal-Bench-Science 0.1 从 Fable 5 的 24.7% 跳到 52.6%,翻了一倍还多。同一个模型换个松护栏的马甲叫 Mythos 5.1,只对通过审核的网络安全与生命科学机构开放。

但真正让这次发布会进企业采购清单的,不是跑分——是缓存读取降价 75% 和 EFS(企业前沿护栏)。前者把 agentic 长任务的账单砍掉最多 45%,后者把「用最强模型就得接受 30 天数据留存」这个死结解开了。三周前 OpenAI 刚拿零留存当矛刺过来,今天盾到了。

来路考:三个月,三代,一条自我加速的产品线

把时间线摊开,节奏本身就在讲故事:

时间事件间隔定位

2026-05-20 前后Fable 5 发布,Anthropic 新旗舰—首代「Fable」档,压在 Opus 之上

2026-07-24Opus 5 发布,百万上下文默认全开 + 自适应思考距 Fable 5 约 65 天刷新 GDPval-AA v2 至 1861,屠榜

2026-09-01Fable 5.1 + Mythos 5.1 同期发布距 Opus 5 仅 39 天七道基准六项第一

产品寿命被压缩的信号:Fable 5 从登顶到被自家接班,只用了三个月。这不是 Anthropic 第一次快速迭代,但「旗舰档三个月一换」意味着企业客户的 POC 窗口被压扁——模型选型不再是年度决策,是季度决策。

双胞胎:同一颗芯,两副护栏

Fable 5.1 与 Mythos 5.1 用的是同一个基础模型,差别只在安全护栏的松紧。这个设计从 Fable 5 / Mythos 5 那代就定了:

Fable 5.1 — 面向所有人开放,API 标识 claude-fable-5-1,同步登陆 AWS / Google Cloud / Azure。

Mythos 5.1 — 护栏更宽松,仅限经审核的网络安全从业者与生命科学研究者,走 Cyber Verification Programme 与 Life Sciences Verification Programme 两条可信访问通道。目前只开放给部分美国组织,Anthropic 称正与美国政府协调扩围。

Anthropic 自述 Mythos 5.1 是其发布过的最强网络安全模型。而第三方追踪站给出的一个数字,恰好量化了「护栏值几个点」——见后文「真相五」。

定价:单价没动,动的是那个占大头的

项目Fable 5Fable 5.1变化

输入(每百万 token)$10.00$10.00持平

输出(每百万 token)$50.00$50.00持平

缓存读取$1.00$0.25−75%

5 分钟缓存写入—$12.50—

1 小时缓存写入—$20.00—

上下文窗口1M1M(自适应思考常开)持平

为什么砍缓存读取这一刀最疼:缓存读取是相对基准输入价的倍数——其他 Claude 模型一律是 0.1×,Fable 5.1 直接压到 0.025×。agentic 任务的 token 账单里,缓存读取占绝对大头:每一轮 agent loop 都要把系统提示、历史对话、工具返回结果重新读一遍。任务越长、轮次越多,这一项越主导总成本。所以官方口径是:典型工作负载总成本降约 25%,高度 agentic 的工作负载降幅可达约 45%。

背景数据更说明问题:据支付平台 Ramp 的统计,Fable 5 发布两个多月后,只占企业客户 AI 工具总支出的约 11%,反倒是更便宜的 Opus 5 在企业端花费超过了它。Fable 5 的瓶颈从来不是能力,是账单。

七道战报:逐项拆开看

先上 Anthropic 官方原表(逐格核对,含空格):

能力域基准Fable 5.1Fable 5Opus 5GPT-5.6 Sol

Agentic 科研Terminal-Bench-Science 0.152.6%24.7%–22.4%

Agentic 编码Terminal-Bench 4.055.8%42.0%52.3%37.3%

Agentic 知识工作GDPval-AA v2(Elo)1853174718611738

Agentic 电脑操作OSWorld 2.0(partial)77.9%72.9%70.6%62.6%

OSWorld 2.0(strict)41.7%36.1%––

多学科推理HLE(无工具)60.9%53.7%50.2%47.4%

HLE(有工具)65.0%57.6%54.9%52.1%

业务流程自动化AutomationBench31.4%17.1%––

Agentic 编码CursorBench 3.2.073.4%70.5%70.0%67.2%

Anthropic 原表四条脚注(逐条照录,这些是读表的钥匙)

凡因我方护栏导致 Fable 5.1 / Fable 5 无法完成的任务,网络安全类任务改由 Claude Opus 4.8 完成,生物学类任务改由 Claude Opus 5 完成。这很可能拉低了 Fable 5.1 与 Fable 5 的分数。

Terminal-Bench、AutomationBench、CursorBench 三项使用我方自有 harness。因此 GPT-5.6 Sol、Fable 5、Opus 5 的数字可能与其他报告不一致。

Fable 5.1 在所有基准上均以最大 effort + 自适应思考 + 1M 上下文测试。若某模型不支持自适应思考或 1M 上下文,则采用其最高推理 effort + 最高可用上下文设置。

各基准采用 MIT 抽样量 n=100(除另注)。n=100 时误差为 ±3.5 个百分点。

① 科研自主性 — Terminal-Bench-Science 0.1 CONFIRMED

考什么:Stanford + Laude Institute 于 2026-08-27/28 发布的基准,70 道题,全部取自真在干活的科学家的研究流水线——不是教科书习题,是那种「FASTA 文件格式坏了」「物理仿真文档只写了一半」「数据得先清洗才能分析」的活。覆盖生命科学 19 题、物理科学 17 题、地球科学 8 题、数学科学 17 题、工程科学 9 题。用确定性 pytest 检查产物(代码/证明/仿真/数据产品),不靠人judge。三独立试验取解决率。

筛选有多严:920 份提案 → 464 份获批实施 → 386 个 PR → 最终 70 题入选,存活率 7.6%。评审过程中刻意校准难度去挑战最新前沿模型,不是「开箱即解」。

系统Harness解决率说明

Fable 5.1Anthropic 自有52.6%较 Fable 5 +27.9pp,2.13 倍

Opus 5Claude Code30.0%Laude 官方榜第一,原纪录

Fable 5Anthropic 自有24.7%Laude 官方榜口径则是 21.4%

GPT-5.6 SolCodex22.4%Laude 官方榜第二

Opus 4.8Claude Code10.5%Laude 官方榜

GLM 5.3Claude Code8.1%开源权重最佳

这一项是本次发布会真正的头条:Fable 5.1 把「AI 自主做科研」的公开纪录从 30.0% 一举推到 52.6%——一次性抹平了此前所有模型在这套题上「连三分之一都过不了」的窘境。Laude 官方榜原本的结论是「跑分 80%+ 的编码 agent,仍然会搞砸 70% 的真实科研工作流」;Fable 5.1 至少把后半句改写了。

两个必须扣的分:(1) 52.6% 是 VENDOR 口径——Anthropic 用自有 harness,与 Laude 官方榜(Fable 5 记 21.4%)差 3.3pp,同一模型两套 harness 就有这个量级的系统差;(2) 脚注 1 自曝:生物学类任务被护栏拦下后由 Opus 5 代做,而生命科学恰恰是这个基准里最大的域(19 题)。所以 52.6% 很可能是被低估的数。

② 编码自主性 — Terminal-Bench 4.0 VENDOR

考什么:Laude Institute 的终端 agent 基准,第 4.0 版。这一版重新校准了每道题的时间、CPU 与内存配额,删掉 8 题、修好 19 题——为的是减少「跟模型无关的运行失败」。所以4.0 的分数与早期版本不可比。测的是 agent 在纯命令行环境里跑编译、训练小模型、配置服务这类端到端脏活。

系统分数与 Fable 5.1 差距

Mythos 5.1(松护栏同源)60.9%+5.1pp

Fable 5.155.8%—

Opus 552.3%−3.5pp

Fable 542.0%−13.8pp

GPT-5.6 Sol37.3%−18.5pp

一处需要打问号的数据:Mythos 5.1 的 60.9% 来自第三方追踪站,与 Fable 5.1 的 HLE 无工具分数 60.9% 完全相同。两道题、两个数、一模一样——是巧合还是抓取串号,本报告无法判定,标记为待核。但这个数字若成立,它是全场最有意思的一个:见「真相五」。

Fable 5.1 对 GPT-5.6 Sol 的领先是 18.5 个百分点(1.50 倍),对自家上一代是 13.8 个百分点。这是七项里绝对差距第三大的一项。

③ 职业知识工作 — GDPval-AA v2 CONFIRMED

考什么:OpenAI 出 GDPval 任务集(44 类职业、9 大 GDP 行业,任务由平均 14 年经验的资深从业者设计的真实交付物),Artificial Analysis 跑独立 agentic 版——220 道题,给 shell 和网页访问,产出匿名后两两盲评,汇总成 Elo。人类基线锚定在 1000 分。

系统Elo与 Fable 5.1 差换算成对胜率

Opus 51861+851.2%(Fable 5.1 视角)

Fable 5.11853——

Fable 51747−10664.8%

GPT-5.6 Sol1738−11566.0%

人类基线1000−853≈99.8%

唯一失手的一项,也是最有意思的一项。8 个 Elo 点换算成成对胜率是 51.2%——在一个 220 道题、LLM 当裁判的盲评体系里,这个差距统计上不可区分。换句话说:Fable 5.1 没有输给 Opus 5,它和 Opus 5 打平了,只是 Elo 排序上排在后面。

为什么偏偏是这项打平:GDPval-AA v2 测的是「交付物质量」——报告、病历、文书、图表、幻灯片。它需要的是「把一个分析做成一份完整职业文档」,而 Fable 5.1 主打的是「长程自主推进」。两者有重叠,但不是同一件事。Opus 5 的百万上下文默认全开 + 自适应思考,在「长文档一气呵成」上仍有身位。

Anthropic 自己的建议也承认这个分工:从 Opus 5 起步,需要更强推理与长程 agentic 时才上 Fable 5.1。这不是「Fable 全面碾压」,是「两把不同的刀」。

三条必须记住的 caveat:(1) 盲评裁判是 LLM 不是人,这是 GDPval-AA 已知的系统性偏差风险,Elo 差值表达不了这个不确定性;(2) 各家 Elo 会随 effort 档位浮动——Artificial Analysis 8 月榜同时列了 Opus 5(max)1852、Opus 5(xhigh)1819、Opus 5(high)1735,同一模型三个 effort 差了 117 分,比 Fable 5.1 与 Opus 5 的 8 分差大一个数量级;(3) 不同资料源对 Opus 5 的分值口径不一(1861 / 1852 / 1853 互见),本报告以图中 1861 为准并标注。

④ 电脑操作 — OSWorld 2.0 CONFIRMED

考什么:XLANG Lab + Snorkel AI 的长程计算机操作基准,108 道端到端工作流,跨 31 个自托管网站与专业桌面应用。人类完成这些任务中位约 1.6 小时,agent 平均要 318 次工具调用(OSWorld 1.0 只要约 30 次)。刻意设计了十类挑战现象:流式交互、动态环境、跨源推理、隐式状态推断、视觉空间精度。

双指标:partial 是部分得分(每道题平均 27.25 个检查点),strict 是二值完成率(整件事干完)。按 150 / 300 / 500 步预算分别评分。

系统partialstrict转化率 strict/partial

Fable 5.177.9%41.7%53.5%

Fable 572.9%36.1%49.5%

Opus 570.6%––

GPT-5.6 Sol62.6%––

Opus 4.854.8%20.6%37.6%

GPT-5.547.5%13.0%27.4%

全表最锋利的一个派生指标在这里:strict/partial 转化率。Fable 5.1 是 53.5%,Fable 5 是 49.5%,Opus 4.8 是 37.6%,GPT-5.5 只有 27.4%。

这个比值回答的是:「已经做到 70% 进度的活,有多大比例能真正收尾?」OSWorld 论文自己点名了 frontier agent 的死穴——丢约束、漏掉中途到达的信息、猜而不问、跳过验证。转化率从 49.5% 提到 53.5%,说明 Fable 5.1 不只是「做得多」,是「能收尾」。

但别高兴太早:41.7% 的 strict 意味着仍有 58.3% 的长程计算机任务干不完。OSWorld 2.0 论文的原话是「当前 agent 距离专业级计算机操作还很远」——Fable 5.1 把这个差距缩小了,没有跨过去。另外这也是七项里唯一两个对手全空格的一项(Opus 5 与 GPT-5.6 Sol 都没有 strict 数据),跨家可比性只在 partial 上成立。

⑤ 多学科推理 — Humanity's Last Exam CONFIRMED部分

考什么:CAIS + Scale AI 于 2025-01-23 发布的「最后一场闭卷学术考试」。2,500 道公开题(另有 500 道私有 held-out),跨 100+ 学科——数学 41%、生物/医学 11%、CS/AI 10%、物理 9%、人文社科 9%、化学 7%、工程 4%。出题流程本身就是个范本:7 万份投稿 → LLM 难度门(任何前沿模型答对即退稿)→ 剩 1.3 万份进人工 → 两轮 PhD 级评审 → 定稿 2,500 题。发布时 GPT-4o 只有 2.7%。2026-01-28 登上 Nature。

系统无工具有工具工具增益

Fable 5.160.9%65.0%+4.1pp

Fable 553.7%57.6%+3.9pp

Opus 550.2%54.9%+4.7pp

GPT-5.6 Sol47.4%52.1%+4.7pp

60.9% 这个数字的分量:HLE 无工具口径的历史水位是——2025-01 GPT-4o 2.7%;2026-02 Gemini 3 Pro Preview 37.5%;2026-04 Gemini 3.1 Pro Preview 46.4%;2026-05 公开可得最佳 Claude Opus 4.7 的 46.9%,实验室自报的 Mythos Preview 56.8%。Fable 5.1 的 60.9% 是公开可得模型首次站上 60% 门槛,也超过了此前只有 lab-reported 的 56.8%。

全表最容易被忽略、也最硬的一个信号:工具增益四家几乎持平(+4.1 / +3.9 / +4.7 / +4.7)。

如果 Fable 5.1 是赢在「会用工具」,它的工具增益应该显著高于对手。但它不是最高的——Opus 5 和 GPT-5.6 Sol 都是 +4.7,比它还高 0.6pp。这说明 60.9% 那个无工具分数的 +13.5pp 领先(对 GPT-5.6 Sol),来自纯推理底子,不是工具链外挂。这个信号比 65% 那个带工具分数更值得信。

还差多远:HLE 的人类基线是——领域专家在自己领域约 90%,跨领域专家 60–70%,普通人 5–10%。Fable 5.1 的 65%(带工具)大致落在「跨领域专家」的下沿,距离「领域专家在自己领域」还有 25 个百分点的身位。

别忘了一个污点:2025-07 FutureHouse 的同行评议复评发现,HLE 有 29% 的化学/生物题答案与文献矛盾。HLE 团队随后启动了 HLE-Rolling 动态修订机制。所以这 60.9% 是打在一套已知有噪音的靶子上的。

⑥ 业务流程 — AutomationBench VENDOR

考什么:Zapier 出品,测的是 agent 能不能跑完真实的跨系统业务流程。每道题启动一个「微型模拟公司」——CRM 记录、收件箱、日历、工单——然后丢一句真人运营会收到的需求给 agent。不评 agent 说了什么,评它离开时这个世界变成什么样。47 个模拟 SaaS 应用(Gmail、Slack、Salesforce、HubSpot、Jira、Zendesk 等)、约 500 个 API 端点、近 12,000 条断言,覆盖销售/市场/运营/支持/财务/HR 六大域各 100 题。

题目刻意做了「脏化」处理:塞无关数据逼你过滤、把关键信息藏在工具调用后面、用相似命名制造貌似合理的错答案、设置互相覆盖的业务政策规则。

系统分数口径

Fable 5.131.4%Anthropic 自有 harness

Kimi K3(max)30.8%llm-stats 转录口径

GPT-5.6 Sol(max)18.1%Zapier 官方榜(私有题集)

Fable 517.4%Anthropic 自有 harness

Fable 5(max)17.4%Zapier 官方榜 1.0.5

Opus 4.8(max)17.2%Zapier 官方榜 1.0.5

这是 Fable 5.1 相对自家上一代提升倍数第二大的一项:17.1% → 31.4%,+14.3pp,1.84 倍。而且注意这个对照——在 Zapier 官方榜上,Fable 5(17.4%)只比 Opus 4.8(17.2%)高 0.2pp,还输给 GPT-5.6 Sol(18.1%)。三个月后 Fable 5.1 跳到 31.4%,等于把这条赛道上的身位一次性拉开了。

但这项的跨家对比基本失效:(1) 表里 Opus 5 与 GPT-5.6 Sol 双双空格,没有可比对象;(2) 口径混乱——Zapier 官方榜跑的是私有 held-out 题集(明确说「比公开集更难,不发布」),Anthropic 用的是自有 harness,两者不可直接比;(3) Artificial Analysis 的独立版(AutomationBench-AA,657 题 / 40 个应用)曾给出 Fable 5 48.6%、Opus 4.8 48.5% 的完全不同的数——同一模型在不同 harness 下能差三倍。所以 31.4% 只能当「相对 Fable 5 提升很大」的证据,不能当「对 GPT-5.6 Sol 领先」的证据。

还有一个所有模型都没通过的考试:AutomationBench-AA 的原始结论是——每一个被测模型都违反了业务护栏。护栏违规数从 Gemini 3.5 Flash 的每题 0.46 次,到 Qwen3.7 Plus 的 1.26 次。Gemini 3.5 Flash 以「每违反一次护栏完成 15.0 个目标」拿下最佳比值,领先 Opus 4.8 的 13.5。Anthropic 这次没报护栏数据,是个缺口。

⑦ IDE 内编码 — CursorBench 3.2.0 VENDOR

考什么:Cursor 自家的一手基准,题目取自真实 Cursor 会话中的模糊、多文件任务。3.2 版在 3.1 的代码库理解、找 bug、规划、代码评审之外,新增了指令遵循与高级工具使用。它同时报四个数:成功率、每任务成本、每任务 token、每任务步数——所以它既能看能力,也能看单位经济。

系统分数每任务成本每任务 token步数

Fable 5.173.4%未报未报未报

Fable 5(Max)70.5%$17.32103,52572

Opus 5(Max)70.0%$8.2361,83878

GPT-5.6 Sol(Max)67.2%$5.6928,32048

Grok 4.670.8%———

Composer 2.556.1%$0.4414,28633

这项的「第一」要打最大的折扣:Fable 5.1 的 73.4% 与 Fable 5 的 70.5% 只差 2.9 个百分点。而 Anthropic 自己的脚注 4 写着:n=100 时误差 ±3.5 个百分点。

换句话说:按 Anthropic 自己给的误差条,这个差距统计上不可区分。表里仍然把 73.4 排在 70.5 之上,是排序习惯,不是统计结论。对 Opus 5 的 +3.4pp 同理,也在误差内。

反而是成本栏藏着真信息:Fable 5(Max)每任务 $17.32 / 103,525 token / 72 步;Opus 5(Max)$8.23 / 61,838 / 78 步;GPT-5.6 Sol(Max)只要 $5.69 / 28,320 / 48 步。Fable 5 是 GPT-5.6 Sol 成本的 3 倍、token 的 3.7 倍,换来的成功率高 3.3pp。

这就是缓存降价 75% 的真正靶心——Fable 系列的问题从来不是不够强,是太贵。Anthropic 这次没报 Fable 5.1 的成本栏,但既然单价不变、缓存读降 75%、官方自述 agentic 负载降 45%,推算 Fable 5.1(Max)每任务成本大致落在 $9.5–13 区间(按 Fable 5 的 $17.32 打 45%–25% 折),仍显著高于 GPT-5.6 Sol 的 $5.69。

胜负手地图:一张表看完

基准Fable 5.1 vs Fable 5Fable 5.1 vs Opus 5Fable 5.1 vs GPT-5.6 Sol判定

Terminal-Bench-Science 0.1+27.9pp(2.13×)无对照+30.2pp(2.35×)大胜

Terminal-Bench 4.0+13.8pp+3.5pp+18.5pp胜

GDPval-AA v2+106 Elo−8 Elo+115 Elo与 Opus 5 打平

OSWorld 2.0 partial+5.0pp+7.3pp+15.3pp胜

OSWorld 2.0 strict+5.6pp无对照无对照胜(缺对照)

HLE 无工具+7.2pp+10.7pp+13.5pp胜

HLE 有工具+7.4pp+10.1pp+12.9pp胜

AutomationBench+14.3pp(1.84×)无对照无对照胜(缺对照)

CursorBench 3.2.0+2.9pp(误差内)+3.4pp(误差内)+6.2pp对 Fable 5 / Opus 5 统计上打平

总账:对 Fable 5 是 9 题中 7 胜 2 平(两处「平」为误差内);对 Opus 5 是 6 题中 4 胜 1 负 1 平(负的 GDPval 也在误差内,实际是平);对 GPT-5.6 Sol 是 6 题中 6 胜。

五个被数字藏起来的真相

真相一:跃迁集中在「长程」,不在「写代码」

把 Fable 5.1 相对 Fable 5 的提升幅度排个序,梯度清晰得不像巧合:

基准提升倍数任务特征可视化

Terminal-Bench-Science 0.1+27.9pp2.13×真实科研流水线,跨工具长链

AutomationBench+14.3pp1.84×跨 47 个 SaaS 的业务流

Terminal-Bench 4.0+13.8pp1.33×终端端到端脏活

HLE 有工具+7.4pp1.13×专家级推理 + 检索

HLE 无工具+7.2pp1.13×纯推理

OSWorld 2.0 strict+5.6pp1.16×长程 GUI 完整交付

OSWorld 2.0 partial+5.0pp1.07×长程 GUI 部分进展

CursorBench 3.2.0+2.9pp(误差内)1.04×IDE 内多文件(30–80 步)

规律:越是需要自主规划、长程状态追踪、跨系统协调的任务,Fable 5.1 的提升越大;越是 Fable 5 已经能解决的短程、单域任务,提升越小甚至归零。

费曼式说法:Fable 5 是个好工程师,能帮你把一个文件改对。Fable 5.1 是能自己接下一个项目的人——从「改对一处」到「负责到底」。这次升级的工程量,全花在「负责」这两个字上。

真相二:partial → strict 的转化率,才是 OSWorld 的真相

单看 partial,Fable 5.1 比 Fable 5 高 5.0pp、比 Opus 5 高 7.3pp——看着还行,不算惊艳。但把 strict 除上去,故事变了:

系统partialstrict转化率解读

Fable 5.177.9%41.7%53.5%做到七成的活,过半能收尾

Fable 572.9%36.1%49.5%同上,差 4 个百分点

Opus 4.854.8%20.6%37.6%上一代的天花板

GPT-5.547.5%13.0%27.4%做得多、收得少

OSWorld 2.0 论文的原始发现是:agent 的失败不在基础 GUI 控制或写代码,而在「丢失约束、漏掉中途到达的信息、猜而不问、跳过验证」,最难的是「任务成败系于某个必须自己恢复出来的隐藏状态」。

Fable 5.1 把转化率从 49.5% 推到 53.5%,涨的这 4 个百分点,正是对着这四项死穴去的。这比 partial 那 5 个百分点更能说明「长程能力」的真实进步。

真相三:HLE 的工具增益四家持平——赢在底子,不在外挂

这一条前文已提,值得单独拎出来。四种模型的「有工具减无工具」增益是:

Fable 5.1 +4.1pp ← 不是最高
Fable 5 +3.9pp
Opus 5 +4.7pp ← 并列最高
GPT-5.6 Sol +4.7pp ← 并列最高

如果 Fable 5.1 的领先来自更好的工具编排、更好的检索策略,它的工具增益应该显著高于对手。事实相反:它比 Opus 5 和 GPT-5.6 Sol 还低 0.6pp。

结论:那 13.5pp 的无工具领先(对 GPT-5.6 Sol),挣在纯推理能力上,不是挣在工具链上。这是七项数据里最经得起推敲的一条——因为无工具口径剥离了 harness、工具实现、检索质量等一整套可调变量。

真相四:五个空格,比数字更响

原表有五处「–」。把它们摊开看:

缺位说明

Opus 5 — Terminal-Bench-Science 0.1Oh 但 Laude 官方榜上 Opus 5 是 30.0% 第一。这个数据明明存在。

Opus 5 — OSWorld strictpartial 报了 70.6%,strict 却空着

Opus 5 — AutomationBench无数据

GPT-5.6 Sol — OSWorld strictpartial 报了 62.6%,strict 空着

GPT-5.6 Sol — AutomationBenchZapier 官方榜上明明有 18.1%(还赢 Fable 5 的 17.4%)

这不是「忘了测」,是选择性披露。最刺眼的是 AutomationBench 那一格:Zapier 官方榜 1.0.5 上,GPT-5.6 Sol(Max)18.1% 赢 Fable 5(Max)17.4%。Anthropic 表里 Fable 5 记 17.1%、Fable 5.1 记 31.4%,而 GPT-5.6 Sol 那一格是空的。

读者看到「31.4% vs 空白」,自然推导出「Fable 5.1 碾压」;但按 Zapier 官方口径,真正的对照是「31.4% vs 18.1%」——依然领先,但落差从「无对手」变成「+13.3pp」。这个数远没有空格那么好看。

当然,空格也可能有正当理由(不同 harness 口径不可比、授权问题)。但脚注 2 已经明说了三项用自有 harness,那么在自有 harness 下重跑一遍 GPT-5.6 Sol 并非不可能。没跑,就留下了这个解释空间。

真相五:脚注 1 的自我拆台——护栏的价签,五个百分点

Anthropic 在脚注 1 里写了一句罕见的话:因为护栏拦下了任务,改由 Opus 4.8(网络安全题)和 Opus 5(生物题)代做,这很可能拉低了 Fable 5.1 和 Fable 5 的分数。

厂商主动说明「我方数字被自家安全策略拖累」,这在发布会材料里不多见。而第三方数据给了这个代价一个量级:

Terminal-Bench 4.0
Mythos 5.1(松护栏,同源模型) 60.9%
Fable 5.1 (标准护栏) 55.8%
─────
护栏成本 ≈ 5.1 个百分点

这大概是全报告最有意思的一个数字:同一个模型,只改护栏松紧,性能差约 5 个百分点。

它同时说明两件事——(1)Anthropic 的安全策略是真金白银的性能支出,不是公关话术;(2)Terminal-Bench-Science 0.1 里生命科学是最大域(19/70 题),如果生物题全部由 Opus 5 代做(Opus 5 在该榜只有 30.0%),那么 Fable 5.1 的 52.6% 确实是压着秤砣跳高,真实水平可能更高。

RUMOR 前提标注:60.9% 来自第三方追踪站且与 HLE 无工具分数完全相同,需官方确认。若此数有误,护栏成本的量级判断需相应修正。

商业三刃:这次发布真正卖的是什么

第一刃 · 价格:缓存读砍 75%

前文算过账,这里补一层行业背景。Fable 5 的定价是 Opus 4.8 的两倍。结果 Ramp 数据显示:发布两个多月后,Fable 5 只占企业客户 AI 工具总支出的约 11%,而更便宜的 Opus 5 在企业端花费超过了它。

这是个典型的「能力强但卖不动」困局。Anthropic 的应对不是降价(输入/输出单价一分没动),而是精准砍掉 agentic 场景里占大头的那一项:

缓存读取 $1.00 → $0.25/百万 token,−75%

相对基准输入价的倍数:其他 Claude 模型 0.1× → Fable 5.1 0.025×

官方口径:典型工作负载总成本降约 25%,高度 agentic 工作负载降约 45%

测算依据:Anthropic 用 8 月真实使用数据算的账

费曼式比喻:Fable 5 是辆跑车,但每次点火都要重新加满一箱油——于是你只在赛道日开它。Fable 5.1 没换引擎,它改了规矩:重复加油的成本砍掉四分之三。于是你终于敢天天开它上班。

这就是 45% 那个数字的意义——它不是打折,是把「用得起」的边界往前推了一大截。

第二刃 · 合规:EFS 把死结解开了

背景(这场仗怎么打起来的):

Fable 5 发布时,Anthropic 强制要求所有 Mythos 级模型的使用数据留存 30 天。对原本享受零数据留存(ZDR)协议的企业客户,等于一夜之间把隐私保障降了一级。金融、医疗、政府这些行业首当其冲。

约两周前,OpenAI 发动攻势:宣布 Private Safety Processing 方案,承诺即使用最强模型也能保持零数据留存。这是精准打在 Anthropic 的软肋上。

EFS(Enterprise Frontier Safeguards)的回应:

核心思路:数据存在客户自己控制的云基础设施上,而非 Anthropic 的系统里;人工审核默认也由客户自己完成。

与 100+ 家客户共同开发,覆盖金融、医疗、制造、法律等行业。

今年秋天开始分阶段上线。在 EFS 可用之前,符合条件的客户可以用零数据留存的方式使用 Fable 5.1。

Bloomberg 此前报道过 Anthropic 在开发这套系统,本次算是正式落地。

这一招的巧处:它把「合规争议」变成了「产品特性」。以前的命题是「要么接受 30 天留存,要么别用最强模型」;现在的命题是「数据在你家,我连看都不看,审核也归你」。

对企业采购而言,这消除的是一个具体的采购障碍,不是抽象的好感度。三周前 OpenAI 的矛,今天有了盾。

第三刃 · 准入:Mythos 5.1 的双通道

Mythos 5.1 与 Fable 5.1 同源,护栏更松,走两条可信访问通道:

通道面向状态

Cyber Verification Programme网络安全从业者(防御性安全工作)目前提供部分 Opus / Sonnet 级降护栏模型,近期将纳入 Mythos 级

Life Sciences Verification Programme生命科学专业人士(研发用途)新设,计划很快向科学家开放注册

Anthropic 称 Mythos 5.1 是其发布过的最强网络安全模型。同时 Fable 5.1 这边也有个配套改动:现在允许发现软件漏洞,但不协助开发针对这些漏洞的利用程序;Claude Code 用户在网络安全任务上的误报减少约 60%。

这一刃的商业逻辑:它把「最强能力」切成两层卖——一层给所有人(Fable 5.1),一层给通过审核的专业机构(Mythos 5.1)。既守住了安全叙事,又没把能力锁死。对企业客户来说,这意味着「想用最强能力就要过审」,而这个审核本身就是一道护城河。

三个能力 demo,按可信度分级

发布会除了跑分,还给了几个能力展示。它们的证据强度差别很大,必须分开看:

展示内容证据强度评级

金星地形图用 NASA 麦哲伦任务 30 多年前的雷达图像训练神经网络,为金星约 1/3 表面生成新高分辨率地形图。原地形数据精度 10–20 km,新地图达 2–3 km(提升 5–10 倍),高度精度最高提升 25%。以 Creative Commons 协议公开发布,宣称对 NASA 的 VERITAS 与 ESA 的 EnVision 任务有用。可下载验证CONFIRMED

蛋白质设计Mythos 5.1 配开源蛋白质设计/折叠工具,设计的高亲和力结合物在三个靶点上的结合亲和力比 AdaptyvBio 蛋白质设计竞赛的最佳提交高 10 倍,成功率接近 50%(行业一般水平 10–15%)。经外部实验验证CONFIRMED(第三方湿实验)

GPU kernel 优化Mythos 5.1 编写自定义 GPU kernel + 缓存中间结果,把七个开源深度学习模型的推理速度提升 1.4–2.5 倍,全基因组分析的 GPU 成本降低 30–60%。宣称这类优化通常需要性能工程团队数周,学术实验室做不起。厂商自述,无独立复现VENDOR

Millennium 崩溃根因投资公司 Millennium 用 Fable 5.1 找到了一个困扰其工程师数年、其他模型也没解决的罕见崩溃根因。早期客户证言RUMOR

Jane Street 背书量化交易公司 Jane Street 称 Fable 5.1 在长任务中保持可读性的能力明显好于前代。客户证言RUMOR

怎么读这张表:金星地图和蛋白质设计是真货——前者 CC 公开可下载,后者过了湿实验。这两项构成了「AI 做科研」叙事的硬支撑,也是 Terminal-Bench-Science 那个 52.6% 的现实注脚。

Millennium 和 Jane Street 那两条,听听就好——客户证言在发布会材料里的标准功能是「让跑分看起来像真事」,不是证据。

治理侧三个动作:容易被跳过,但都挺硬

① 反蒸馏机制

从发布日起,新注册的 API 账号不能再在多轮对话中手动编辑 Claude 的先前上下文、同时保留思考链记录。这条针对的是一个已知的公开蒸馏技巧——用强模型的输出训练另一个模型。Anthropic 把这条路堵了。

② 不可见水印

Anthropic 于 2026 年 7 月签署了欧盟 AI 法案的透明度实践准则。Fable 5.1 作为 8 月 2 日之后发布的模型,输出文本中内置了不可见水印。对使用体验无影响。检测 API 以私人预览形式逐步推出,目前只对欧盟法律要求的组织开放(监管机构、媒体、事实核查机构等)。

③ 误报降低 + 漏洞发现开闸

Claude Code 用户在网络安全相关任务上的误触发减少约 60%——被安全限制打断的次数大幅下降。

Fable 5.1 现在允许发现软件漏洞,但不生成漏洞利用代码。对做防御性安全的人是实质性松绑。

这三条合起来看:前两条(水印、反蒸馏)是防御性的——防别人抄、防别人冒充。第三条(误报降低、只找漏洞不写利用)是进攻性的——让防御方真的能用起来。

它们共同回应的是同一个压力:能力越强,滥用风险越大。Anthropic 的答案是「能力分级 + 输出可追溯 + 防御侧松绑」,而不是一刀切。

风险与局限

七项里三项是厂商自跑:Terminal-Bench 4.0、AutomationBench、CursorBench 3.2.0 全部用 Anthropic 自有 harness(脚注 2 明说)。其中 CursorBench 的 +2.9pp 落在自家声明的 ±3.5pt 误差内,等于统计上没赢。

五处空格:Opus 5 与 GPT-5.6 Sol 共缺 5 格,且缺位方向对 Anthropic 有利或至少无害。最刺眼的是 AutomationBench——Zapier 官方榜上 GPT-5.6 Sol 的 18.1% 是存在的,还赢 Fable 5。

effort 不对称:脚注 3 说 Fable 5.1 用「max effort + 自适应思考 + 1M 上下文」,其他模型若不支持则用「最高 reasoning effort + 最高可用上下文」。自适应思考是 Anthropic 独有,这条脚注的实际含义是:对手跑的是次优配置。

GDPval-AA 的裁判是 LLM:盲评由模型而非人完成,这是该基准已知的系统性偏差风险。且同一模型不同 effort 档能差 117 Elo(Opus 5: 1852/1819/1735),比 Fable 5.1 与 Opus 5 的 8 分差大一个数量级——8 分完全在噪音里。

成本栏缺失:Fable 5.1 在 CursorBench 上没报成本/token/步数。按缓存降价推算每任务约 $9.5–13,仍显著高于 GPT-5.6 Sol 的 $5.69。「最强」和「最划算」不是同一个模型。

Fable 5 的 12 周旗舰寿命:5/20 → 9/1。企业 POC 窗口被压到季度级,选型决策的时间成本上升。

自家产品栈的尴尬:Fable 5.1 在 6 项可比基准里 4 胜 Opus 5,但 Anthropic 官方建议仍是「从 Opus 5 起步」。这是罕见的「最强模型不是默认推荐」时刻——因为 agentic 能力 ≠ 通用性价比。

护栏数据缺口:AutomationBench-AA 的原始结论是「每个被测模型都违反业务护栏」,Gemini 3.5 Flash 以每违规一次完成 15.0 个目标领先。Anthropic 这次没报 Fable 5.1 的护栏违规数据。

Mythos 5.1 的 60.9% 存疑:第三方追踪站数据,与 Fable 5.1 的 HLE 无工具分数完全相同,需官方确认。若成立,则「护栏成本 ≈ 5pp」;若不成立,该推论作废。

HLE 靶子本身有噪音:FutureHouse 复评发现 29% 的化学/生物题答案与文献矛盾,HLE 团队已启动 HLE-Rolling 动态修订。

战场地图:该用哪个

场景推荐理由

常规编码、日常 IDE 工作Opus 5 或 Composer 2.5CursorBench 上 Fable 5.1 对 Opus 5 的 +3.4pp 在误差内,但成本可能高 40–130%。性价比不成立。

职业交付物(报告/分析/图表/文书)Opus 5GDPval-AA v2 仍第一(1861 vs 1853,实际打平),且百万上下文默认全开更适合长文档。

长程自主科研 / 数据分析流水线Fable 5.1Terminal-Bench-Science 52.6% vs 此前最佳 30.0%,断层第一。这是它的主场。

跨 SaaS 的业务流程自动化Fable 5.1AutomationBench 17.1% → 31.4%,1.84 倍。但注意官方榜上 Kimi K3 有 30.8% 的转录数据,差距没那么绝对。

需要 GUI 操作的长时间工作流Fable 5.1OSWorld strict 41.7%、转化率 53.5% 双第一。但仍有过半任务干不完,须配人工复核。

高难度专家级推理(无检索)Fable 5.1HLE 无工具 60.9%,公开模型首破 60%,且赢在纯推理底子。

成本敏感的高并发 agenticGPT-5.6 Sol 或 Opus 5GPT-5.6 Sol 在 CursorBench 上 $5.69/任务 vs Fable 5 的 $17.32,token 只有 1/3.7。差距 6.2pp。

网络安全(防御侧)Mythos 5.1需通过 Cyber Verification Programme 审核。仅限部分美国组织,正协调扩围。

生命科学研发Mythos 5.1需通过 Life Sciences Verification Programme 审核。蛋白质设计的湿实验验证结果最强。

金融 / 医疗 / 政府等强合规Fable 5.1(零留存过渡期)→ EFSEFS 秋季分阶段上线;在此之前合格客户可零数据留存使用。这是它相对 Fable 5 的关键改善。

一句话收尾

这次发布会最值得记住的,不是 Fable 5.1 赢了多少项,而是它在哪儿赢、赢多少——长程自主性上翻倍,短程编码上几乎没动。Anthropic 把三个月的工程量,全押在了「让 AI 自己把一整件事干完」这一件事上。

跑分只是入场券。真正让它进企业采购清单的,是缓存读降 75% 那一刀和 EFS 那个盾:前者解决了「用不起」,后者解决了「不敢用」。Ramp 那个 11% 的数字说明 Fable 5 卡在哪儿——不是不够强,是太贵、太不敢用。Fable 5.1 两个都治了。

至于 Opus 5 被自家小弟压一头这件事,Anthropic 处理得很清醒:官方建议仍是「从 Opus 5 起步」。在这个迭代速度下,承认「最强 ≠ 默认」,比硬推旗舰更诚实,也更聪明。

附:数据来源与文件清单

来源用途链接

Anthropic 官方 benchmark 对比表七道基准全部数据 + 四条脚注(一手材料)anthropic.com

Terminal-Bench-Science 0.1(Stanford / Laude Institute)官方榜 30.0% / 22.4% / 21.4% 对照news.lavx.hu · explainx.ai · tbench.ai

Zapier AutomationBench 官方榜 1.0.5GPT-5.6 Sol 18.1%、Fable 5 17.4% 对照zapier.com/benchmarks · github.com/zapier/AutomationBench

Cursor CursorBench 3.2 官方榜成本 / token / 步数三栏cursor.com/evals

Artificial AnalysisGDPval-AA v2、AutomationBench-AA 独立口径artificialanalysis.ai

OSWorld 2.0(XLANG Lab / Snorkel AI)108 题、27.25 检查点、partial/strict 定义、失败模式分析snorkel.ai/leaderboard/os-world-2-0 · github.com/xlang-ai/OSWorld-V2

Humanity's Last Exam(CAIS / Scale AI)2,500 题、100+ 学科、出题流程、人类基线、FutureHouse 复评lastexam.ai · arXiv:2501.14249 · Nature (2026-01-28)

AI Release TrackerFable 5.1 定价、Terminal-Bench 4.0 改版说明、Mythos 5.1 60.9%(存疑)aireleasetracker.com

cnBeta / 微博 / Firstpost / Swikblog发布会背景、EFS、Ramp 数据、三条能力 demo— 交叉验证

研究日期 2026-09-02 | 数据截止 2026-09-02 12:00 GMT+8 | 一手材料为 Anthropic 官方 benchmark 对比表(2026-09-01 发布)

数据分级说明:CONFIRMED = 官方榜/论文/可下载产物可查;VENDOR = 厂商自跑、无独立复现;RUMOR = 客户证言或第三方转述。

Elo 转胜率换算采用标准公式 1 / (1 + 10^(−Δ/400));partial/strict 转化率为本报告派生指标,非官方口径。

本报告为独立分析,未接受任何厂商资助。所有跨家对比均已标注 harness 口径差异;口径不一致处,以「不可直接比较」标注而非强行排序。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens