1691 一个建立在 29 场对战上的世界第一
Qwen3.8-Max-0902 登顶 Code Arena: WebDev —— 一份关于「分数」这件事本身的拆解
文本版 · 供搜索与朗读
1691 分 —— 一个建立在 29 场对战上的世界第一
深度研究 · 2026.09.02
1691
一个建立在 29 场对战上的世界第一
Qwen3.8-Max-0902 登顶 Code Arena: WebDev —— 一份关于「分数」这件事本身的拆解
数据快照 2026-08-31
636,842 票 / 122 模型
三路并行核验
序:先把话说在前面
9 月 2 日,阿里发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 榜上拿下 1691 分,位列第一。中文媒体一片欢腾:「前端编程能力跃居全球第一」「超越 Claude Opus 5」。
这话不算假。但它漏掉了三件事:
榜单自己判定:第一名与第二名并列。
在两者唯一有直接样本的正面对战中,第二名赢了第一名。
支撑这次发布的官方硬基准表里,Qwen 在 9 项上落后、6 项上领先。
这不是一篇唱衰稿。恰恰相反——中国模型把差距压缩到统计误差以内,这本身就是 2026 年最重要的产业事实。但「差一点」和「超过了」是两件不同的事,尤其在有人拿它做采购决策的时候。
01先弄明白:Arena 的分数是个什么东西?
在讨论「谁第一」之前,得先搞清楚这个「分」是怎么来的
它不是考试分,是棋类等级分
Arena 的做法很朴素:让两个模型匿名回答同一个问题,请人类投票选哪个更好,赢的次数多了分就高。
具体算法叫 Bradley-Terry 模型——和棋类比赛的 Elo 等级分是同源思路,只不过 Elo 是每局后微调,BT 是拿全部对战数据一次性做最大似然估计。排序代码已开源,默认标度是 400 分对应 10:1 的胜率比。
这意味着分数差可以直接换算成胜率。按这套标度,1691 与 1688 相差 3 分,对应的预期胜率是 50.43% —— 几乎是抛硬币。
每个分数都带着一个误差棒
排名模型分数置信区间票数标记
1qwen3.8-max-09021691±19 → 1672–17101,389Preliminary
2claude-opus-5-max1688±8 → 1680–169610,334—
3kimi-k3-max1674±114,544—
4qwen3.8-max1669±123,219Preliminary
看清楚这两组数字的关系:Claude 的整个置信区间 [1680, 1696],完整地落在 Qwen 的 [1672, 1710] 之内。
Code Arena: WebDev 前四名置信区间。方块为 ±CI 范围,圆点为拟合分。
红色虚线框内为两者重叠区 —— 按 Arena 官方规则,重叠即并列。
用统计语言说:3 分差距,合成标准误约 10.5,z ≈ 0.29,p ≈ 0.77。这个差距在统计上完全不存在。
最锋利的一击:榜单自己说「这两人并列」
Arena 有一列叫 Rank Spread(排名区间),官方定义是「基于所有模型的置信区间,一个模型可能拿到的最好名次与最差名次构成的区间……两个模型的 rank spread 若重叠,即为并列」。
1–4
#1 Qwen3.8-Max-0902
排名区间
1–4
#2 Claude Opus 5 Max
排名区间
按照 Arena 自己定下的规则,第一名和第二名是并列。
官方在 2025 年 7 月的榜单更新日志里写得更直白:「重加权会提高 Arena 分数的方差,我们因此观察到更宽的置信区间。这意味着新的排名会因为置信区间重叠而出现更多并列。」
—— 换句话说,「重叠即并列」不是外人的解读,是榜单明示的读法。
「Preliminary」不是票少,是身份问题
Qwen 头上那个 Preliminary 标记,很多人以为等于「票数不足,仅供参考」。查证下来不是。官方定义是:若一个模型在匿名状态下被测试、随后才公开发布,分数标为 preliminary,直到公开发布后收集到足够新票。该标记意味着分数可能变动。
决定性证据(机器可验证)
我们从榜单页面内嵌 JSON 中导出了全部 122 行数据的 releaseType 字段:6 个 Preliminary 模型无一例外都是 co_release(Arena 同步首发)或 pre_release(预发布),其余 116 个全是 null。100% 对应。
所以:Qwen 带标记、票数更多的 GLM-5.3-Max 不带标记,原因是发布路径不同,与票数无关。1,000 票是「能否上榜」的门槛,不是「能否摘帽」的门槛。顺带一提,Qwen 的榜单内部匿名代号是 kiana-8mgg,而 Claude 用的是真名 —— 这也印证了 Qwen 的票有一部分是在尚未公开发布、以代号参测的状态下收集的。
需要澄清一点:Qwen 的 1691 分不是 AutoEval 自评分。Arena 确有 AutoEval 机制(用奖励模型快速给预估分),但那些条目带闪电标且「在真人投票验证前不赋予正式名次」。Qwen 在总榜有正式 Rank=1 且有 1,389 张真人票,属拟合结果。
02头对头 11 : 18 —— 榜首模型输掉的那 29 场
如果说置信区间只是「证明不了谁更强」,那接下来这组数据就是反向证据
Arena 榜单页面底部有四张图表,数据以内嵌 JSON 形式存在页面上,但不以表格展示。我们把它挖出来了。
数据来源:arena.ai 榜单页面内嵌 win_fraction_heatmap 与 battle_count_heatmap
其他两项指标,也都是 Claude 领先
指标Claude Opus 5 MaxQwen3.8-Max-0902更优
直接对战62.1%(n=29)37.9%Claude
平均胜率(对每个对手)65.95%62.71%Claude
共同对手横评(加权)68.2%(N=1,301)65.8%(N=196)Claude
必须诚实的两点
其一,29 场样本也太小。双侧二项检验 p ≈ 0.26,这个 62.1% 本身也不显著。所以严谨的说法是:没有任何证据支持 Qwen 强于 Claude Opus 5 Max,而仅有的直接样本是反向的。
其二,Qwen 不是靠捏软柿子刷分。我们特意验了这一点 —— Qwen 的加权对手均分是 1613.1,Claude 是 1607.5,Qwen 的对手反而略强。这条质疑不成立。
但有一个结构性事实无法回避
Qwen 与榜单第 3 名 kimi-k3-max 的正面交锋数是 0,与第 11 名 glm-5.3-max 只有 2 场。
它的 1691 分,主要是在其余对手上的传递性推算结果,而非与头部模型全面对打的产物。
把「29 场」这个数字本身当作新闻。一个全球第一的判定,建立在与最直接竞争者的 29 场有效对战上。这不是某个厂商的阴谋,而是榜单机制的结构性短板 —— 却比任何阴谋论都更值得警惕。
03$5/MToken 的算术,与被省略的坐标
官方的第二张牌:blended $5/MToken,占据「帕累托前沿最高分位置」
这个公式是对的
官方用的 blended 公式是:blended = (1 × 输入价 + 3 × 输出价) ÷ 4,即假设 token 消耗为输入:输出 = 1:3。逐项验算:
模型输入输出计算式blended官方称
Qwen3.8-Max-0902$2$6(2 + 3×6)/4$5.00$5 ✓
Claude Opus 5 Max$5$25(5 + 3×25)/4$20.00$20 ✓
Kimi K3 Max$3$15(3 + 3×15)/4$12.00$12 ✓
三个数全中。而且这个 3:1 不是阿里自己发明的 —— 它是 Artificial Analysis 的行业惯例,理由正是「agentic 负载通常是长生成配短提示」。Arena 只是沿用。
所以「斩杀所有价格大于 $5 的模型」这句话是精确成立的:Opus 5 Max($20,1688 分)和 Kimi K3 Max($12,1674 分)在分数与价格两个维度上同时被 0902 支配,确实不在帕累托前沿上。这句宣称没有吹牛。
但 3:1 这个坐标,恰好挑了对 Qwen 最有利的一段
Qwen 便宜在哪?主要便宜在输出侧:输出 $6 vs $25(4.17 倍),输入只便宜 2.5 倍($2 vs $5)。那么,输入占比越高,Qwen 的优势就越薄:
口径(输入:输出)Qwen blendedOpus 5 Max blendedQwen 便宜
10:1(长文档 / RAG)$2.36$6.822.89×
1:1$4.00$15.003.75×
3:1(官方口径)$5.00$20.004.00×
纯输出$6.00$25.004.17×(上限)
3:1 处在 2.89×–4.17× 的偏上端。它不是最夸张的算法,但确实偏向 Qwen 擅长的场景。
真正被省略的,是前沿上剩下的那几个点
全榜同口径(blended 3:1)性价比排行。数据来源:arena.ai 2026-08-31 快照价格与分数
最讽刺的发现:性价比之王是阿里自家的 qwen3.8-flash-next
从 flash-next 升级到 0902,多花 $4.61/M(11.8 倍)只买到 71 分。0902 的「$5 屠夫」叙事,被同门小兄弟按在地上 —— 每美元效能差 12.2 倍。
给阿里一个公允的说法
不过话说回来,得给一个反向修正。换成「扣掉 1500 分可用基线后,为多出来的每一分能力付多少钱」这个口径,0902 从总榜第 10 升到第 6 位,并且是所有 1650 分以上模型里最便宜的一个。所以对「帕累托前沿最高分」的公允评价是:这句话在「有能力挑战 Opus 5 的那一小撮旗舰里」完全成立;在「全榜性价比」意义上不成立。阿里选了一个自己赢、且听众容易自行滑向「整体最优」的坐标系 —— 不是造假,是选择性披露。
0417 项硬基准:落后 9 项,领先 6 项
官方发布时附的对照表,是本次发布最有信息量的材料,也最容易被略过
9 项
落后于 Claude Opus 5
幅度合计 −56.7 分
6 项
领先于 Claude Opus 5
幅度合计 +20.2 分(3 项 ≤0.5)
落后的九项,是最硬的九项
基准测什么0902Opus 5差距
TerminalBench 3.0Agentic 终端编程29.042.7−13.7
ProgramBench黑盒软件复现28.041.5−13.5
NL2Repo-Bench仓库级代码生成64.972.3−7.4
SWE-Marathon超长程软件工程44.850.0−5.2
DeepSWE 1.1Agentic 编码69.373.6−4.3
Toolathlon Verified真实工具使用73.377.6−4.3
JobBench专业职业任务64.067.8−3.8
CoWorkBench 阿里自研长程办公76.179.6−3.5
ClawEval-MM多模态工具使用80.281.2−1.0
五项 agentic coding 基准(TerminalBench、ProgramBench、NL2Repo、SWE-Marathon、DeepSWE)全部落后。这与官方文案「更强的智能体编程能力,在多步推理、工具调用、端到端 app 生成方面均刷新全球上限」构成直接冲突。
特别要说 CoWorkBench:这是阿里自己的基准,而 0902 主打的正是「Coding & Cowork 双线后训练」。结果在自家场地上还输 3.5 分,且只比旧版涨了 1.3 分(74.8 → 76.1)—— Cowork 这条腿基本没跑起来,这次升级实质上是一次纯 Coding 升级。
领先的六项,含金量逐个过筛
领先项幅度研判
ERQA(具身推理视觉问答)+11.0唯一的大胜。但它是视觉/多模态基准,不考编码。把它列进「Coding 升级」的证据链,本身就说明编码侧领先项不够用。
BabyVision (w/ CI)+3.3分数已挤到天花板(>90),区分度低;且「w/ CI」= 带代码解释器,属工具增强而非裸模型能力。
SWE-Atlas QnA+3.1⚠ 只取了 QnA 子集。SWE-Atlas 有 QnA(仓库问答)/ RF(仓库修复)/ TW(测试编写)三类,各子集分差极大。QnA 只考「读懂仓库」,不考「改对代码」 —— 选的是对自己最有利的口径。
QwenSWEBench V2+2.0⚠ 阿里自研基准,命题、数据、评测脚本全在自己手里。存在直接利益冲突。
Automation Bench+0.5统计噪声。
MLS-Bench-Lite+0.3统计噪声。
结论:0902 唯一过硬、可复现、无利益冲突的大幅领先只有 ERQA 一项,而它不考编码。
最值得写的一段:86.6 → 11.3
这是整份报告里我最想让你记住的数字。Terminal-Bench 从 2.1 换到 3.0,各家的分数是这样的:
Terminal-Bench 版本更替的断崖。0902 把 29.0 拉回来是补课,不是领跑
在 TB 2.1 上,Qwen 是 86.6,压过 Fable 5 的 84.6,属于第一梯队甚至领先。换到 TB 3.0,它掉了 75.3 分,是全场跌幅最大的模型。0902 把它拉回 29.0(+17.7),这才是这次后训练真正干的事:把 TB 2.1 时代的 harness 红利缺口补回来。
同期被拿掉的两个基准,正是 Qwen 输最惨的两个
基准8 月表9 月表Qwen 表现
SWE-bench Pro✅ 有❌ 消失67.7 vs Fable 5 的 80.0(−12.3)
FrontierSWE✅ 有❌ 消失73.5 vs Fable 5 的 88.8(−15.3)
QwenSWEBench V2❌ 无✅ 新增阿里自研,赢 2.0
SWE-Atlas QnA❌ 无✅ 新增挑子集,赢 3.1
一次升级,同时「换了 Terminal-Bench 大版本」+「删掉两个输 12–15 分的基准」+「新增一个自研和一个自选子集」。我不打算说这是造假 —— 基准迭代本来就是常态。但这个组合动作的方向性太一致了,读者有权知道。
一个必须标注的可比性问题
官方表的脚注我们没能拿到逐字原文(它们只存在于 X 推文的配图里,无文本层,无法提取)。但我们在同期智谱 GLM-5.3 的研报里找到了几乎同措辞的配置说明,可判断行业通用口径是:用 Claude Code harness,reasoning effort=max,400K 上下文,128K 最大输出,avg@3,600 agent turns,10 小时超时。
问题在于:Qwen 用自己的 RL 训练过的 harness 跑分,而竞品分数是「跨 harness 的最佳已发布分数」。阿里官方博客明确写过,其 RL 训练环境覆盖 QwenWork / Claude Code / Codex / OpenClaw / Hermes 多个 harness —— 用自己练过的场地去比,天然占优。
更狠的一条:在 tbench.ai 官方 TB 3.0 榜上,最高分是 GPT-5.6 Sol 的 34.4%,既没有 42.7 这个数,也没有 Qwen 的任何条目。也就是说,官方表里的「Opus 5 = 42.7」和「Qwen = 29.0」很可能不在同一个 dataset tag 上 —— 这两个数相减得到的「−13.7 分差距」,在严格意义上不成立,只能作为方向性参考。
05真正的信号:中国模型的集体上位
前面都在挑刺。这一章说真正重要的事
挑刺是因为「登顶」这个说法被放大了;但中国模型整体上位这件事,不但成立,而且比登顶更重要。
Top 20 的中美对照
维度中国(11 席)美国(9 席)倍数
平均分1622.21609.4中国 +12.8 分
中位分16081616美国 +8
平均 blended 价格$3.54$18.21中国便宜 5.1×
中位 blended 价格$3.30$20.00中国便宜 6.1×
每美元分数458.388.4中国 5.2×
中国在平均分上已经反超,但中位分仍落后 —— 优势来自「厚度」,头部最强仍是美国的 Opus 5。这是群体厚度 vs 单点尖峰的差异。
美国 9 席里 Anthropic 独占 6 席,其中 3 席是均价 $20、分数仅 1556–1563 的旧型号。这既是护城河(榜单刷脸密度),也是价格包袱。
中国厂商价格带从 $0.39 铺到 $12,覆盖完整;美国从 $2.86 到 $40,低端几乎空白 —— 而低端正是 agentic 用量爆发的地方。
开放权重阵营 100% 是中国厂商
维度开放权重(9 席)闭源(11 席)
平均分1609.31622.3
平均 blended$3.22$15.81
每美元分数500.5102.6
中国厂商占比9/9 = 100%2/11
能力差已被压到 13 分(约 0.8%),价差仍有 4.9 倍。
不过要提醒一句:「开放」正在被重新定义。Qwen3.8-Max 和 Kimi K3 都是「可下载权重 + 营收门槛」,不是 OSI 意义上的开源。真正的无条件开源只剩 Apache 2.0(qwen3.8-27b、hy4-preview)和 MIT(GLM 系列、DeepSeek 系列)。
0902 不开源 —— 这是最容易被误读的一点
名字是什么开源?协议
Qwen3.8-2.4T-A95B8 月 12 日放出的旧版底座权重✅ 是自定 Qwen3.8-Max License
Qwen3.8-Max云端托管版❌ 否闭源 API
Qwen3.8-Max-09029 月 2 日的后训练快照❌ 否闭源 API
开源的 A95B 是纯文本、强制思考、无视觉,与云端版不是一回事。
自定协议有两道闸门:月活 >1 亿或月营收 >$2000 万须显著标注;运营 MaaS 且关联方 12 个月合计营收 >$5000 万需单独授权。
0902 没有任何独立权重包,榜单直接标 Alibaba · Proprietary。
「可以私有部署」只对旧版底座成立,对 0902 不成立。顺便说个耐人寻味的细节:官方推文下的第一条有效评论就是 ——「Are you releasing the weights?」
Anthropic 的反应:不是降价,是改计价结构
阿里登顶的前一天(9 月 1 日),Anthropic 发布了 Fable 5.1:
缓存读取费从 $1/M 砍到 $0.25/M(−75%),官方称典型负载成本降 25%、高 agentic 负载最高降 45%
输入/输出标价一分未降(仍 $10/$50)
原定 9 月 1 日上调的 Sonnet 5 促销价,Anthropic 主动取消上调
Fable 5.1 的 Terminal-Bench 4.0 得分 55.8%,而它尚未进入 Arena 榜单 —— 下一个变数已经在了
这说明 Anthropic 已经意识到:在 agentic 场景里,真正的成本项是反复读取的上下文,不是单价。
价格战不是单边下降,而是「高端涨价、低端崩塌」
−67%
Opus 档位
2025 年 11 月一次性降价,此后 8 个月纹丝不动
−75%
DeepSeek V4-Pro
小米 MiMo-V2.5 部分场景降近 99%
+83%
智谱 GLM 反向涨价
Qwen 自己从 $1.25/$3.75 涨到 $2/$6
而这一切发生在上游成本暴涨的背景下 —— 2026 年上半年 HBM 市价涨幅超 500%。降价是被推理层技术创新(MoE 稀疏激活、线性注意力、量化、多级 KV 缓存)硬扛出来的,不是成本自然下降。
06那么,开发者该怎么做?
社区已形成「路由而非切换」的共识
「大多数团队已经稳定在一个模式上:把 60–80% 的 agent 流量路由到自托管的 Qwen 或 Kimi,剩下的 20–40% 升级到 Claude 或 Gemini。」
「聪明的做法不是『切换』,而是『路由』。把批量的、agentic 的、长上下文的工作发给 Qwen3.8-Max 拿成本优势,把前沿模型留给最难的问题。」
场景建议理由
批量 / 高并发 / 长上下文 / 内部工具qwen3.8-flash-next($0.39)
或 glm-5.3-flash($0.41)每美元效能是 0902 的 12.2 倍
前端页面生成 / 原型 / 视觉一致性要求高qwen3.8-max-0902Arena WebDev 与视觉能力确属第一梯队,且 $5 比 $20 便宜 4 倍
仓库级重构 / 复杂 SWE 任务仍用闭源前沿(Opus 5 / Fable 5.1)五项 agentic coding 基准全部落后;第三方实测直言「若你的负载是仓库级重构,这不是替换你现有模型的选择」
自托管 / 合规 / 数据不出域Apache 2.0 或 MIT 模型
(qwen3.8-27b、GLM、DeepSeek、hy4-preview)避开 Qwen3.8-Max 的 $5000 万条款与 Kimi K3 的 $2000 万 / 1 亿 MAU 条款
专业办公 / Cowork 场景观望阿里自家的 CoWorkBench 上仍落后 Claude 3.5 分
一条实践警告
0902 用在真·agentic 场景时,账单要盯输出侧。它的 $5 blended 是建立在 1:3 假设上的。若你的实际负载是 1:1,blended 只有 $4(更便宜);若是 1:6,则升至 $5.71。用 blended 做预算之前,先量一量自己的真实输入输出比。
07拍板
一 句 话 结 论
Qwen3.8-Max-0902 拿下的第一是真的,但它是一个 1,389 票、±19 分、与第二名并列、且头对头 11:18 落后 的第一。它真正证明的不是「中国模型超越了 Claude」,而是 ——
中国模型已经追赶到了统计误差以内,
而价格差仍有 4 到 5 倍。
后面这件事,比前面那件重要得多。
01
「登顶」按 Arena 自身规则是并列第一(Rank Spread 均 1–4),3 分差距 p≈0.77,统计上不存在。
02
唯一有直接样本的对战中,Qwen 11 胜 18 负;平均胜率与共同对手横评两项也都是 Claude 领先。
03
17 项硬基准落后 9 项、领先 6 项,落后幅度 56.7 分 vs 领先 20.2 分;五项 agentic coding 基准全落后;唯一大幅领先的 ERQA 不考编码。
04
$5 的算术精确、叙事取巧:3:1 是行业惯例,但同口径下阿里自家的 flash-next 只要 $0.39,每美元效能高 12.2 倍。
05
86.6 → 11.3 是本次研究最刺眼的数字:换了个基准大版本,Qwen 掉 75.3 分,同期被拿掉的 SWE-bench Pro 与 FrontierSWE 正是它输 12–15 分的两项。
06
0902 不开源,且榜单前 7 名有 5 个国产模型、Fable 5.1 尚未入榜 —— 这个第一,可能撑不过一个月。
附录数据边界
查不到的一律写明,不编造
附录 A:我们没查到的
项目状态
官方 benchmark 表的 12 条脚注逐字原文未查到 仅存在于 X 配图内,无文本层
0902 后训练的技术细节(数据配比、RL 算法、奖励模型)未披露
9 月 2 日发布当天的开发者独立实测未查到 X / Reddit / 知乎 / V2EX 均无
Qwen 系列的 SWE-bench Verified 成绩未查到 官方从未公布
Qwen 在 tbench.ai 官方 TB 3.0 榜上的条目不存在
Anthropic 官方对 Qwen 登顶的表态未查到
Preliminary 摘帽所需的具体票数未查到 官方仅称 "enough fresh votes"
附录 B:信源冲突(已在正文标注采信)
项目冲突处理
Qwen3.8-Max 权重许可证4 源称自定协议 vs 1 源称 Apache 2.0采信多数派,有许可证原文与 HF license: other 交叉验证
DeepSeek V4 Flash 定价arena $0.44/$1.32 vs 另源 $0.14/$0.28表格统一采用 arena 口径
GPT-5.6 Sol 定价arena $4/$20 vs 另源 $5/$30表格统一采用 arena 口径
Claude Code 企业份额Menlo 称 54% vs valueaddvc 称约 42%两者均列出
Kimi K3 激活参数104B vs 约 50B采用 104B
附录 C:数据可信度评级(节选)
论断评级
Code Arena 使用 Bradley-Terry 模型确证
Rank Spread 重叠即并列(官方定义)确证
#1 Qwen 与 #2 Claude 排名区间均为 1–4确证(按官方公式复算吻合)
Preliminary ⇔ releaseType ∈ {co_release, pre_release},122 行 100% 对应确证(机器验证)
Qwen vs Claude 直接对战 11:18,n=29确证(官方内嵌图表数据)
阿里 7 项 Domain 子榜宣称全部属实确证
Qwen 在 Frontend / Fullstack Category 子榜均非第一确证
claude-opus-5-max 35 天内 1725→1705→1691→1688确证
官方曾追溯性修改 Code Arena 分数(claude-fable-5,2026-07-12)确证
长度是主导风格因子(系数 0.249 vs markdown 0.02–0.03)确证
Qwen 靠「捏软柿子」刷分已证伪 Qwen 对手均分反而略高(1613.1 vs 1607.5)
Qwen 的 1691 分是 AutoEval 自评分已证伪 有正式名次与 1,389 真人票
数据来源:arena.ai Code Arena | WebDev(2026-08-31 快照,636,842 票 / 122 模型);阿里千问官方发布(X @Alibaba_Qwen、千问 AI 平台、QwenCloud);DataLearner;tbench.ai;Artificial Analysis;各厂商官方定价页与研报。
方法:三路并行核验 —— A 路(榜单方法论与数据可信度)、B 路(模型技术与硬基准)、C 路(竞争格局与产业意涵),交叉验证后由主笔整合拍板。所有数字均标注来源,查不到的一律写明「未查到」。
生成时间:2026 年 9 月 2 日 · 模型发布当日