JetBrains Mellum2.1:架构没动,SWE-bench 跳了 45 分,动的是强化学习的位置

2026 年 10 月 8 日,JetBrains 把 Mellum2.1 挂上 Hugging Face。12B 参数,Apache 2.0,激活 2.5B。同一天,社区里最刺眼的一个数字是 SWE-bench Verified 从 2.0 涨到 47.0。

目录
  1. 🧩 模型没动,动的是训练的主语
  2. 📊 短任务赢,长任务输
  3. ⚖️ 厂商自测与模型卡的差
  4. 🚀 真正的卖点是吞吐
  5. 🧭 谁该换,谁不该换

2026 年 10 月 8 日,JetBrains 把 Mellum2.1 挂上 Hugging Face。12B 参数,Apache 2.0,激活 2.5B。同一天,社区里最刺眼的一个数字是 SWE-bench Verified 从 2.0 涨到 47.0。

一个版本跳 45 分,架构一个字没改。

🧩 模型没动,动的是训练的主语

Mellum2.1 沿用 Mellum2 的全部结构:12B 总参数,2.5B 激活的混合专家(MoE),上下文 131,072。JetBrains 自家的话是后训练没碰架构,所以速度与上一代持平。

真正变了的是强化学习的位置。在 Mellum2 里,强化学习是训练末尾的一小段收尾工序;在 Mellum2.1 里,它成了训练主体。数学、竞赛编程、科学题、工具调用、软件工程五类任务都配了强化学习科目,训练在真实代码仓库里跑,配 shell 与文件编辑工具,测试通过就发奖励。官方说法是启动了数百万个沙箱,铺在数千个自建环境上。

训练数据也过了一道筛:剔除测试坏掉的题、答案无法验证的题,以及过简单或根本不可能完成的题。

项目Mellum2Mellum2.1
总参数 / 激活12B / 2.5B12B / 2.5B
上下文131,072131,072
强化学习位置训练末尾收尾训练主体
SWE-bench Verified2.047.0
SWE-bench Pro0.028.0
Terminal-Bench 2.10.617.4
HarmBench(越低越好)21.58.5

📊 短任务赢,长任务输

同一套流水线(Pi v0.73.1 harness,114K 上下文,思考模式),JetBrains 测了四个模型。分界线很清楚:比编码谜题和工具调用,Mellum2.1 领先;比真实仓库里的修 bug,Qwen3.5-9B 领先。

基准Mellum2.1Qwen3.5-9B
SWE-bench Verified(真实 GitHub bug)47.050.0
SWE-bench Pro(更难)28.038.0
Terminal-Bench 2.1(命令行)17.421.7
LiveCodeBench v6(编码谜题)82.075.4
BFCL v4(工具调用)62.358.5
GPQA Diamond(高难科学题)64.677.8
HumanEval+91.5—
MBPP+79.4—
那 45 分涨幅要放回它所属的类别看。SWE-bench Verified 是真实 GitHub issue 的修复率,2.0 意味着二十个 bug 里修不到一个。这个模型此前是个代码补全工具,压根不碰仓库;45 分的涨幅说明它学会了逛仓库、读日志、找到失败测试的根因、改代码、跑测试验证。

分界线不是参数量,是任务长度与是否需要逛仓库。

⚖️ 厂商自测与模型卡的差

所有分数都是 JetBrains 自己跑的,无人复现。更麻烦的是同一个模型两套数字:Qwen 自己的模型卡写 LiveCodeBench v6 是 65.6、GPQA Diamond 是 81.7,JetBrains 实测同一模型是 75.4 和 77.8。差距不小,方向还不一致(前者高 9.8,后者高 3.7)。到底是评测流水线不同还是版本不同,两边都没细说。

所以这份成绩单的正确读法是:47.0 与 50.0 之间那 3 分之差,在厂商自测的同一流水线内可比;跨厂商的那几个数字不可比。

🚀 真正的卖点是吞吐

JetBrains 讲吞吐不讲命中。单张 H200 高负载下,它说 Mellum2.1 吐出的 token 接近 Qwen3.5-9B 的两倍。具体数值只存在于一张图里,未在正文给出。单请求场景靠多 token 预测(MTP)头提速约 1.6 倍,这个头在 vLLM 上标注 coming soon。

自部署的门也一并开着。GGUF 量化版本已在仓库里:

量化格式体积top-token 匹配率
BF1624.3 GB参考基准
Q8_012.9 GB96.1%
Q6_K10.9 GB93.9%
Q4_K_M8.1 GB88.0%
MXFP4_MOE7.0 GB85.6%
7.0 GB 意味着一台家用显卡能同时开好几个编码子智能体。服务端用 vLLM,--reasoning-parser qwen3,工具调用再加 --enable-auto-tool-choice --tool-call-parser hermes,推荐温度 0.6、top_p 0.95、top_k 20。托管 API 没有价格。

🧭 谁该换,谁不该换

已经在自托管 Qwen3.5-9B 做编码智能体的团队,换模型的理由不成立。真实仓库修 bug 这类像日常工作的任务上,Qwen 依然更高。Mellum2.1 值得试的场景是另一种:在固定 GPU 预算下同时跑很多智能体或子智能体,且源码不能出内网。这时候低几个百分点的命中率配上两倍的吞吐,量上去了就是划算的买卖。

验证方式也很简单:在自己的仓库上,用同一套 harness 跑两个模型,只量两件事。每秒 token 数,以及真正关掉的工单数。


信源:JetBrains 官方博客与 Mellum2.1 模型卡(2026-10-08 上线,JetBrains/Mellum2.1-12B-A2.5B-Thinking);llmreference、datanorth、syncai 三方转述一致处采信,单一来源处标注。全部基准分数为 JetBrains 自测,无第三方复现。Qwen 自家模型卡与 JetBrains 实测的数字差异已并列,未裁定谁对。MTP 头与托管 API 在发布日尚未可用。

#AIcoding #JetBrains #Mellum #开源模型 #MoE

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens