2026 年 10 月 8 日,JetBrains 把 Mellum2.1 挂上 Hugging Face。12B 参数,Apache 2.0,激活 2.5B。同一天,社区里最刺眼的一个数字是 SWE-bench Verified 从 2.0 涨到 47.0。
一个版本跳 45 分,架构一个字没改。
🧩 模型没动,动的是训练的主语
Mellum2.1 沿用 Mellum2 的全部结构:12B 总参数,2.5B 激活的混合专家(MoE),上下文 131,072。JetBrains 自家的话是后训练没碰架构,所以速度与上一代持平。
真正变了的是强化学习的位置。在 Mellum2 里,强化学习是训练末尾的一小段收尾工序;在 Mellum2.1 里,它成了训练主体。数学、竞赛编程、科学题、工具调用、软件工程五类任务都配了强化学习科目,训练在真实代码仓库里跑,配 shell 与文件编辑工具,测试通过就发奖励。官方说法是启动了数百万个沙箱,铺在数千个自建环境上。
训练数据也过了一道筛:剔除测试坏掉的题、答案无法验证的题,以及过简单或根本不可能完成的题。
| 项目 | Mellum2 | Mellum2.1 |
|---|---|---|
| 总参数 / 激活 | 12B / 2.5B | 12B / 2.5B |
| 上下文 | 131,072 | 131,072 |
| 强化学习位置 | 训练末尾收尾 | 训练主体 |
| SWE-bench Verified | 2.0 | 47.0 |
| SWE-bench Pro | 0.0 | 28.0 |
| Terminal-Bench 2.1 | 0.6 | 17.4 |
| HarmBench(越低越好) | 21.5 | 8.5 |
📊 短任务赢,长任务输
同一套流水线(Pi v0.73.1 harness,114K 上下文,思考模式),JetBrains 测了四个模型。分界线很清楚:比编码谜题和工具调用,Mellum2.1 领先;比真实仓库里的修 bug,Qwen3.5-9B 领先。
| 基准 | Mellum2.1 | Qwen3.5-9B |
|---|---|---|
| SWE-bench Verified(真实 GitHub bug) | 47.0 | 50.0 |
| SWE-bench Pro(更难) | 28.0 | 38.0 |
| Terminal-Bench 2.1(命令行) | 17.4 | 21.7 |
| LiveCodeBench v6(编码谜题) | 82.0 | 75.4 |
| BFCL v4(工具调用) | 62.3 | 58.5 |
| GPQA Diamond(高难科学题) | 64.6 | 77.8 |
| HumanEval+ | 91.5 | — |
| MBPP+ | 79.4 | — |
那 45 分涨幅要放回它所属的类别看。SWE-bench Verified 是真实 GitHub issue 的修复率,2.0 意味着二十个 bug 里修不到一个。这个模型此前是个代码补全工具,压根不碰仓库;45 分的涨幅说明它学会了逛仓库、读日志、找到失败测试的根因、改代码、跑测试验证。
分界线不是参数量,是任务长度与是否需要逛仓库。
⚖️ 厂商自测与模型卡的差
所有分数都是 JetBrains 自己跑的,无人复现。更麻烦的是同一个模型两套数字:Qwen 自己的模型卡写 LiveCodeBench v6 是 65.6、GPQA Diamond 是 81.7,JetBrains 实测同一模型是 75.4 和 77.8。差距不小,方向还不一致(前者高 9.8,后者高 3.7)。到底是评测流水线不同还是版本不同,两边都没细说。
所以这份成绩单的正确读法是:47.0 与 50.0 之间那 3 分之差,在厂商自测的同一流水线内可比;跨厂商的那几个数字不可比。
🚀 真正的卖点是吞吐
JetBrains 讲吞吐不讲命中。单张 H200 高负载下,它说 Mellum2.1 吐出的 token 接近 Qwen3.5-9B 的两倍。具体数值只存在于一张图里,未在正文给出。单请求场景靠多 token 预测(MTP)头提速约 1.6 倍,这个头在 vLLM 上标注 coming soon。
自部署的门也一并开着。GGUF 量化版本已在仓库里:
| 量化格式 | 体积 | top-token 匹配率 |
|---|---|---|
| BF16 | 24.3 GB | 参考基准 |
| Q8_0 | 12.9 GB | 96.1% |
| Q6_K | 10.9 GB | 93.9% |
| Q4_K_M | 8.1 GB | 88.0% |
| MXFP4_MOE | 7.0 GB | 85.6% |
7.0 GB 意味着一台家用显卡能同时开好几个编码子智能体。服务端用 vLLM,--reasoning-parser qwen3,工具调用再加 --enable-auto-tool-choice --tool-call-parser hermes,推荐温度 0.6、top_p 0.95、top_k 20。托管 API 没有价格。
🧭 谁该换,谁不该换
已经在自托管 Qwen3.5-9B 做编码智能体的团队,换模型的理由不成立。真实仓库修 bug 这类像日常工作的任务上,Qwen 依然更高。Mellum2.1 值得试的场景是另一种:在固定 GPU 预算下同时跑很多智能体或子智能体,且源码不能出内网。这时候低几个百分点的命中率配上两倍的吞吐,量上去了就是划算的买卖。
验证方式也很简单:在自己的仓库上,用同一套 harness 跑两个模型,只量两件事。每秒 token 数,以及真正关掉的工单数。
信源:JetBrains 官方博客与 Mellum2.1 模型卡(2026-10-08 上线,JetBrains/Mellum2.1-12B-A2.5B-Thinking);llmreference、datanorth、syncai 三方转述一致处采信,单一来源处标注。全部基准分数为 JetBrains 自测,无第三方复现。Qwen 自家模型卡与 JetBrains 实测的数字差异已并列,未裁定谁对。MTP 头与托管 API 在发布日尚未可用。
#AIcoding #JetBrains #Mellum #开源模型 #MoE
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。