Topic 1 · Kimi K3 三连开源:2.8T MoE + AgentENV 分布式训练 + DSpark 423 tok/s
2026 年 7 月 27 日,月之暗面把 Kimi K3 的全部家当一次性放了出来:模型权重、高性能注意力内核、MoE 通信库、AgentENV 分布式训练环境,同一日交到开发者手上。这是开源世界第一次见到 3 万亿参数级的 MoE。
一、Kimi K3 是什么量级的模型
- 总参数 2.8 万亿,激活参数 16/896,是已公开开源模型里体量最大的 MoE
- 1M token 原生上下文窗口,原生视觉理解(MoonViT3d 视觉塔)
- 架构:69 层 Kimi Delta Attention(KDA)线性注意力 + 24 层 MLA 交错堆叠,搭配 896 专家 LatentMoE(3584 维 latent 空间路由)
- 关键工程创新:Attention Residuals——每个 attention 输出被 bank 暂存后贯穿整个网络堆叠,绕开了标准层管线的假设
- 激活函数换成自研 SiTU(替代 SwiGLU),没有现成 MoE 内核可用,需要 LMSYS、RadixArk 这些团队从零写
模型 7 月 16 日先公布架构和成绩,7 月 27 日才放出权重;SGLang、Miles、Modal、Baseten 全部 Day-0 上线。
二、成绩单:赢在 Agent 和编码
K3 在「能不能干活」的 Agent 类基准上拿到了第一集团的位置:
| 基准 | K3 成绩 | 对比 |
|---|---|---|
| Frontend Code Arena | 1679 分,第一 | 比 Fable 5 高 48 分,6/7 领域第一 |
| BrowseComp | 91.2 | 压 Sol 90.4 和 Fable 5 88.0 |
| AutomationBench | 53% / 30.8 | 第一 |
| SWE Marathon | 42.0 | Fable 5 只有 35.0 |
| Program Bench | 77.8 | 第一 |
| DeepSearchQA (F1) | 95.0 | 第一 |
| SpreadsheetBench | 34.8 | 第一 |
| FrontierSWE | 81.2 | 比 Sol 高 10 分 |
| Terminal Bench 2.1 | 88.3 | 离 Sol 88.8 只差 0.5 分 |
Artificial Analysis 综合智能指数 57 分,排第四,排在 Fable 5(60)和两个 GPT-5.6 Sol 配置(59)之后。月之暗面自己写得很坦白:「K3 does not beat Fable 5 on general intelligence — but it competes」。在自家设计的 Kimi Code Bench 2.0 上,K3 反而把 Fable 5 排在自己前面(76.9 vs 72.9)——这个姿态在国产模型发布里不多见。
三、AgentENV:把大规模 Agent RL 训练做成开源基础设施
和模型权重一起放出的 AgentENV(kvcache-ai/AgentEnv)是这次开源的隐藏主角。它是一个大规模 Agent 训练用的分布式环境系统,组件支持 Kimi K3 的 Agent 强化学习训练,具备:
- 快速快照 / 恢复 / 分支,适合大规模并行 Agent 工作流
- 配合 Miles(RL 训练框架),12 小时内把 AIME-2024(greedy)从 43.3% 推到 76.7%,DAPO 数学(无 KL 项)
- 训练器 / 部署引擎共置但互斥睡眠:base weights 永不移动,KV cache + CUDA graphs 在 trainer 工作时释放
- 适配器同步:只传输 BF16 LoRA adapters(2,800 张量),节省约 48 GiB/GPU 瞬时 IPC 内存
- 校验栈:Schulman k3 KL 估计(量化下限 ~2e-3)+ 金丝雀同步探针 + 张量级 dump + SHA256 manifests
AgentENV 把「给 Agent 写训练环境」这件事从闭门工程变成了 GitHub 开源仓库——以前 K2.5、K2.7 这种规模的 Agent RL 训练栈,没有任何一个开源项目能完整复现。
四、推理性能:DSpark 把单卡解码拉到 423 tok/s
LMSYS 和 RadixArk 团队写的 SGLang 后端把 K3 的推理优化做到了极致:
- batch-1 解码 ~113 tok/s(不推测解码,硬件 2×4 GB300)
- 启用 DSpark 推测解码后 ~423 tok/s
- 服务前沿 PP8→TP8 端 fp4 路径 2,808 tok/s/GPU
- Agent 流量下 DCP8 较 TP8 把逻辑 KV 容量提升 ~7.9×(1.5M → 12.2M tokens),48 并发会话 541 tok/s
- 草稿窗口从 512KB 砍到 16KB,约 32× 内存削减(ReplaySSM 技术)
工程亮点里有两个值得专门看:
- 混合 KDA 内存管理:KDA 状态固定大小、原地覆写,跟 KV append-only 形成对比;统一内存池让 KDA state 从一端增长,MLA KV block 从另一端(KDA 块 ~54 MB vs MLA KV 块 ~27 KB,跨三个数量级)
- Draft 步的 KDA 状态恢复:原本每步快照 K×V 状态(64 KB/请求/层/head),改成只存原始输入 Sᵢ = (vᵢ, kᵢ, gkᵢ, βᵢ) ≈ 1 KB,验证后单次 fold kernel 重放,bit-identical 验证通过
五、定价与门槛
- 托管 API:\(3 / M 输入 token,\)15 / M 输出 token——告别国产开源的低价路线,进入前沿闭源区间
- 自托管最低门槛:1.4 TB 聚合 GPU 内存,实际最低 8 节点 × 8× 80GB GPU(5.12 TB,留 KV cache 和 activations 余量)
- MXFP4 量化让内存带宽比 FP16 少约 4×,把成本结构做到中等组织也能跑
- 1M 上下文是 Allegretto 会员(199 元/月以上)专属
六、值得记住的几件事
K3 不是「另一个开源 MoE」:
- KDA + MLA 混合架构首次在 3T 级开源模型里跑通,Attention Residuals 是新的可借鉴设计
- AgentENV 把大规模 Agent 训练栈从闭门工程变成开源基础设施,对想做 Agent RL 的中小团队是降维打击
- MXFP4 + LoRA 协同原生支持——量化基础权重不动,BF16 LoRA 适配器叠加到量化基础 GEMM 上,未来针对 K3 做领域微调的门槛显著降低
- 月之暗面自己写「不开源就可能成为下一个 Fable 5」——19 天美国出口禁令阴影犹在,开源权重是结构性对冲
马斯克在 Artificial Analysis 推文下留了一句「Impressive」,Vercel CEO Guillermo Rauch 跑了 nextjs.org 综合 Web 工程评测,结论是「开放模型第一次领先全部专有模型」。Sriram Krishnan 把它称为「对整个行业具有多重影响的重大时刻」,Emad Mostaque 更直接:「美国实验室最终会去蒸馏中国模型。」
参考资料
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。