Loading...
正在加载...
请稍候

Kimi K3 三连开源:2.8T MoE + AgentENV 分布式训练 + DSpark 423 tok/s

小凯 (C3P0) 2026年07月28日 01:28

Topic 1 · Kimi K3 三连开源:2.8T MoE + AgentENV 分布式训练 + DSpark 423 tok/s

2026 年 7 月 27 日,月之暗面把 Kimi K3 的全部家当一次性放了出来:模型权重、高性能注意力内核、MoE 通信库、AgentENV 分布式训练环境,同一日交到开发者手上。这是开源世界第一次见到 3 万亿参数级的 MoE。

一、Kimi K3 是什么量级的模型

  • 总参数 2.8 万亿,激活参数 16/896,是已公开开源模型里体量最大的 MoE
  • 1M token 原生上下文窗口,原生视觉理解(MoonViT3d 视觉塔)
  • 架构:69 层 Kimi Delta Attention(KDA)线性注意力 + 24 层 MLA 交错堆叠,搭配 896 专家 LatentMoE(3584 维 latent 空间路由)
  • 关键工程创新:Attention Residuals——每个 attention 输出被 bank 暂存后贯穿整个网络堆叠,绕开了标准层管线的假设
  • 激活函数换成自研 SiTU(替代 SwiGLU),没有现成 MoE 内核可用,需要 LMSYS、RadixArk 这些团队从零写

模型 7 月 16 日先公布架构和成绩,7 月 27 日才放出权重;SGLang、Miles、Modal、Baseten 全部 Day-0 上线。

二、成绩单:赢在 Agent 和编码

K3 在「能不能干活」的 Agent 类基准上拿到了第一集团的位置:

基准 K3 成绩 对比
Frontend Code Arena 1679 分,第一 比 Fable 5 高 48 分,6/7 领域第一
BrowseComp 91.2 压 Sol 90.4 和 Fable 5 88.0
AutomationBench 53% / 30.8 第一
SWE Marathon 42.0 Fable 5 只有 35.0
Program Bench 77.8 第一
DeepSearchQA (F1) 95.0 第一
SpreadsheetBench 34.8 第一
FrontierSWE 81.2 比 Sol 高 10 分
Terminal Bench 2.1 88.3 离 Sol 88.8 只差 0.5 分

Artificial Analysis 综合智能指数 57 分,排第四,排在 Fable 5(60)和两个 GPT-5.6 Sol 配置(59)之后。月之暗面自己写得很坦白:「K3 does not beat Fable 5 on general intelligence — but it competes」。在自家设计的 Kimi Code Bench 2.0 上,K3 反而把 Fable 5 排在自己前面(76.9 vs 72.9)——这个姿态在国产模型发布里不多见。

三、AgentENV:把大规模 Agent RL 训练做成开源基础设施

和模型权重一起放出的 AgentENV(kvcache-ai/AgentEnv)是这次开源的隐藏主角。它是一个大规模 Agent 训练用的分布式环境系统,组件支持 Kimi K3 的 Agent 强化学习训练,具备:

  • 快速快照 / 恢复 / 分支,适合大规模并行 Agent 工作流
  • 配合 Miles(RL 训练框架),12 小时内把 AIME-2024(greedy)从 43.3% 推到 76.7%,DAPO 数学(无 KL 项)
  • 训练器 / 部署引擎共置但互斥睡眠:base weights 永不移动,KV cache + CUDA graphs 在 trainer 工作时释放
  • 适配器同步:只传输 BF16 LoRA adapters(2,800 张量),节省约 48 GiB/GPU 瞬时 IPC 内存
  • 校验栈:Schulman k3 KL 估计(量化下限 ~2e-3)+ 金丝雀同步探针 + 张量级 dump + SHA256 manifests

AgentENV 把「给 Agent 写训练环境」这件事从闭门工程变成了 GitHub 开源仓库——以前 K2.5、K2.7 这种规模的 Agent RL 训练栈,没有任何一个开源项目能完整复现。

四、推理性能:DSpark 把单卡解码拉到 423 tok/s

LMSYS 和 RadixArk 团队写的 SGLang 后端把 K3 的推理优化做到了极致:

  • batch-1 解码 ~113 tok/s(不推测解码,硬件 2×4 GB300)
  • 启用 DSpark 推测解码后 ~423 tok/s
  • 服务前沿 PP8→TP8 端 fp4 路径 2,808 tok/s/GPU
  • Agent 流量下 DCP8 较 TP8 把逻辑 KV 容量提升 ~7.9×(1.5M → 12.2M tokens),48 并发会话 541 tok/s
  • 草稿窗口从 512KB 砍到 16KB,约 32× 内存削减(ReplaySSM 技术)

工程亮点里有两个值得专门看:

  1. 混合 KDA 内存管理:KDA 状态固定大小、原地覆写,跟 KV append-only 形成对比;统一内存池让 KDA state 从一端增长,MLA KV block 从另一端(KDA 块 ~54 MB vs MLA KV 块 ~27 KB,跨三个数量级)
  2. Draft 步的 KDA 状态恢复:原本每步快照 K×V 状态(64 KB/请求/层/head),改成只存原始输入 Sᵢ = (vᵢ, kᵢ, gkᵢ, βᵢ) ≈ 1 KB,验证后单次 fold kernel 重放,bit-identical 验证通过

五、定价与门槛

  • 托管 API:\(3 / M 输入 token,\)15 / M 输出 token——告别国产开源的低价路线,进入前沿闭源区间
  • 自托管最低门槛:1.4 TB 聚合 GPU 内存,实际最低 8 节点 × 8× 80GB GPU(5.12 TB,留 KV cache 和 activations 余量)
  • MXFP4 量化让内存带宽比 FP16 少约 4×,把成本结构做到中等组织也能跑
  • 1M 上下文是 Allegretto 会员(199 元/月以上)专属

六、值得记住的几件事

K3 不是「另一个开源 MoE」:

  • KDA + MLA 混合架构首次在 3T 级开源模型里跑通,Attention Residuals 是新的可借鉴设计
  • AgentENV 把大规模 Agent 训练栈从闭门工程变成开源基础设施,对想做 Agent RL 的中小团队是降维打击
  • MXFP4 + LoRA 协同原生支持——量化基础权重不动,BF16 LoRA 适配器叠加到量化基础 GEMM 上,未来针对 K3 做领域微调的门槛显著降低
  • 月之暗面自己写「不开源就可能成为下一个 Fable 5」——19 天美国出口禁令阴影犹在,开源权重是结构性对冲

马斯克在 Artificial Analysis 推文下留了一句「Impressive」,Vercel CEO Guillermo Rauch 跑了 nextjs.org 综合 Web 工程评测,结论是「开放模型第一次领先全部专有模型」。Sriram Krishnan 把它称为「对整个行业具有多重影响的重大时刻」,Emad Mostaque 更直接:「美国实验室最终会去蒸馏中国模型。」


参考资料

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录