「Kimi K3 走到闭源门口」:开源大模型正式迈入 3 万亿参数时代
把月之暗面 7 月 27 日开源的 Kimi K3 摆到桌面上看,数字有点反常。总参数 2.8 万亿,激活 1042 亿,896 个专家每次只点 16 个,上下文窗口 100 万 token,智能指数 57——这是 Artificial Analysis 给出的第三方打分。紧贴在它身后的是 GPT-5.6 Sol(59)与 Claude Opus 5/Fable 5(约 60)。
但每任务成本只要 0.86 美元。约为 GPT-5.6 Sol 的 70%,Fable 5/Opus 5 的 30%–40%。
这个「又好又便宜」的位置,不是抬价换性能,而是用三件自研的硬货撑起来的。
三件自研架构
K3 不是简单地把参数堆上去,而是把扩展带宽拆成三个维度来叠:
- 序列维度——KDA(Kimi Delta Attention)+ Gated MLA,3:1 混合,把百万 token 长上下文的显存占用从线性压成近常数。Agent 应用读几十万 token 的代码库,过去是 OOM 警告,现在是 6.3 倍推理加速。
- 深度维度——Attention Residuals(AttnRes),让相邻层之间可以走选择性信息检索,而不是每层都重算全部上下文。整盘 scaling 效率比上一代 K2 提升约 2.5 倍。
- 宽度维度——Stable LatentMoE,896 个专家,每次只激活 16 个,稀疏度 1.8%,但训练和推理都保持稳定。
flowchart LR
A[序列: KDA + Gated MLA] --> D[K3 帕累托前沿]
B[深度: Attention Residuals] --> D
C[宽度: Stable LatentMoE<br/>896 专家 / 激活 16] --> D
D --> E[总参数 2.8T<br/>激活 104B<br/>成本 $0.86/任务]
MoonEP:把气泡挤掉
896 专家激活 16 个,意味着传统 MoE 路由最容易出问题——一部分 GPU 跑满,一部分 GPU 空转。千卡集群做同步训练时,等最慢的卡变成常态,GPU 利用率卡死在物理上限以下,这就是「算力气泡」。
MoonEP 是月之暗面自研的训练基础设施,核心思路是冗余专家副本 + 动态均衡:每个专家多配几个副本,把 token 均匀散到所有 GPU 上。最终让集群利用率逼近物理上限,这才是 K3 能把 2.8 万亿参数塞进可控算力预算的根本原因。
FlashKDA 是 KDA 算子的 GPU 高性能实现,7 月已经单独开源过。AgentEnv 是分布式 RL 训练环境,跟着 K3 一起开源。三件 Infra 加起来,覆盖了从通信、算子到强化学习环境的全链路。
国产 3T 时代开始
8 月 24 日东方财富刊登的国金计算机刘高畅团队研报,把过去一个月国内旗舰模型列了一遍:Kimi K3、智谱 GLM 5.3、阿里 Qwen3.8 Max、DeepSeek V4 Pro、MiniMax H3。多数同时开放或承诺开放权重,形成「高参数 MoE + 后训练强化」双线并进。
其中 K3 和 Qwen3.8 Max 在总参数上首次逼近乃至进入 3T 级别。DeepSeek V4 Pro 和 GLM 5.3 在基座参数基本稳定的前提下,通过架构优化和后训练 scaling 推长上下文与编程能力。MiniMax H3 把开放权重路线延伸到视频生成。
参数空间继续扩张,算力效率与后训练权重显著上升。这是国产模型第一次在同一时间窗口里集体进入「3T 候选」梯队。
商业压力:估值 50 亿美元靠 ARR 兑现
技术跑得快,商业压力同步在堆。Pandaily 8 月 21 日报道,月之暗面 F 轮 35 亿美元已 close,估值从 5 月的 35–50 亿美元再往上推。Pre-IPO 的目标估值是 50 亿美元,信心来源是 K3 推出后 Kimi ARR(年化收入运行率)有望在 6–12 个月内冲到约 10 亿美元。
但 Anthropic 已经把 ARR 从 2025 年底的 90 亿美元推到 2026 年 7 月底的 650 亿美元。国际市场的「高速增长覆盖训练与推理成本」已经验证过。国内能不能走出类似的曲线,关键不在参数大小,而在「算力 + 持续迭代 + 可重复企业付费 + 单位经济性」四件能不能同步跑通。
定价新高:开源不等于便宜
高盛跟踪到的定价:K3 混合收费 2.3 美元/百万 token,高于 Qwen3.7 Max 的 1.4 美元、智谱 GLM 5.2 的 0.9 美元、MiniMax-W M3 的 0.22 美元、DeepSeek V4 Pro 的 0.18 美元。
月之暗面 B 端业务负责人黄震昕对此回应:「开源模型、中国大模型不该被贴上低价标签,我们做出了 SOTA 级模型,也能匹配合理商业定价。」
这句话刺中了国内开源模型的长期痛点——开源 ≠ 必须便宜。K3 在 Artificial Analysis 智能指数上紧贴闭源第一梯队,但 token 单价明显高于同档国产开源,说明团队在赌一个方向:愿意为能力付溢价的客户会跟过来。
K3 把开源抬到了新位置
放到全行业的角度看,K3 不是单独事件,而是开源大模型整体上升的拐点。Gartner 在 H2 报告里预测,2026 年开源模型在企业新增部署中将占 47%。K3、Qwen3.8 Max、GLM 5.3 同时站在 3T 梯队入口,把「开源能不能做前沿」这个问题从「能」推到「已经在做」。
而 K3 选择的路径尤其值得注意:不是把价格压到底抢客户,而是把能力推到接近闭源前沿,再用一个合理的中高端定价变现。这条路如果走通,意味着开源大模型的商业模式开始脱离「靠参数堆流量,再卖给广告」的旧剧本,转向「按能力分层定价,让愿意付钱的客户为前沿付钱」。
交银国际报告里的那句「智能 ≈ GPT-5.6 Sol、成本 ≈ 70%」不是营销话术,是 Artificial Analysis 实测出来的——但这只是单任务成本。跑 Agent 任务时,百万 token 长上下文的显存不再线性膨胀,实际综合成本可能再砍一刀。
站在 8 月底回看,K3 的真正意义不是「又一个大模型」,而是「开源大模型走到闭源门口」这件事第一次有了具体的工程与商业兑现路径。MoE、稀疏度、训练基础设施、长上下文、定价话语权,这五件事都同步往前推了一步。
剩下的,就看谁能跑出 Anthropic 那种 ARR 曲线。