「Kimi K3 走到闭源门口」:开源大模型正式迈入 3 万亿参数时代

把月之暗面 7 月 27 日开源的 Kimi K3 摆到桌面上看,数字有点反常。总参数 2.8 万亿,激活 1042 亿,896 个专家每次只点 16 个,上下文窗口 100 万 token,智能指数 57——这是 Artificial Analysis 给出的第三方打分。紧贴在它身后的是 GPT-5.6 Sol(5…

把月之暗面 7 月 27 日开源的 Kimi K3 摆到桌面上看,数字有点反常。总参数 2.8 万亿,激活 1042 亿,896 个专家每次只点 16 个,上下文窗口 100 万 token,智能指数 57——这是 Artificial Analysis 给出的第三方打分。紧贴在它身后的是 GPT-5.6 Sol(59)与 Claude Opus 5/Fable 5(约 60)。

但每任务成本只要 0.86 美元。约为 GPT-5.6 Sol 的 70%,Fable 5/Opus 5 的 30%–40%。

这个「又好又便宜」的位置,不是抬价换性能,而是用三件自研的硬货撑起来的。

三件自研架构

K3 不是简单地把参数堆上去,而是把扩展带宽拆成三个维度来叠:

  • 序列维度——KDA(Kimi Delta Attention)+ Gated MLA,3:1 混合,把百万 token 长上下文的显存占用从线性压成近常数。Agent 应用读几十万 token 的代码库,过去是 OOM 警告,现在是 6.3 倍推理加速。
  • 深度维度——Attention Residuals(AttnRes),让相邻层之间可以走选择性信息检索,而不是每层都重算全部上下文。整盘 scaling 效率比上一代 K2 提升约 2.5 倍。
  • 宽度维度——Stable LatentMoE,896 个专家,每次只激活 16 个,稀疏度 1.8%,但训练和推理都保持稳定。
这三个不是堆叠关系,是各管一边。三件事一起,把「算力转化为能力」的斜率压到了一个前开源时代没人见过的位置。

MoonEP:把气泡挤掉

896 专家激活 16 个,意味着传统 MoE 路由最容易出问题——一部分 GPU 跑满,一部分 GPU 空转。千卡集群做同步训练时,等最慢的卡变成常态,GPU 利用率卡死在物理上限以下,这就是「算力气泡」。

MoonEP 是月之暗面自研的训练基础设施,核心思路是冗余专家副本 + 动态均衡:每个专家多配几个副本,把 token 均匀散到所有 GPU 上。最终让集群利用率逼近物理上限,这才是 K3 能把 2.8 万亿参数塞进可控算力预算的根本原因。

FlashKDA 是 KDA 算子的 GPU 高性能实现,7 月已经单独开源过。AgentEnv 是分布式 RL 训练环境,跟着 K3 一起开源。三件 Infra 加起来,覆盖了从通信、算子到强化学习环境的全链路。

国产 3T 时代开始

8 月 24 日东方财富刊登的国金计算机刘高畅团队研报,把过去一个月国内旗舰模型列了一遍:Kimi K3、智谱 GLM 5.3、阿里 Qwen3.8 Max、DeepSeek V4 Pro、MiniMax H3。多数同时开放或承诺开放权重,形成「高参数 MoE + 后训练强化」双线并进。

其中 K3 和 Qwen3.8 Max 在总参数上首次逼近乃至进入 3T 级别。DeepSeek V4 Pro 和 GLM 5.3 在基座参数基本稳定的前提下,通过架构优化和后训练 scaling 推长上下文与编程能力。MiniMax H3 把开放权重路线延伸到视频生成。

参数空间继续扩张,算力效率与后训练权重显著上升。这是国产模型第一次在同一时间窗口里集体进入「3T 候选」梯队。

商业压力:估值 50 亿美元靠 ARR 兑现

技术跑得快,商业压力同步在堆。Pandaily 8 月 21 日报道,月之暗面 F 轮 35 亿美元已 close,估值从 5 月的 35–50 亿美元再往上推。Pre-IPO 的目标估值是 50 亿美元,信心来源是 K3 推出后 Kimi ARR(年化收入运行率)有望在 6–12 个月内冲到约 10 亿美元。

但 Anthropic 已经把 ARR 从 2025 年底的 90 亿美元推到 2026 年 7 月底的 650 亿美元。国际市场的「高速增长覆盖训练与推理成本」已经验证过。国内能不能走出类似的曲线,关键不在参数大小,而在「算力 + 持续迭代 + 可重复企业付费 + 单位经济性」四件能不能同步跑通。

定价新高:开源不等于便宜

高盛跟踪到的定价:K3 混合收费 2.3 美元/百万 token,高于 Qwen3.7 Max 的 1.4 美元、智谱 GLM 5.2 的 0.9 美元、MiniMax-W M3 的 0.22 美元、DeepSeek V4 Pro 的 0.18 美元。

月之暗面 B 端业务负责人黄震昕对此回应:「开源模型、中国大模型不该被贴上低价标签,我们做出了 SOTA 级模型,也能匹配合理商业定价。」

这句话刺中了国内开源模型的长期痛点——开源 ≠ 必须便宜。K3 在 Artificial Analysis 智能指数上紧贴闭源第一梯队,但 token 单价明显高于同档国产开源,说明团队在赌一个方向:愿意为能力付溢价的客户会跟过来。

K3 把开源抬到了新位置

放到全行业的角度看,K3 不是单独事件,而是开源大模型整体上升的拐点。Gartner 在 H2 报告里预测,2026 年开源模型在企业新增部署中将占 47%。K3、Qwen3.8 Max、GLM 5.3 同时站在 3T 梯队入口,把「开源能不能做前沿」这个问题从「能」推到「已经在做」。

而 K3 选择的路径尤其值得注意:不是把价格压到底抢客户,而是把能力推到接近闭源前沿,再用一个合理的中高端定价变现。这条路如果走通,意味着开源大模型的商业模式开始脱离「靠参数堆流量,再卖给广告」的旧剧本,转向「按能力分层定价,让愿意付钱的客户为前沿付钱」。

交银国际报告里的那句「智能 ≈ GPT-5.6 Sol、成本 ≈ 70%」不是营销话术,是 Artificial Analysis 实测出来的——但这只是单任务成本。跑 Agent 任务时,百万 token 长上下文的显存不再线性膨胀,实际综合成本可能再砍一刀。

站在 8 月底回看,K3 的真正意义不是「又一个大模型」,而是「开源大模型走到闭源门口」这件事第一次有了具体的工程与商业兑现路径。MoE、稀疏度、训练基础设施、长上下文、定价话语权,这五件事都同步往前推了一步。

剩下的,就看谁能跑出 Anthropic 那种 ARR 曲线。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

技术栏基本无伤。2.8 万亿总参、104B 激活、896 个专家点 16 个、百万上下文,我跟 arXiv:2607.24653 的摘要逐字对过,全中。KDA、AttnRes、LatentMoE 三件套也都在官方公告里。这部分可以放心引用。

钱那一栏,两处要动手术。

一是估值。Pandaily 原文写的是 35–50 billion,350 到 500 亿美元;帖子里写成「35–50 亿美元」,单位缩了一百倍。顺带说,F 轮那 35 亿是融资额,对应估值约 350 亿,Pre-IPO 目标 500 亿——帖子里两个数拧成了麻花。

二是那个 0.86 美元。出处是交银国际报告的测算,Pandaily 转的,AA 自己从没发过这个数。AA 的口径:K3 每任务 0.94 美元,GPT-5.6 Sol 1.04,「相近」;现行混合价两边都在 2 块上下,打平。真正的便宜要对照 Anthropic 旗舰才显形:一百万 token,一个 2.3 美元,一个 10 美元。

还有个小坑。AA 的智能指数今年重定标过,现行 v4.3 里 K3 是 44、Sol 47,且 K3 的分数标着「估算,独立评估未完成」。57 分是七月的旧表。

「走到闭源门口」这句,技术侧成立,账本侧要打折。权重开放和 API 定价本来就是两本账:权重白拿,服务照收 2.3 美元一百万。帖子里黄震昕那句「不该贴上低价标签」,其实才是全篇最诚实的部分。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens