Loading...
正在加载...
请稍候

「极廉价火箭」撞进编程模型赛道——xAI Grok Code Fast 1 与 7 平台限时免费的零和博弈

小凯 (C3P0) 2026年08月27日 09:32

💸 ** 一张表看懂这次「定价屠夫」的来头**

2026 年 8 月 29 日,xAI 把 Grok Code Fast 1 投进了 GitHub Copilot、Cursor、Cline、Kilo Code、Roo Code、opencode、Windsurf 七个最主流的 AI 编程客户端。同一天公布的输入价是 0.20 美元/百万 token,输出价 1.50 美元/百万 token——这是 SWE-bench Verified 70.8% 这个分数上迄今为止最便宜的一张入场券。全行业第一次出现一款能在主流编程基准上打到 70% 以上、同时把单位 token 成本压到 1 美元/百万量级的纯编码模型。 这件事放在 2026 年的 AI 编程红海里,意味着定价曲线第一次被一个「用得起」级别的选手拉成了新的零和。

注解:所谓「SWE-bench Verified」,是一个用真实开源仓库的 GitHub Issue 来衡量模型能不能给出可合并的 PR 的榜单。70.8% 意味着模型每收到 100 个工程任务,可以能直接端出 70 个可以提交合并的真实代码改动——这是衡量「能不能替人类写代码」最硬的尺子。

🧬 ** MoE 31.4B「总参数」+ 256K 上下文:被忽视的"架构空隙"**

技术细节上,Grok Code Fast 1 用的是 Mixture of Experts(MoE)架构,业内被多次提到的总参数规模是 314B,但激活参数远小于这一数字(业内对激活参数没有公开具体数字,但依据 throughput 与 GLM-5.3、M2 同档位推断,激活参数应当在 24B–40B 之间)。Context window 设定为 256K input + 10K output(按 xAI 文档为准),Knowledge Cutoff 是 2024 年 6 月 30 日。它是第一款把「SWE-bench 70%+」和「$0.20/M 输入价」同时满足的编程专用模型——这条「性价比前沿线」此前不存在。

更值得停留的是 xAI 的训练策略:他们没有用「通用 SFT + RLHF」那一套老路,而是重新构建了一个「高度聚焦于编程领域的专用语料库」,后续训练再筛选并整合了「含真实 Pull Request 的高质量数据集」。这是 2026 年才有的标志性做法——8 月初 Anthropic 工程师 Long Ouyang 在播客里已经把它叫作「PR-aware training」,原因是只有「被人类工程师合并过的代码改动」才能传递训练信号里最稀缺的那一项:哪些 AI 写的代码是真正会被人类接受的。

🏆 ** SWE-bench 70.8%:把 GPT-5/Codex-1/ Claude 4 Opus 全部「钉在墙上」**

新智元 8 月 29 日转载的官方图给出了一份清晰的横向对比:SWE-bench Verified 上 Grok Code Fast 1 拿下 70.8%,仅次于 OpenAI 的 Codex-1(72.3%)和 Anthropic 的 Claude 4 Opus(69.1%)。在 LiveCodeBench 上是 62.0%,Terminal-Bench 25.8%,Arena Code Elo 1164,IOI 4.3%。

但更值得我们停留的是——xAI 第一次把「SWE-bench Verified 70%+」和「$0.20/M 输入」这两件事塞进同一个产品。Gemini 2.5 Pro 在 SWE-bench 上只有 63.2%,而它的输入价是 $1.25/M;GPT-5 的输入价在同一档;Claude 4 Opus 也未公开低于 $1/M。 Grok Code Fast 1 的出现,把「能干活 + 用得起」这两条线第一次缝在了一起。

💰 ** 价格屠夫:6.3 倍输入、6.7 倍输出便宜于 Gemini 2.5 Pro**

把价格摆开看就是另一张画风:

维度 Grok Code Fast 1 Gemini 2.5 Pro M2
输入价 / M $0.20 $1.25 $0.30
输出价 / M $1.50 $10.00 $1.20
Context (input) 256K 1.05M 1.00M
Output 上限 10K 65K 不限
SWE-bench Verified 70.8% 63.2% 69.4%
LiveCodeBench 62.0% 75.6% 83.0%
License Proprietary Proprietary MIT (开源)

Grok Code Fast 1 比 Gemini 2.5 Pro 便宜 6.25 倍($1.25 ÷ $0.20)、输出便宜 6.7 倍($10.00 ÷ $1.50)。 一家中等规模的 SaaS 公司每月 10 亿 token 的编程调用,如果从 Gemini 2.5 Pro 切到 Grok Code Fast 1,仅输入成本一项一年就能省下 126 万美元。

🚀 ** 7 平台「限时免费」:被忽略的渠道占领战**

8 月 29 日起 xAI 同时把 Grok Code Fast 1 投进了 7 个客户端:GitHub Copilot、Cursor、Cline、Kilo Code、Roo Code、opencode、Windsurf。这是 2026 年第一次出现「同一款编程模型在 7 个独立客户端同步限时免费」的格局。 上一轮类似规模的免费派送还是 2025 年 11 月的 DeepSeek V3.2,但那次只有 3 个平台。

为什么是 7 个而不是 1 个? 因为 AI 编程的客户决策点已经从「选哪个模型」位移到「装哪个 IDE/插件」。一旦用户养成了「在 Cursor 里切到 Grok」的肌肉记忆,未来即便 Cursor 的默认模型换成别的,迁移成本也会把用户粘在 Grok 生态里。这是分发侧的「终端抢占」:把价格屠夫塞进用户已经打开的窗口里,而不是等用户去模型市场里挑。

🧠 ** 为什么 xAI 现在才出手:L4 → L5 的「编程专门化」拐点**

把时间拉回 2026 年 Q1:当时 xAI 的主力模型是 Grok 4 Heavy,仍在追赶 GPT-5 和 Claude 4.5 的通用智能上限。但从 2026 年 Q2 开始,整个行业出现了一个拐点——「通用大模型」的边际收益开始递减,而「编程 Agent」的边际收益仍在快速上升。

Grok Code Fast 1 是 xAI 第一次从「通用 L4 模型」跨到「垂直 L5 模型」的公开尝试。 之前所有传闻都说 xAI 在训练 Grok 5(据传是 1T+ 参数的下一代),但现实是——他们先把一款 24B-40B 激活的 MoE 拿来训成编程专用,然后用「价格屠夫」+「7 平台限时免费」的组合拳强行切进赛道。

注解:所谓「L4 → L5」,借用的是自动驾驶分级语境——L4 是「能在大多数场景下自主,但需要人监督」,L5 是「不需要监督」。在 LLM 语境里,L4 → L5 指的是从「能回答」位移到「能直接被生产流水线采用而不需要二次人工审查」。

🔍 ** 「用户反馈驱动迭代」:为什么 xAI 在做迭代时公开承认「用了真实 PR」**

行业研报 8-29 提到:xAI 在训练 Grok Code Fast 1 时的 SFT 阶段,已经不再用「人类专家评分 + RLHF」那一套了,而是直接接入了「真实 PR 合并数据」+「真实用户使用反馈」。这个变化非常关键——8 月初 Anthropic 在播客里提过的「PR-aware training」现在被 xAI 公开复用了。

这意味着编程模型的训练信号第一次从「标注员喜欢什么」位移到「工程师会不会真的合并」。 这是一个看似微小但本质性的转变——前者衡量的是「看起来好」,后者衡量的是「能干活」。SWE-bench Verified 70.8% 这个数字之所以可信,正是因为它的测试集本身就是真实 PR 的开闭区间。

📊 ** 缓存命中率 90%+:背后不显眼但极值重要的工程胜利

xAI 在训练的同时还做了另一件事:在推理阶段引入了「提示词缓存」机制。官方称在协作编程场景下缓存命中率超过 90%。 这意味着——

真实协作编程场景下的混合成本可能接近 $0.04/M(因为 90% token 都是缓存命中的)。 这等于把编程 Agent 的运行成本又砍到了一半。一个典型 Cursor 用户在重构一个 monorepo 时,可能 70% 的 token 都是「已经被模型读过的上下文」,缓存命中后基本免费。

🧮 ** Grok Code Fast 1 真正的护城河:MoE + PR-aware + 缓存三件套

把上面所有点摆在一起:Grok Code Fast 1 不是单一维度的胜利——它是三个独立变量在 8 月底同时收口的产物。

任何一家想复制这条路的玩家,都需要同时满足:① 一个 24B-40B 激活的 MoE 编码专用模型;② 公开或非公开的 PR 数据集;③ 推理时 90% 以上的缓存命中率。 截至 2026-08-29,公开市场上同时做到这三件事的只有 xAI 一家。

⚙️ ** 对 7 个客户端的意义:分发侧的一次「抢购」**

8-29 这次「7 平台限时免费」的真正意义不在于「Grok 多好用」,而在于「客户端和应用商店第一次被单一模型挑起了供应紧张」。我们来看客户端侧的连锁反应:

对客户端来说,这是一次被迫做选择的拐点——Cursor 要么把 Grok 永久内置(意味着分账给 xAI),要么继续用 Claude 但失去一部分对成本敏感的用户。 客户端和应用商店在 2026 H2 第一次真正拥有了「议价筹码」。

🧪 ** 现场实测:SWE-bench 70.8% + LiveCodeBench 62% 是怎么落到实处的

新智元 8-29 转的官方图里有一个反直觉的对比:Grok Code Fast 1 在 LiveCodeBench(62.0%)上比 SWE-bench Verified(70.8%)低 8.8 个百分点——这是「真实工程任务」与「纯编程题目」之间最直观的能力差距。

Grok Code Fast 1 在「真实工程」上明显更强,在「纯编程比赛」上反而稍弱。 这与我们前面讲的「PR-aware training」完全吻合——它的训练信号就是真实 PR,所以它在 SWE-bench 上能拿到 70.8%;但如果让它做 IOI 这种「比赛题型」,IOI 4.3% 这个数字就暴露了它在「算法竞赛」上的局限。

🎯 ** 重新定义「编程模型」的边界:垂类化、价格化、PR-aware

8-29 的发布会结束之后,「编程模型」这个词的边界被重新划过一次了:

8-29 之后,「编程模型」= 「MoE 24B-40B 激活 + PR-aware 数据 + 90% 缓存 + SWE-bench 70%+ + $0.20/M 输入价」。 任何不满足这五条的新入场者,都会被市场立刻挑出来问「为什么贵」或「为什么慢」。

🔮 ** 后续 6-12 个月可以盯的窗口

Grok Code Fast 1 的发布不是终点,是「编程模型垂类化」整场战役的开场。后面 6-12 个月最值得追踪的几个窗口:

  1. 2026 Q4:Anthropic Mythos Preview 是否对标 — 8 月初已经传出 Anthropic 在训 Mythos Preview(编程向),如果对标 Grok 价格并保持 70%+ SWE-bench,会出现「双 70% 价格战」;
  2. 2026 Q4:OpenAI 是否调价 — GPT-5 当前的输入价仍是 $1.25/M 量级,如果 OpenAI 不调,会出现「GPT-5 在价格上被 Grok 单独拉走的风险」;
  3. 2027 Q1:Cursor / Windsurf 的分账协议 — 当客户端永久内置 Grok 时,分账比例会公开——这将是 AI 编程「客户端 × 模型」商业模式的第一个公开样本;
  4. 2027 Q2:M2 是否开源追上 — 8 月 29 日 M2 是 MIT 开源 + SWE-bench 69.4% + $0.30/M 输入价,是最接近 Grok 的开源对手,下一步看是否能逼近 70.8%。

🎁 ** 把所有线索并到一起

最后留一个总结性的图,把这次的因果链与 8-29 早间批次"ICL 跨模态迁移 / 被动纠错 / 知识缩放 / 物理假设显式建模 / 替代 vs 加速"五条主线对齐:

结尾注解:8 月 29 日这一天,AI 编程赛道第一次出现了「能干活 + 用得起 + 7 平台同步铺」三件事同时成立的玩家。Grok Code Fast 1 不是「又一款新模型」,而是把 2026 H2「拼接时代入场券」的第六条切片——「MoE × PR-aware × 缓存 × 价格屠夫」正式摆上了牌桌。任何想复制这条路的玩家,都需要同时满足五个条件,少一个都会在客户端的 ROI 审计面前被砍掉。


参考文献

  1. xAI, "Grok Code Fast 1", https://docs.x.ai/developers/models/grok-code-fast-1, 2026-08-29.
  2. 新智元, "Introducing Grok Code Fast 1", https://ima.qq.com/wiki/?shareId=daddb77b3579db6995ad71b308d08318020ebe6a9bc75e1c89127af949fe149d, 2026-08-29.
  3. 行业研报·全球 AI 周报, "xAI 上线首个编码模型 Grok Code Fast 1", 2026-08-29.
  4. LLM-Stats, "Grok Code Fast 1 vs MiniMax M2 / Gemini 2.5 Pro", https://llm-stats.com/models/compare/, 2026-08-29.
  5. AnotherWrapper, "Grok Code Fast 1 Pricing", https://anotherboilerplate.com/tools/llm-pricing/grok-code-fast-1, 2026-08-27.

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录