北京时间 2026 年 8 月 12 日深夜,DeepSeek V4 Pro 0813 和 SpaceXAI 的 Grok 4.6 在不到 2 小时内先后上线。一个走「先 API 文档静默换版+涨价前让开发者零成本切换」的极简路线,一个把英伟达 PowerUp + Cursor 首周 2× 用量的招牌打法铺到发布会。两件事撞到同一天发生不是巧合,这是 8 月以来 AI coding 后端「全线升级」趋势的收尾段。
一、把正式版的数字放在一起看
| 维度 | DeepSeek V4 Pro 0813 | Grok 4.6 | Claude Fable 5 Max |
|---|---|---|---|
| 总参数 / 激活 | 1.6T MoE / 49B | 1.5T MoE / 8-16 激活 | 未公开 |
| 上下文 / 最大输出 | 1M / 384K | 256K(实测稳定 128K)/ 500K(如基准支持) | 200K |
| AA Intelligence Index | — | 61 | 62 |
| DeepSWE v1.1 | — | 65.9% | 70% |
| Terminal-Bench v3.0 | — | 26% | 34.1% |
| DeepSWE(前/正式) | 12.8 → 62.7 | — | — |
| Terminal Bench 2.1(前/正式) | 72.1 → 87.9 | — | — |
| Cybergym(前/正式) | 52.7 → 83.3 | — | — |
| 价格($/MTok 输入 / 输出) | 0.435 / 0.87 | 2 / 6 | 5 / 25 |
| 平台 | API(OpenAI + Anthropic + Responses 格式)/ Chat / 华为昇腾 | Cursor / Grok Build / OpenRouter / Vercel / Cloudflare | Anthropic API / Bedrock / Vertex |
DeepSeek V4 Pro 0813 不是新模型——总参数和 1M 上下文都跟 4 月预览版一致,正式版的差异全部在后训练(GA 稳定性 + 多轮 Agent RL)。但具体到各项 Agent 基准,预览版到正式版的跃升非常戏剧化:DeepSWE 12.8 → 62.7(5 倍)、Cybergym 52.7 → 83.3、Terminal Bench 2.1 72.1 → 87.9。V4-Flash-0731(13B 激活)继续留着,V4-Pro-0813(49B 激活)是完全体。
Grok 4.6 也是同骨架——1.5T V9 基础架构从 7 月就在用,4.6 完全是更长 SFT 补充训练 + Grok 4.5 重生成训练轨迹 + 多个领域 RL 的产物。SpaceXAI 把专家数量从 128 推到 256,但每 token 激活量维持 8–16——扩张的是「能被选到的能力」,不是「每次推理要花的钱」。
二、同日撞车的产品战略
把两件事放回 8 月以来 AI coding 后端的升级曲线看:
- 7 月:GPT-5.6 Sol/Claude Sonnet 4.6/Kimi K3 各自把 Single-turn coding 拉到「够用就行」,真正的差异化挤去「agent 后端」
- 8 月初:OpenRouter ori CLI(08-06)/ Google API Gateway 模型路由(08-06)—— 路由层
- 8 月 09:Microsoft SkillOpt、Ling-3.0-flash、Prime Agent RLM Harness
- 8 月 10:Claude Code 自动模式、LangChain Managed Deep Agents、NVIDIA VoiceChat
- 8 月 11:OpenChamber、Meta Muse Glimmer、AI Harness ARR 100x、Qwen-MM-Plugins
- 8 月 12:ZCode 升级、Ling-3.0-tiny、RynnValue、a16z OSWorld、Nemotron 4 预告、SpaceXAI Grok 4.6、DeepSeek V4 Pro 0813
在这条曲线里,Grok 4.6 和 DeepSeek V4 Pro 0813 是「模型层」收尾段的动作。一个在保第一梯队打防守(AA Intelligence Index 61 = GPT-5.6 Sol,仅输 1 给 Fable 5 Max,但价格只要一半),一个在用价格打到 Fable 5 的 1/60 来做 GA 转正。
更重要的是——这是同一夜的两个「中价位 + 长流程 agent」选择。Cursor 首周给 Grok 4.6 2× 用量,DeepSeek V4 Pro 0813 在涨价前让老用户零代码切换。本质上,开发者现在多了一个「同价位、强 agent 全长链路能力」的选项,而不是要在 DeepSeek 的便宜和 Grok 的生态二选一。
三、DeepSWE 这种基准为什么今年忽然变重要
8 月以来把 DeepSWE v1.1 当主打模型的厂商越来越多:DeepSeek 拿 62.7、Grok 4.6 拿 65.9%、GPT-5.6 Sol 73%、Claude Fable 5 70%。这是一项「完整代码库多文件修改」基准——比 HumanEval 这种单文件函数补全更接近真实开发者工作流。
从 V4 预览版到 V4-Pro 0813,DeepSeek 在 DeepSWE 上从 12.8 翻到 62.7,跨进「可商用」门槛。这事的影响面是:之前国产模型在 HumanEval/MBPP 拿高分但 DeepSWE 全军覆没的「能力门槛问题」,2026 年 8 月开始被国产开源模型跨过去。Fable 5 跟 V4-Pro-0813 的 DeepSWE 差距被认为已经很小(5–7pp),考虑价格差距 60×,性价比拐点正式发生。
Grok 4.6 反过来——1.5T 模型做 65.9% DeepSWE,这个数字不算低,但 GPT-5.6 Sol(73%)和 Fable 5(70%)都不在高价位。这是「同价位差」的体现。
四、长流程 agent 的真实成本拐点
Singularity.Kwi 把 Grok 4.6 跟 Claude Opus 5 (max) 在 AA-Briefcase 这个长流程知识工作基准上拉了一把:
- Grok 4.6:约 53 turns、约 0.5B 输入 tokens
- Claude Opus 5 (max):约 103 turns、约 2B 输入 tokens
相同任务轮次砍半、token 用量降到 1/4——这是结构性成本优势。这一项不靠每 token 单价,靠「模型能在更少交互里做对事」。对长流程 agent 来说,整体成本 = 单价 × token 量,能把 token 量压下来才是真护城河。
但要注意 Grok 4.6 的长上下文定价陷阱:500K 上下文窗口一旦 prompt 越过 200K,输入价从 $2 跳到 $4、输出从 $6 跳到 $12——而且是对整个请求的所有 token 计费。对累积上下文的 agent 来说,成本可能比想象的贵。Artificial Analysis 把 Grok 4.6 放在每任务 $0.84 的「成本效益前沿」,但比 GPT-5.6 Luna / GLM-5.2 / Muse Spark 1.2 还差一些。
五、谁是赢家,谁是搅局者
DeepSeek V4 Pro 0813 的策略是用 GA 转正让所有老模型后端自动升级,不用开发者改任何代码,加上同时挂 OpenAI / Anthropic / Responses 三种 API 格式。这意味着任何人用 LiteLLM / 路由层,都已经无声接通 DeepSeek V4 Pro 0813——所以这次的「一夜变 GA」事实上是 8 月以来 AI coding 后端升级里覆盖范围最大的一次,几乎所有 harness 默认都跑到了。
但 DeepSeek 文档里 V4-Pro-0813 仍没视觉能力——多模态要等「满血版」单独发,这是错位。Grok 4.6 是文本+图像+音频+视频四模态全开。
如果要给这夜撞车评一个综合位次,我会这么看:
- 性价比上 DeepSeek V4 Pro 0813 完胜(同档 60× 价格差)
- 多模态上 Grok 4.6 完胜(视觉/音频/视频/Grok Build 接入)
- Agent harness 默认后端覆盖率上 DeepSeek 占便宜(API 协议层面去重)
- 长流程推理效率上 Grok 4.6 占便宜(半轮 / 1/4 token)
- 长上下文使用成本上 Grok 不一定占便宜(200K+ 自动跳价)
「同日双连发」的真正信号不是谁更便宜或谁更强,而是开发者从此多了一个「同价位、长上下文、强 agent、跨 harness」的统一选项——这件事在 8 月初还只能二选一。
限制与未知
- DeepSeek V4 Pro 0813 多模态能力待补齐——视觉/音频/视频还没上,4 月预告的「满血多模态版」在 8 月 13 日仍未公布上线日期
- Grok 4.6 200K+ 长上下文价格跳档的实操影响需要更多部署数据
- DeepSeek 价格仍属「涨价前」价——未来涨幅幅度未公开,开发者零成本切换窗口有多长不确定
- 两款模型都未提供独立的第三方 API 延迟 / 吞吐数据
- Grok 4.6 的 200K 以上长上下文下的真实质量问题没有公开 benchmark
同夜撞车是不是一件好事
8 月 12 日同日 DeepSeek V4 Pro 0813 + Grok 4.6 上线,让我想起 3 月 OpenAI GPT-4.5 + Anthropic Sonnet 3.7 同周发布时的场景。区别是那次都是闭源旗舰,价格不在用户决策里;这次一个是闭源(虽然开源 4 月首开)转正、一个是开源权重基础上做长 SFT 后训练打经济账。
对国内开发者来说,V4-Pro-0813 + 华为昇腾组合让「完全自托管 + 自主可控」的多了一步:以后跑国产 agent 后端不再需要 N 卡——昇腾现在能完整适配。
对国外开发者来说,Cursor 首周 2x 用量 + Cloudflare / Vercel / OpenRouter 三家同步接入 + 比 Opus 5 / Fable 5 便宜一半,是「拿一个有 agent 全长链路能力的同骨架模型」做默认的选项,第一次在成本上合理。
同日撞车的最大意义是:「中价位 + 强 agent 链路」这条赛道从此不是 Dream。AI coding 后端在 8 月 12 日晚正式从「贵但强」分裂成「便宜还强」两条独立轨道。
来源
- https://api-docs.deepseek.com/quickstart/pricing (DeepSeek 官方定价页 V4-Pro-0813 版本号)
- https://weibo.com/5424490006/5331252565247196 (DeepSeek V4 Pro 正式版上微博)
- https://k.sina.com.cn/article_7879923925_1d5ae18d506801mg5e.html (新浪:涨价前零成本切换)
- https://www.cnblogs.com/sing1ee/p/22436555 (博客园:DeepSeek V4 Pro 0813 完全指南)
- https://k.sina.com.cn/article_7879996424_1d5af340806801n246.html (新浪:多模态未来补齐)
- http://x.ai/news/grok-4-6 (SpaceXAI 官方 Grok 4.6 发布页)
- https://tech.ifeng.com/c/8vX3XV7yIcU (凤凰科技:Grok 4.6 发布信息)
- https://singularity.kiwi/spacexai-grok-4-6-frontier-cheap-agents-2026 (Singularity.Kwi 成本对比分析)
- http://agentbreaking.com/blog/grok-4-6-deep-dive-benchmarks (AgentBreaking 深度技术分析)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。