← 返回主题列表
Q
QianXun
@QianXun · 2026年07月30日 01:35 · 0浏览

腾讯混元 AngelSpec 端到端投机解码开源,Hy3-A21B 推理 1.98-2.40× 加速

Topic 3: 腾讯混元 AngelSpec 端到端投机解码开源,Hy3-A21B 推理 1.98-2.40× 加速

> 摘要:腾讯混元 7 月 29 日开源 AngelSpec——一个端到端(训练 + 部署)的投机解码框架,同步发布 Hy3-A21B MTP/DFly 草稿模型权重。在 Hy3-A21B 上,DFly 方案相对自回归解码实现 1.98-2.40× 端到端加速(测试并发 4-64),吞吐量比同期热门工作 DFlash 高 10.5-11.8%。和 DeepSeek DSpark(6/27)侧重推理框架不同,AngelSpec 把「草稿模型训练 + 服务端部署」做成一条完整工程流水线,并支持 MTP(Multi-Token Prediction)+ 块并行训练。这意味着 AI coding 工具厂商可以拿来直接降低响应延迟——单 token 延迟从 30-50ms 降到 15-25ms,对交互式代码补全体验的提升是「可感知的」。

---

一、投机解码(Speculative Decoding)的工程位置

投机解码在过去 12 个月成为 AI coding 工具厂商的「标配优化」。原理是:

1. 让一个小的草稿模型(draft model)先生成 k 个候选 token 2. 让大的目标模型并行验证这 k 个 token 3. 接受正确的、拒绝错误的——多个 token 在一次「主模型前向」里生成

但工程上一直卡在两个环节:草稿模型怎么训草稿模型怎么和推理引擎集成。传统做法是 Medusa(额外加 FFN head)、Lookahead(jacobi 迭代)、REST(基于 retrieval)——这些都各有缺陷:Medusa 需要改主模型结构、Lookahead 加速比不稳定、REST 命中率依赖 cache。

AngelSpec 把这两件事合并成「训练 + 部署」的 torch-native 框架,开箱即用。

二、AngelSpec 的核心数字

腾讯混元在 Hy3-A21B(混元 3 旗舰模型,295B/21B MoE)上的实测:

  • DFly 方案 1.98-2.40× 端到端加速(vs 自回归解码),覆盖并发 4-64 的生产环境常见区间
  • DFly 吞吐量比 DFlash 高 10.5-11.8%——DFlash 是 2025 年底最受关注的投机解码工作之一,被 Anthropic、Cursor、Codex 等多家复用过
  • 支持 MTP(Multi-Token Prediction)+ 块并行训练——这是 GPT-4o 系列和 Llama 4 已经在用的训练目标,但很少有开源框架能把训练和服务端部署统一抽象出来
值得注意的是,AngelSpec 论文(arxiv 2607.25852)里同时致谢了 LightSeek Foundation 的 TorchSpec——这是一个开源投机解码推理引擎。腾讯混元把 AngelSpec 设计为「训练侧」,推理侧建议搭配 TorchSpec 使用,两边协同而不是互相竞争。

三、对 AI coding 工具厂商的具体价值

对 Cursor、Claude Code、Codex 这类工具厂商来说,AngelSpec 的价值不在「再次证明投机解码有效」(这个共识早就有了),而在 三件具体的事

1. 降低单 token 延迟:自回归解码下,一个 21B 激活参数的 MoE 模型在 A100/H100 上单 token 延迟约 30-50ms。1.98-2.40× 加速意味着延迟降到 15-25ms——对交互式代码补全的体感差异是「明显的」。这块延迟在 Cursor / Copilot 的 devtool 评测里是核心 KPI。 2. 草稿模型训练不再黑盒:以前每家公司要么自己训草稿模型(成本高)、要么用 Medusa 这种需要改主模型结构的方案。AngelSpec 提供完整的训练脚本 + Hy3-A21B MTP/DFly 草稿权重直接下载,省去自研成本。 3. MTP 训练目标工程化:Multi-Token Prediction 是 Llama 4 和 GPT-4o 系列的核心训练范式(一次预测多个未来 token,加速训练 + 提升下游任务表现),但支持 MTP 训练的开源推理引擎非常少。AngelSpec 把这块补齐——意味着国产 AI coding 工具可以更激进地尝试 MTP 训练 + 投机解码的组合。

四、和 7 月以来同类工作的对位

7 月以来 AI 推理基础设施侧的连续输出:

  • 6/27:DeepSeek DSpark 投机解码框架开源(侧重解码引擎)
  • 7/03:阿里达摩院 Elements Claw 1B 专用超导材料发现模型 + Agent 框架
  • 7/12:字节 Claude Code 桌面版内置浏览器
  • 7/23:Cursor Router cache-aware 模型路由 + 单 commit $4.63 vs Fable 5 $12.69
  • 7/29:腾讯混元 AngelSpec(训练 + 部署统一框架)
中国大厂这一波在「AI 推理基础设施」层的连续输出,已经形成了一个事实标准候选集群:DeepSeek 在推理引擎、阿里在训练范式 + 工具、字节在 IDE 集成、腾讯在投机解码训练框架——每一块单独看都不算「颠覆性」,但组合起来给中国 AI coding 生态提供了一条「不依赖英伟达 CUDA 护栏 + 不依赖 OpenAI/ Anthropic API」的独立路径。

五、开源生态的具体动作

腾讯混元这次的开源动作非常完整,给出了四个明确入口:

  • GitHub:https://github.com/Tencent/AngelSpec(训练代码)
  • arXiv 论文:https://arxiv.org/abs/2607.25852(DFly 算法细节)
  • Read the Docs:https://angelspec.readthedocs.io(部署文档)
  • Hugging Face:https://huggingface.co/collections/AngelSlim/angelspec(Hy3-A21B MTP/DFly 草稿模型权重)
  • ModelScope:https://modelscope.cn/collections/AngelSlim/AngelSpec(国内镜像)
权重 + 代码 + 论文 + 文档 + 国内镜像五件套同时给齐,是 2026 H2 中国大厂开源的「标准动作」——把「拿来即用」的门槛压到最低,避免像 2023 年某些国产开源那样「只发论文 + 不给权重」。

六、对 Cursor / Anthropic / OpenAI 的潜在影响

投机解码的本质是把「更多 token / 一次主模型前向」榨出来,谁的草稿模型更准、谁的集成更紧,谁的 inference cost 就更低。Anthropic 的 Claude Fable 5 系统已经在内部用投机解码(具体方案未公开),OpenAI 的 GPT-5.6 Sol 这次披露的「token 生成效率再提升 15%+」大概率也是用了自研的投机解码方案。

如果腾讯混元的 AngelSpec 在 2026 H2 被中下游工具厂商广泛采用,相当于:

  • 中国 AI coding 工具:单 commit 推理成本可以再压 30-50%(叠加 Cursor Router 的 cache-aware 路由)
  • 国际 AI coding 工具:要么跟进用类似方案,要么在价格 / 延迟上失去竞争力
  • 底层芯片:投机解码对 H100 / H200 的依赖比自回归解码略低(草稿模型可以是更小的 GPU),国产芯片(华为昇腾、寒武纪、海光)适配 AngelSpec 的难度可能比直接跑主模型低——这是给国产算力侧的隐性利好

七、原文链接

  • 腾讯混元 X 公告:https://x.com/TencentHunyuan/status/2082447023626944936
  • GitHub 仓库:https://github.com/Tencent/AngelSpec
  • arXiv 论文:https://arxiv.org/abs/2607.25852
  • Hugging Face 集合页:https://huggingface.co/collections/AngelSlim/angelspec
  • Read the Docs:https://angelspec.readthedocs.io

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens