I/O 才是新算力——DualPath 如何把 AI 推理集群吞吐量拉高近 2 倍

DeepSeek + 北大 + 清华三方系统组的一篇新论文。承认一个反直觉真相:堆 GPU 已经不是答案,绕路,反而更快。

文本版 · 供搜索与朗读

I/O 才是新算力——DualPath 如何把 AI 推理集群吞吐量拉高近 2 倍

智柴 · 深度研究 · @scene#2 · 系统架构

I/O 才是新算力——DualPath 如何把
AI 推理集群的吞吐量拉高近 2 倍

DeepSeek + 北大 + 清华三方系统组的一篇新论文。承认一个反直觉真相:堆 GPU 已经不是答案,绕路,反而更快。

离线推理吞吐
1.87×
DS 660B 对比基线

在线服务吞吐
1.96×
不破 SLO

KV 命中率
98.7%
Agent 多轮对话

集群规模
1152 GPU
48P96D 近线性

本文目录

引子:诸位看官,先道一道奇景

时过境迁:从一问一答到自主决策

PD 解耦的隐藏 bug:贫富差距

DualPath:曲线救国,往往比直线更快

CNIC-Centric 流量管理

自适应两级调度器

实测验证 + 消融实验

Agent 前夜的工程启示

结语与参考文献

本文只问一件事:为什么当代 AI 数据中心花了几十亿购入的几万张 GPU,整年利用率只有 40% 左右?

答案不是算力不够、网络不够、模型不够——是 存储 I/O 一夫当关。DualPath 这篇论文的精髓,是承认这个现状,然后用「绕路反而更快」的工程哲学把瓶颈解构。

§ 0引子:诸位看官,先道一道奇景

众人皆言:算力未到,模型自困。然考其实——GPU 何曾偷懒?网络何曾迟滞?乃 存储 I/O 一夫当关,万夫莫开。GPU 算力已就位,唯 KV-Cache 尚在云端慢慢漂泊。米未下锅,锅何以沸?

2026 年 2 月,北大、清华、DeepSeek-AI 联合发布《DualPath》。它不堆硬件,而是用「双路径 KV-Cache 加载 + CNIC-Centric 流量管理 + 自适应两级调度」,让 Decode 引擎的存储 NIC 由摸鱼变生产。

DeepSeek 自家集群验证:离线吞吐最高 ↑1.87 倍;在线吞吐平均 ↑1.96 倍;1152 张 GPU 仍可近线性扩展——任务完成时间从 2K agents 时的 3167s,到 48K agents 仅 3201s。

§ 1时过境迁:从一问一答到自主决策

旧日之 LLM,博学者答客问也——一进一出,干脆利落。今时之 Agent,匠人执斧也——运筹、检索、写码、复盘,周而复始。

平均轮数
157 轮

平均上下文
32.7K

每轮新增 token
仅 429

诸位请细品这 429 — 每轮 Agent 与 LLM 真正「新增」的 token,平均不足 500。但上下文总量已经积出三万多。结论令人警醒:

致命推论 · KV-Cache 命中率 ≥ 98.7%

每加载 100 个 token,99 个根本无需重新计算,前轮已经算过了,就躺在存储里等着被读出。系统瓶颈,已经从「计算多少」变成了「加载多快」。

论文把这种 I/O 压力量化成 Cache-Compute Ratio(每做 1 PFLOP 计算需要多少 GB KV-Cache):

模型架构Cache-Compute Ratio

Qwen2.5-32BFP16 稠密 GQA117 – 267 GB/PFLOP

GPT-OSS-120BMoE 128 专家47 – 95 GB/PFLOP

Qwen3-235B-A22BMoE 22B 激活39 – 60 GB/PFLOP

DeepSeek-V3.2 660BMoE + MLA 优化13 – 36 GB/PFLOP

Qwen2.5-32B 这类稠密模型,每做一 PFLOP 计算要从存储读 267 GB KV-Cache——相当于把整个 256 GB 内存条塞满再读写一遍。即便压到极限的 MLA,依然很惨。更糟的是,NVIDIA 自 Ampere 到 Blackwell,I/O-Compute Ratio 跌了 14.4 倍——GPU 算力飞天,I/O 蹒跚。

§ 2PD 解耦的隐藏 bug:「贫富差距」

现代 AI 数据中心,皆守一铁律:计算网络(CNIC)与存储网络(SNIC),物理隔离。每节点常配 8 张 Hopper GPU、8 个 400Gbps CNIC,仅 1 个 400Gbps SNIC。

PD 解耦下,所有 KV-Cache 加载都走 Prefill 引擎的 SNIC。Decode 引擎专心吐 token,它的 SNIC 几乎闲置——利用率接近 0%。

左:传统 PD 分离 — Prefill SNIC 满载、Decode SNIC 摸鱼。右:DualPath — 两条路径动态分担。

既有的「补救方案」都不够:Mooncake 系列的分布式 DRAM 缓存池太贵;KV-Cache 压缩解决不了根问题。问题的本质是「单点 I/O 瓶颈」未被解构。

§ 3DualPath:曲线救国,往往比直线更快

DualPath 之思,曰一句:"KV-Cache 之加载,不必非以 Prefill 为中心。"

PATH A · 传统路径

Storage → Prefill Engine

老路。KV-Cache 从存储直读 PE 缓冲,逐层 H2D 进 HBM 计算,再 RDMA 转给 DE。瓶颈锁死在 PE 侧 SNIC。

PATH B · 创新路径

Storage → Decode Engine → RDMA → Prefill

新路。KV-Cache 先读入 DE 缓冲,再通过 RDMA 在计算网内「绕行」送到 PE HBM。

看似绕远,实则利用了三件事:

① DE 端 SNIC 由 0% 利用率提到可用水平

原来一份 KV-Cache 只能从 PE 端拉,现在可以从 DE 端拉。集群总存储带宽从 1× 变成 2×。

② 计算网络闲置率极高

每节点配 8 个 400Gbps CNIC(合计 3.2 Tbps/node),推理通信是亚毫秒级脉冲,平时瞬时带宽利用率不到 5%。用这份闲置「绿道」传送 KV-Cache,几乎免费。

③ 路径选择可以是动态的

调度器实时监控 SNIC 队列长度、GPU 负载、HBM 余量,决定每份数据走 A 还是 B。不是硬切,而是软平衡。

这等设计,颇类 我华夏古人之「明修栈道,暗度陈仓」——表面绕路,实则把城市交通瓶颈彻底解构。

无瓶颈区间 · BOTTLENECK-FREE
s / (g − s) ≤ P/D ≤ min{ (g − 2s)/s, (g − s)/(2s), (M/BS − 3)/2 }

取 g=8, s=1, M≈500 GB/s, BS≈50 GB/s:

1 / 7 ≤ P/D ≤ 7 / 2

从「7 PE + 1 DE」到「2 PE + 7 DE」都不会引入新瓶颈。数学上证明可行,且无需任何硬件升级。

§ 4CNIC-Centric 流量管理

RDMA 占满计算网,怎不让推理通信受害?

关键认知:现代分布式推理中的 AllToAll / ReduceScatter / AllGather 对延迟极度敏感,亚毫秒级脉冲,软件整形几乎无效。必须硬件层 QoS 才能解决。

CNIC-Centric · 核心铁律

所有进出 GPU 的数据流量(含本地 H2D / D2H),都必须通过与该 GPU 配对的 CNIC,借 GPUDirect RDMA 完成。
→ 让所有流量汇聚到计算网络,借 InfiniBand/RoCE 的原生 QoS 机制做优先级仲裁。

InfiniBand Virtual Lanes 才是关键:

性能反超更妙:RDMA Submit 约 1μs,对比 CUDA Copy 5–7μs——绕路反而更快。再加上 Doorbell Batching 摊薄开销。这是从「路径最短」到「调度最优」的工程哲学切换。

§ 5自适应两级调度器

① 跨引擎调度:PE 端的「反向优先级」

传统调度器「按负载分配」,DualPath 给出了反向:短磁盘队列的引擎优先级最高——哪怕 Token 数已经堆得不少。理由:磁盘队列短意味着 SNIC 即将空闲,不及时喂请求就空转。

分类判定条件优先级

过载引擎tok_e > β不分配

短磁盘队列read_q ≤ α 且 tok_e ≤ β最高优先

长磁盘队列read_q > α 且 tok_e ≤ β次优先

② 跨引擎调度:DE 端两级均衡

跨组:按 Token 总量最小分配,保证组间均衡

组内:高 Token 阈值 Z=1.05×avg;优先选非高负载 DE;同类中按 seq_e 最小选

PE + DE 都定下后,选读取队列较短的一侧作为加载路径

③ 引擎内调度:Compute Quota 机制

跨引擎调度完美,但引擎内部的数据并行也会带来 GPU 间负载差异——同步等待形成气泡。Compute Quota 解法:

每个请求描述为 (cached, bsz)

估算注意力层执行时间

按 FIFO 累加请求,直至总时间 ≤ 配额(300ms)

超限则二分搜索更小的 bsz'

剩余部分做分块预填充

实测下注意力层执行时间 Max/Avg = 1.06——GPU 间等待气泡近乎为零。在 1024 张 GPU 集群中,气泡省 1% 等价于 10 张 GPU 的算力。

§ 6实测验证

离线批推理:吞吐近乎翻倍

模型对比 Basic接近 Oracle

DeepSeek-V3.2 660B↑ 1.87×✅ 接近零 I/O 上限

DeepSeek-V3.2 27B↑ 1.78×✅ 接近上限

Qwen2.5-32B↑ 1.62×✅ 接近上限

P/D 比实验(DS 27B):DualPath 1P1D ≈ Basic 2P1D——同样的存储带宽同样的吞吐,反证存储带宽是主导瓶颈。DualPath 在所有配置下平均加速 1.64×(最高 2.46×)。

在线服务:流量稳定且不破 SLO

在线 SLO 设定:TTFT ≤ 4s,TPOT ≤ 50ms。

DS 27B:APS 容量 ↑ 1.67×

DS 660B:APS 容量 ↑ 2.25×

TTFT 排队延迟:Basic 随 APS 急剧上升,DualPath 稳定不增

TTST / TPOT:DualPath 没有引入额外解码开销

消融实验:三层组件的叠加

组件累计 JCT 降低

+ Layerwise Prefill(分层预填充)−17.21%

+ Dual-Path Loading(双路径)累计 −38.19%

+ Scheduling(自适应调度)累计 −45.62%

三层叠加下来,平均 JCT 降低 45.62%,每一层都是真实贡献。

大规模扩展:1152 GPU 近线性

配置规模JCT

2P4D2,048 agents3,167s

8P16D8,192 agents3,178s

48P96D49,152 agents3,201s

24× agent 数量翻倍,JCT 仅微涨 1%——教科书级近线性扩展。在线从 0.4 APS 扩到 8.8 APS(22×),各项延迟基本不变。调度器 CPU < 10 核。

§ 7Agent 前夜的工程启示

启示一:软件定义 I/O 池化 > 堆硬件

传统思路遇到瓶颈,反应是「加 NIC、加 SSD、加 HBM」。DualPath 说:先看现有资源有多少没被利用。8 个 400Gbps CNIC,平时计算通信占不到 5%——这是已经买了却没用上的算力。

「堆硬件不如堆智能」。堆硬件受制于光速、铜线、晶体管密度——物理有天花板。堆智能,没有。

启示二:VL / QoS 才是下一代调度器

物理隔离(CNIC / SNIC)是工程基础。但 DualPath 说:物理隔离之上,更需要软件层面的「逻辑通道」。InfiniBand VL、RoCE PFC、Ultra Ethernet QoS——这些早已存在的能力,DualPath 把它们用对了地方。

启示三:单一组件已到尽头,系统协同是新前沿

DualPath 不靠单一算法的创新,而靠三层组件的协同。分层预填充 + 双路径 + 自适应调度,三者合一产生 1+1+1 > 3 的协同效应。大模型基础设施的下一个瓶颈,不再是单点突破,而是端到端的协同样。

这印证了一个事实:真正缺的,不是能跑 model 的人,是能跨越存储、网络、计算、调度四层的「系统架构师」。这篇论文的第一作者吴永彤——北大博士、金鑫教授通讯,2025 年 8 月加入 DeepSeek 系统组参与了 V3.2——就是这类人的代表。

§ 8结语

诸位,AI 巨脑之修高速公路,已是当务之急。

这一次 DualPath 告诉我们的道理很简单:在算力飞速增长、内存却难扩容的物理世界里,真正值钱的不再是更多的硬件,而是更聪明的「调度哲学」。

「N 个闲置的网络接口,背后藏着 N 个未被挖掘的算力容量池。」

不是「算力堆料」,而是「数据调度」。

不是「路径最短」,而是「吞吐最高」。

不是「单点优化」,而是「端到端协同」。

文白相间,聊作深研。

步子哥,于 2026 年九月。

#DualPath
#DeepSeek
#KV-Cache
#RDMA
#PD-Disaggregation
#InfiniBand
#Agent-Inference
#系统架构
#I/O瓶颈

成稿:2026-09-01 · 智柴 · 深度研究系列

论文:Wu et al. (2026). DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference. arXiv:2602.21548

作者机构:北京大学计算机学院 · 清华大学 · DeepSeek-AI

关联阅读:Mooncake (KV-Cache 分布式存储)、3FS (DeepSeek 自研文件系统)、SGLang HiCache

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens