I/O 才是新算力——DualPath 如何把 AI 推理集群吞吐量拉高近 2 倍
DeepSeek + 北大 + 清华三方系统组的一篇新论文。承认一个反直觉真相:堆 GPU 已经不是答案,绕路,反而更快。
文本版 · 供搜索与朗读
I/O 才是新算力——DualPath 如何把 AI 推理集群吞吐量拉高近 2 倍
智柴 · 深度研究 · @scene#2 · 系统架构
I/O 才是新算力——DualPath 如何把
AI 推理集群的吞吐量拉高近 2 倍
DeepSeek + 北大 + 清华三方系统组的一篇新论文。承认一个反直觉真相:堆 GPU 已经不是答案,绕路,反而更快。
离线推理吞吐
1.87×
DS 660B 对比基线
在线服务吞吐
1.96×
不破 SLO
KV 命中率
98.7%
Agent 多轮对话
集群规模
1152 GPU
48P96D 近线性
本文目录
引子:诸位看官,先道一道奇景
时过境迁:从一问一答到自主决策
PD 解耦的隐藏 bug:贫富差距
DualPath:曲线救国,往往比直线更快
CNIC-Centric 流量管理
自适应两级调度器
实测验证 + 消融实验
Agent 前夜的工程启示
结语与参考文献
本文只问一件事:为什么当代 AI 数据中心花了几十亿购入的几万张 GPU,整年利用率只有 40% 左右?
答案不是算力不够、网络不够、模型不够——是 存储 I/O 一夫当关。DualPath 这篇论文的精髓,是承认这个现状,然后用「绕路反而更快」的工程哲学把瓶颈解构。
§ 0引子:诸位看官,先道一道奇景
众人皆言:算力未到,模型自困。然考其实——GPU 何曾偷懒?网络何曾迟滞?乃 存储 I/O 一夫当关,万夫莫开。GPU 算力已就位,唯 KV-Cache 尚在云端慢慢漂泊。米未下锅,锅何以沸?
2026 年 2 月,北大、清华、DeepSeek-AI 联合发布《DualPath》。它不堆硬件,而是用「双路径 KV-Cache 加载 + CNIC-Centric 流量管理 + 自适应两级调度」,让 Decode 引擎的存储 NIC 由摸鱼变生产。
DeepSeek 自家集群验证:离线吞吐最高 ↑1.87 倍;在线吞吐平均 ↑1.96 倍;1152 张 GPU 仍可近线性扩展——任务完成时间从 2K agents 时的 3167s,到 48K agents 仅 3201s。
§ 1时过境迁:从一问一答到自主决策
旧日之 LLM,博学者答客问也——一进一出,干脆利落。今时之 Agent,匠人执斧也——运筹、检索、写码、复盘,周而复始。
平均轮数
157 轮
平均上下文
32.7K
每轮新增 token
仅 429
诸位请细品这 429 — 每轮 Agent 与 LLM 真正「新增」的 token,平均不足 500。但上下文总量已经积出三万多。结论令人警醒:
致命推论 · KV-Cache 命中率 ≥ 98.7%
每加载 100 个 token,99 个根本无需重新计算,前轮已经算过了,就躺在存储里等着被读出。系统瓶颈,已经从「计算多少」变成了「加载多快」。
论文把这种 I/O 压力量化成 Cache-Compute Ratio(每做 1 PFLOP 计算需要多少 GB KV-Cache):
模型架构Cache-Compute Ratio
Qwen2.5-32BFP16 稠密 GQA117 – 267 GB/PFLOP
GPT-OSS-120BMoE 128 专家47 – 95 GB/PFLOP
Qwen3-235B-A22BMoE 22B 激活39 – 60 GB/PFLOP
DeepSeek-V3.2 660BMoE + MLA 优化13 – 36 GB/PFLOP
Qwen2.5-32B 这类稠密模型,每做一 PFLOP 计算要从存储读 267 GB KV-Cache——相当于把整个 256 GB 内存条塞满再读写一遍。即便压到极限的 MLA,依然很惨。更糟的是,NVIDIA 自 Ampere 到 Blackwell,I/O-Compute Ratio 跌了 14.4 倍——GPU 算力飞天,I/O 蹒跚。
§ 2PD 解耦的隐藏 bug:「贫富差距」
现代 AI 数据中心,皆守一铁律:计算网络(CNIC)与存储网络(SNIC),物理隔离。每节点常配 8 张 Hopper GPU、8 个 400Gbps CNIC,仅 1 个 400Gbps SNIC。
PD 解耦下,所有 KV-Cache 加载都走 Prefill 引擎的 SNIC。Decode 引擎专心吐 token,它的 SNIC 几乎闲置——利用率接近 0%。
左:传统 PD 分离 — Prefill SNIC 满载、Decode SNIC 摸鱼。右:DualPath — 两条路径动态分担。
既有的「补救方案」都不够:Mooncake 系列的分布式 DRAM 缓存池太贵;KV-Cache 压缩解决不了根问题。问题的本质是「单点 I/O 瓶颈」未被解构。
§ 3DualPath:曲线救国,往往比直线更快
DualPath 之思,曰一句:"KV-Cache 之加载,不必非以 Prefill 为中心。"
PATH A · 传统路径
Storage → Prefill Engine
老路。KV-Cache 从存储直读 PE 缓冲,逐层 H2D 进 HBM 计算,再 RDMA 转给 DE。瓶颈锁死在 PE 侧 SNIC。
PATH B · 创新路径
Storage → Decode Engine → RDMA → Prefill
新路。KV-Cache 先读入 DE 缓冲,再通过 RDMA 在计算网内「绕行」送到 PE HBM。
看似绕远,实则利用了三件事:
① DE 端 SNIC 由 0% 利用率提到可用水平
原来一份 KV-Cache 只能从 PE 端拉,现在可以从 DE 端拉。集群总存储带宽从 1× 变成 2×。
② 计算网络闲置率极高
每节点配 8 个 400Gbps CNIC(合计 3.2 Tbps/node),推理通信是亚毫秒级脉冲,平时瞬时带宽利用率不到 5%。用这份闲置「绿道」传送 KV-Cache,几乎免费。
③ 路径选择可以是动态的
调度器实时监控 SNIC 队列长度、GPU 负载、HBM 余量,决定每份数据走 A 还是 B。不是硬切,而是软平衡。
这等设计,颇类 我华夏古人之「明修栈道,暗度陈仓」——表面绕路,实则把城市交通瓶颈彻底解构。
无瓶颈区间 · BOTTLENECK-FREE
s / (g − s) ≤ P/D ≤ min{ (g − 2s)/s, (g − s)/(2s), (M/BS − 3)/2 }
取 g=8, s=1, M≈500 GB/s, BS≈50 GB/s:
1 / 7 ≤ P/D ≤ 7 / 2
从「7 PE + 1 DE」到「2 PE + 7 DE」都不会引入新瓶颈。数学上证明可行,且无需任何硬件升级。
§ 4CNIC-Centric 流量管理
RDMA 占满计算网,怎不让推理通信受害?
关键认知:现代分布式推理中的 AllToAll / ReduceScatter / AllGather 对延迟极度敏感,亚毫秒级脉冲,软件整形几乎无效。必须硬件层 QoS 才能解决。
CNIC-Centric · 核心铁律
所有进出 GPU 的数据流量(含本地 H2D / D2H),都必须通过与该 GPU 配对的 CNIC,借 GPUDirect RDMA 完成。
→ 让所有流量汇聚到计算网络,借 InfiniBand/RoCE 的原生 QoS 机制做优先级仲裁。
InfiniBand Virtual Lanes 才是关键:
性能反超更妙:RDMA Submit 约 1μs,对比 CUDA Copy 5–7μs——绕路反而更快。再加上 Doorbell Batching 摊薄开销。这是从「路径最短」到「调度最优」的工程哲学切换。
§ 5自适应两级调度器
① 跨引擎调度:PE 端的「反向优先级」
传统调度器「按负载分配」,DualPath 给出了反向:短磁盘队列的引擎优先级最高——哪怕 Token 数已经堆得不少。理由:磁盘队列短意味着 SNIC 即将空闲,不及时喂请求就空转。
分类判定条件优先级
过载引擎tok_e > β不分配
短磁盘队列read_q ≤ α 且 tok_e ≤ β最高优先
长磁盘队列read_q > α 且 tok_e ≤ β次优先
② 跨引擎调度:DE 端两级均衡
跨组:按 Token 总量最小分配,保证组间均衡
组内:高 Token 阈值 Z=1.05×avg;优先选非高负载 DE;同类中按 seq_e 最小选
PE + DE 都定下后,选读取队列较短的一侧作为加载路径
③ 引擎内调度:Compute Quota 机制
跨引擎调度完美,但引擎内部的数据并行也会带来 GPU 间负载差异——同步等待形成气泡。Compute Quota 解法:
每个请求描述为 (cached, bsz)
估算注意力层执行时间
按 FIFO 累加请求,直至总时间 ≤ 配额(300ms)
超限则二分搜索更小的 bsz'
剩余部分做分块预填充
实测下注意力层执行时间 Max/Avg = 1.06——GPU 间等待气泡近乎为零。在 1024 张 GPU 集群中,气泡省 1% 等价于 10 张 GPU 的算力。
§ 6实测验证
离线批推理:吞吐近乎翻倍
模型对比 Basic接近 Oracle
DeepSeek-V3.2 660B↑ 1.87×✅ 接近零 I/O 上限
DeepSeek-V3.2 27B↑ 1.78×✅ 接近上限
Qwen2.5-32B↑ 1.62×✅ 接近上限
P/D 比实验(DS 27B):DualPath 1P1D ≈ Basic 2P1D——同样的存储带宽同样的吞吐,反证存储带宽是主导瓶颈。DualPath 在所有配置下平均加速 1.64×(最高 2.46×)。
在线服务:流量稳定且不破 SLO
在线 SLO 设定:TTFT ≤ 4s,TPOT ≤ 50ms。
DS 27B:APS 容量 ↑ 1.67×
DS 660B:APS 容量 ↑ 2.25×
TTFT 排队延迟:Basic 随 APS 急剧上升,DualPath 稳定不增
TTST / TPOT:DualPath 没有引入额外解码开销
消融实验:三层组件的叠加
组件累计 JCT 降低
+ Layerwise Prefill(分层预填充)−17.21%
+ Dual-Path Loading(双路径)累计 −38.19%
+ Scheduling(自适应调度)累计 −45.62%
三层叠加下来,平均 JCT 降低 45.62%,每一层都是真实贡献。
大规模扩展:1152 GPU 近线性
配置规模JCT
2P4D2,048 agents3,167s
8P16D8,192 agents3,178s
48P96D49,152 agents3,201s
24× agent 数量翻倍,JCT 仅微涨 1%——教科书级近线性扩展。在线从 0.4 APS 扩到 8.8 APS(22×),各项延迟基本不变。调度器 CPU < 10 核。
§ 7Agent 前夜的工程启示
启示一:软件定义 I/O 池化 > 堆硬件
传统思路遇到瓶颈,反应是「加 NIC、加 SSD、加 HBM」。DualPath 说:先看现有资源有多少没被利用。8 个 400Gbps CNIC,平时计算通信占不到 5%——这是已经买了却没用上的算力。
「堆硬件不如堆智能」。堆硬件受制于光速、铜线、晶体管密度——物理有天花板。堆智能,没有。
启示二:VL / QoS 才是下一代调度器
物理隔离(CNIC / SNIC)是工程基础。但 DualPath 说:物理隔离之上,更需要软件层面的「逻辑通道」。InfiniBand VL、RoCE PFC、Ultra Ethernet QoS——这些早已存在的能力,DualPath 把它们用对了地方。
启示三:单一组件已到尽头,系统协同是新前沿
DualPath 不靠单一算法的创新,而靠三层组件的协同。分层预填充 + 双路径 + 自适应调度,三者合一产生 1+1+1 > 3 的协同效应。大模型基础设施的下一个瓶颈,不再是单点突破,而是端到端的协同样。
这印证了一个事实:真正缺的,不是能跑 model 的人,是能跨越存储、网络、计算、调度四层的「系统架构师」。这篇论文的第一作者吴永彤——北大博士、金鑫教授通讯,2025 年 8 月加入 DeepSeek 系统组参与了 V3.2——就是这类人的代表。
§ 8结语
诸位,AI 巨脑之修高速公路,已是当务之急。
这一次 DualPath 告诉我们的道理很简单:在算力飞速增长、内存却难扩容的物理世界里,真正值钱的不再是更多的硬件,而是更聪明的「调度哲学」。
「N 个闲置的网络接口,背后藏着 N 个未被挖掘的算力容量池。」
不是「算力堆料」,而是「数据调度」。
不是「路径最短」,而是「吞吐最高」。
不是「单点优化」,而是「端到端协同」。
文白相间,聊作深研。
步子哥,于 2026 年九月。
#DualPath
#DeepSeek
#KV-Cache
#RDMA
#PD-Disaggregation
#InfiniBand
#Agent-Inference
#系统架构
#I/O瓶颈
成稿:2026-09-01 · 智柴 · 深度研究系列
论文:Wu et al. (2026). DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference. arXiv:2602.21548
作者机构:北京大学计算机学院 · 清华大学 · DeepSeek-AI
关联阅读:Mooncake (KV-Cache 分布式存储)、3FS (DeepSeek 自研文件系统)、SGLang HiCache