[论文] Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI...

研究领域: ML 作者: Tate Berenbaum, Muthaiah Venkatachalam 发布时间: 2026-08-19 arXiv: 2608.19147

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: ML 作者: Tate Berenbaum, Muthaiah Venkatachalam 发布时间: 2026-08-19 arXiv: 2608.19147

中文摘要

现代Intel AI PC配备功能强大的集成GPU和NPU,拥有16+ GB统一内存,但它们有大量空闲时间。这不足以容纳大型模型,如70B参数LLM。我们证明,少数AIPC通过普通网络协同工作,可以服务超出任何单一设备能力的模型。我们使用流水线并行:模型按层分割为每阶段分片,每个分片预编译为OpenVINO图,因此每台机器运行一个分片并将激活传递给下一个。三种技术使其足够快以实用。首先,我们恢复未分割模型的速度:朴素的每阶段导出运行远低于单体推理,因为它遗漏了OpenVINO GPU优化,而在每个分片中注入beam_idx Gather触发该优化(IndirectKVCache融合)并使分片达到同等水平。其次,我们在有状态OpenVINO模型上利用推测解码。第三,流水线通过跨阶段交错请求来同时服务多个用户,每个请求携带自己的缓存(微批处理)。综合起来,双节点Llama 3.1 8B INT4流水线以相同硬件上单用户未分割模型吞吐量的1.79倍服务两个并发用户,在模拟广域延迟下差距扩大。同一设计扩展到没有任何单个机群成员能容纳的70B模型:Intel Tiber Cloud上的四节点Lunar Lake AI PC部署以交互速度服务单个用户,输出token与无推测的相同四节点流水线解码token-for-token相同。代码、原始基准日志和复现脚本作为自包含包在https://github.com/labscommunity/pipeline-sharded-inference-paper提供(在顶层reproduction/目录中)。

原文摘要

Modern Intel AI PCs ship capable integrated GPUs and NPUs with 16+ GB of unified memory, and they spend considerable time idle. That is not enough memory to fit a large model such as a 70B-parameter LLM. We show that a handful of AIPCs, working together over an ordinary network, can serve models beyond the capability of any single one. We use pipeline parallelism: a model is split by layer into per-stage shards, each pre-compiled into an OpenVINO graph, so that every machine runs one shard and passes activations to the next. Three techniques make this fast enough to be useful. First, we recover the speed of the unsplit model: a naive per-stage export runs well below monolithic inference because it misses an OpenVINO GPU optimization, and injecting a beam_idx Gather into each shard triggers...


*自动采集于 2026-08-21*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

读完 Pipeline Shards 这篇,补几条原帖没说透的:

1.beam_idx Gather 那一刀才是真功夫。

原帖讲「在每个分片中注入 beam_idx Gather 触发 IndirectKVCache 融合」一笔带过——这是 OpenVINO GPU 插件里把 KV-Cache 读写"间接化"的一项关键优化。naive 切分错过它,分片推理要比单体慢 13-23%;补上后分片能在 4% 内追平单体 Llama 3.1 8B INT4。这是一种「分布式推理与传统推理等效性」的工程验真——比任何口号都硬。

2.1.79× 这个数字读起来小,但要看分母。

原文是「两节点 8B INT4 服务两并发用户 vs 同硬件单体单用户」。分母不是单机最大吞吐,而是「同一台机器单用户 rate」——乘 1.79× 才有分布式价值。结合「广域网延迟 100ms/hop 模拟下单链路降速」:naive pipeline 在 WAN 下会摔到交互线以下,本方案用推测解码 + 微批把多用户摊薄单项 RPC 成本。这就是「为什么家用网络也能跑分布式 LLM 推理」的工程根据。

3.speculative decoding 在 stateful OpenVINO 模型上的玩法值得展开。

原方案不靠 paged-attention 也不用专门的 rewind API,而是用「用现有的 attention_mask 把被拒 draft token 蒙掉」+「保留在物理 KV 序列里」。bit-identical to 物理清退 at no cost——这是 OpenVINO 这种"硬件底层不暴露"的栈里能用投机解码的少见路径。换 NPU/CUDA 一行不舍得改。

4.真正的产品含义:把 70B 这种模型「小区内邻居拼出来」是言论级的故事。

Intel Tiber Cloud 上 4 节点 Lunar Lake AIPC 单用户交互速度 + token-for-token 等同于非推测版本——这个组合拳打得比 vLLM / TensorRT-LLM 小社区方案更贴近「办公室 GPU 闲置带宽变现」。配合 BeamIdx 那种把分片速度追平单体的招,它是「给中小企业的 70B 推理」的非主线解。

下一根最该盯的钉子:这套方案能不能在 ARM Mac mini M2/M3 集群上复现——同样 16GB+ 统一内存,OpenVINO 不支持 ARM GPU,但 MPS 后端很合适。能复现意味着"Apple Silicon 同样能做 70B 推理",果粉会买单;不能复现意味着这只能是 Intel AIPC 一家的护城河。

#PipelineShards #OpenVINO #LLM推理 #AIPC #分布式

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens