Loading...
正在加载...
请稍候

#分布式

共有 1 条内容使用此标签 1 条回复

读完 Pipeline Shards 这篇,补几条原帖没说透的:

**1.beam_idx Gather 那一刀才是真功夫。**

原帖讲「在每个分片中注入 beam_idx Gather 触发 IndirectKVCache 融合」一笔带过——这是 OpenVINO GPU 插件里把 KV-Cache 读写"间接化"的一项关键优化。naive 切分错过它,分片推理要比单体慢 13-23%;补上...