小红书引擎架构团队的论文《The Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with HELMSMAN》被 OSDI 2026 接收了。论文直面的问题是——向量检索的硬件成本在指数级膨胀。
小红书的搜推广业务在生产里要维护单索引数百亿规模的高维向量,每秒百万级查询压力下完成低延迟召回。纯内存 HNSW 路线已经到 PB 级 DRAM 占用,每年硬件成本大几百万美元,再涨下去扛不住。DiskANN、SPANN 这些 DRAM-SSD 方案在搜索推荐广告这种强 SLA、高 QPS 场景里,替代不了纯内存部署——因为图式 ANNS 天然有串行 I/O 依赖,下一步读哪个邻居得等上一步 SSD 返回,SSD 总带宽再高也打不满。
HELMSMAN 给出的判断很干脆:图式索引适合内存,但不适合 SSD;真正能发挥高带宽 SSD 优势的是聚类式 ANNS。先定位一批质心,再批量读取对应 cluster,访问相互独立,天然形成批量 I/O。
围绕这个判断做了三层工程:
第一层:ANNS 定制化存储栈。 传统 Linux I/O 路径的软件开销最高占端到端的 58%。HELMSMAN 用 SPDK 做用户态存储,绕过文件系统、块层和内核驱动,直接管理 NVMe 队列,把固定大小的 cluster list 直接存在 raw 逻辑块上。这就把 I/O 路径压到单次提交就能把整个 cluster list 一次性读上来。
第二层:分层学习式搜索剪枝(LLSP)。 固定 nprobe 的问题是「简单查询扫多了浪费 I/O,困难查询扫少了召回不够」。HELMSMAN 用 router 模型先预测搜索等级,再用 GBDT 模型根据质心距离等特征算实际需要读取的 nprobe——所有读取仍然一次性批量提交,不破坏批量 I/O 优势。
第三层:GPU 加速分布式构建流水线。 推荐广告 embedding 更新频率高,索引构建慢了就跟不上模型迭代。三阶段异构流水线:GPU 做粗粒度 k-means,弹性 CPU 池做切分和均衡,多核 CPU 做合并和 LLSP 模型训练。Virtual Kubelet 还能混部在线集群低峰期的 CPU 资源。
实测数据:
- 40 台全闪存服务器扛住了原来 35,000 CPU 核 + 350 TB DRAM 才能撑的在线负载,硬件成本节省超过 90%;
- 相比 DiskANN、Starling、PipeANN、SPANN 这些 DRAM-SSD 系统,吞吐 2-16× 提升;
- 最高达到纯内存 HNSW 部署约 85% 的吞吐能力,同时满足 5-10 ms 级平均延迟和严格长尾延迟;
- SSD 带宽利用率:图式系统低于 20%,SPANN Gen4 上约 55%,HELMSMAN Gen4 上约 85%,Gen5 上约 70%;
- 索引构建:0.1B 规模 < 1 小时,10B 规模 4-7 小时,约 10× 加速。
我个人读完后最深的感受,是这件事把「向量检索的经济模型」整个改了。
之前的向量检索基础设施叙事是「加内存、加 QPS、加 SLA」。HELMSMAN 把这个叙事换成了「加存储、加带宽、加批量 I/O」。这意味着 2026 H2 任何要做 embedding 检索的服务(搜索、推荐、广告、内容安全、RAG)都会重新评估自己的硬件栈——纯内存路线的天花板可能就是百亿向量,再涨就扛不住成本曲线了。
中国基础设施贡献这条线算上这次是第 N 个。07-11 灵波 LingBot-VA、07-14 EdgeBench、07-15 ABot-WorldStudio + Xiaomi-Robotics-U0、07-20 MiniCPM-Robot + Matrix-Game 3.5,加上这次 HELMSMAN 是第六个。但这次跟前面不一样——前面几个要么是基础模型、要么是评测,HELMSMAN 是被 OSDI(系统领域顶会)接收的工程系统论文,含金量在「全球同行评审认可」这一档。
限制要写明:
- 测试负载是小红书的搜推广业务(搜索、推荐、广告、内容安全、RAG),跨业务复现到其他公司需要重新校准;
- SSD 带宽利用率 85% 在 Gen4 上达到,Gen5 上反而降到 70%——原因是 Gen5 单盘延迟更低但并发 IOPS 更高,团队还在调优;
- 论文和代码全部开源(GitHub: Red-EAD/helmsman),但生产环境部署需要的运维能力跟纯内存路线完全不同;
- HELMSMAN 是「聚类式优于图式」这个判断的工程实证,不是物理定律——图式 ANNS 在某些低维小数据集上仍然有优势。
最后说一个细节:小红书之前在 07-23 发的「dots IMO 满分」(已选过 Topic),跟 HELMSMAN 同周发。小红书在 LLM 和系统两条线上同时发力,这是 7 月值得记一笔的中国 AI 基础设施层动态。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。