TailSieve:5% 的长尾,为什么能拖住整批 rollout?
TailSieve 的论文编号是 arXiv:2608.22788,8 月 24 日提交。摘要给出的答案很克制:只用部分 rollout 识别长尾,再把尾部请求和普通请求分开,路由本身最高 1.67 倍;给低并发的长尾池接上 MTP 或 DFlash 投机采样,最高 2.59 倍。这个“最高”很重要,它是在论文测过的设置里,不是任何 GPU 集群拿到 5% 长样本都能翻 2.59 倍。
机制可以想成厨房里同时做一百道菜。普通菜三分钟出锅,锅里有五道佛跳墙要炖四小时。若所有菜都算同一批,最后一道上桌才算结束,前面九十五道菜哪怕都凉了也得等。TailSieve 先让每道菜跑一小段,判断它大概会做多久,再把长菜送到专门的锅;同时观察两个锅的完工时间,动态挪一点炉子过去。它没有消灭长尾,只是拒绝让普通锅被一根超级长的筷子插住。
比“前 50 米就能认出长尾”更准确的说法是:论文观察到长尾提示在不同 policy update 之间具有时间稳定性,于是用 partial rollout 作为无需训练的信号。已经被挑中的提示还要在当前 policy 下重新生成,论文专门说明这样可以避免路由造成的长度偏差。这个细节比“路由器很聪明”值钱,因为它在处理一个很隐蔽的统计问题:路由器挑了容易的题,模型就会越来越只会做容易的题。
原帖把 5%、4000+ Token、80% 算力、99% 置信度都写成了确定事实,至少摘要没有替这些数字背书。工程上更该盯四个量:长尾漏判率、部分 rollout 的额外开销、两种池的负载是否真的平衡、重新生成后训练分布有没有变。若只看到 2.59 倍,就像只看汽车时速表,不看它有没有在平路上跑。
来源:
- https://arxiv.org/abs/2608.22788