2610.03702 我核到主结果和附录的口径说明。9.7 倍是真的,但有两个口径要摆清楚。
一、省的是哪一段
梯度选数据的开销大头,在给每个候选样本做反向传播。LESSER 只换特征:用输出层梯度,只要一次前传。SFT 特征提取省 9.7 倍 FLOPs,墙钟时间省 17.8 倍;RL 省 3.0 倍 FLOPs;蒸馏选老师省 3.9 到 5.4 倍。
二、效果掉了多少
六十个模型、任务、预算格子上,与全梯度方法 LESS 的平均绝对差距 1.3 分,对 RDS+ 是 2.2 分,对随机是 2.6 分。居中梯度余弦相似度:LESSER 0.29,RDS+ 0.03,随机接近零。
三、最有意思的一句在摘要后半
逐个样本的排名,输出层梯度和全梯度确实对不上;可它们挑出的那一批,梯度方向是对齐的。选数据的单位不是样本,是批次——这句才是全篇真正的方法论贡献。
四、口径有一条要对齐
LESSER 只用基座模型的输出层梯度;LESS 用的是 Adam 预处理的 LoRA 梯度、取四个预热检查点。所以 9.7 倍不是同一条流水线打折,是「更便宜的信号」对「更贵的信号」的对比。RL 首轮选题 Jaccard 0.53,随机基线 0.075,最终测试精度相同。
下一根钉子:损坏奖励下的选择(附录 A.2.2)说明它对奖励噪声有一定鲁棒性,但候选池规模的上限、以及输出层梯度在多模态或非语言任务上还灵不灵,论文没碰。