扩散模型的推理期缩放:渐进式种子剪枝 PSP
副标题:把"花算力换质量"这桩旧账,重新算一遍
一、核心问题:扩散模型为何长不出"慢思考"
大语言模型(LLM)早已悟得一事:临场多想一想,答案便会更好。这叫"推理期缩放"(inference-time scaling,测试阶段多投算力)——best-of-N 多采样几回挑最优、Chain-of-Thought 逼它步步推演、乃至树搜索反复试探。投得越多,分越高,近乎一条平滑上坡。
扩散模型(diffusion,以逐步去噪从噪声生成图像的网络)却相反。它的"默认旋钮"是加多去噪步数,但学界早有定论:多加步数往往是笔亏本买卖。真正微妙的是"种子"——那张最初喂进去的纯噪声。同一提示词、同一模型,换一颗种子,成品便天差地别。质量对种子高度敏感,本是隐患,却也指了条路:既然种子定生死,何不多试几颗、择优而从?于是有了 best-of-N(并行跑 N 条、末端挑奖赏最高者)等法。
然旧法皆守一桩心照不宣的规矩:内存恒定——同时养着 N 条候选,从头到尾一样多,直到最后一刻才裁。这好比雇了 N 个画师,人人画完整幅,才看谁佳。浪费在明处:多数人早露怯态,你却仍付他画完的工钱。
二、一句话洞见
> 放宽"内存恒定"这道枷锁,以"前期广撒网、早期猛淘汰"换同一笔算力花得更聪明——此即 PSP 的全部智慧。
三、通俗类比:一场倒计时的选秀海选
把生成图像想成选秀。终点是成品图,每去噪一步,便如选手闯过一轮。
- Best-of-N 是:请 4 位选手,每人从头唱到尾,末了评委打分选冠军。中途你早听出 3 人走音,却照付全额出场费。
- PSP 是:一上来请 8 位(多一倍),唱到四分之一、评委已能辨优劣时,砍半;唱到一半、高下更明时,再砍半,仅留 2 位进决赛圈,把余下预算尽数砸于其上精雕细琢。
四、方法拆解:账是怎么平的
PSP 由 Caltech 的 Guimarães 与 Perona 提出,训练无关、梯度无关,扩散与流匹配(flow-matching,另一类以"速度场"去噪的生成范式)主干通吃。它用确定性求解器(DDIM η=0 或 Euler),令所有随机性只源于初始种子——正合"种子搜索"的题面。
算法极简(默认 N̄=4,即等效算力为单条轨迹之 4 倍): 1. 撒下 2N̄ = 8 颗独立噪声种子; 2. 自 t=T 至 1,每步:用生成器已有预测顺手估出 x̂₀ → 奖励模型打分 → 按预定时间表只留高分者 → 幸存者去噪一步; 3. 时间表:8 颗 → 25% 进度砍到 4 → 50% 进度砍到 2 → 直至终点。
算力账(以去噪步计):C = Σ kₜ = 8×0.25T + 4×0.25T + 2×0.5T = 4T,恰等于跑 4 条完整轨迹的 best-of-N。换言之:PSP 探了 8 颗种子的量,却只花 4 颗的工钱。中间打分复用生成器内部量,零额外前向;奖励模型开销可忽略。
五、实验与结论
在 SD v1.5、SDXL、SD 3.5 三主干上,以同一奖励 ImageReward、同一总去噪步为公平擂台,对比 best-of-N、重要性采样(FK-Steering)、树搜索(DSearch、BFS 等)。N̄=4 时:
- SDXL:GenEval 0.645 对 0.629(BoN),人类对齐 0.713 对 0.682;
- SD 3.5:GenEval 0.747 持平,人类对齐 0.841 对 0.831;
- SD v1.5:GenEval 0.574 对 0.542。
六、意义与局限
意义在"开了一维"。它证得:扩散模型的推理期缩放,不必只在"步数"或"末端点兵"上做文章;"何时养多少人、何时裁"自身便是可调旋钮。小模型配大 N̄,竟能在相近 FLOPs 下逼近大模型——给"用算力换质量"添了新算盘。它还可叠于 DPO 微调之上,亦能用以海选"提示词改写"。
局限亦实在:其一,倚仗标量奖励,故在"目标早期即定形"的提示词对齐上最强,对纯美学引导增益偏小;其二,早期广撒网推高峰值显存(SDXL 13.27 对 8.28 GiB);其三,终归是个推理调度器,替代不了控制类条件或后期细节精修。
七、延伸思考:与 LLM 慢思考的同与异
两界皆把"测试期算力"视作新边疆。LLM 借语言天然可逐步验证,树搜索水到渠成;扩散模型因"中间产物是噪声"而难验证,PSP 之巧,正是用"去噪估计 x̂₀"这免费副产品充当早期评委,把不可验证化作可早筛。此恰与粒子滤波(KLD-sampling,2001)的"变粒子数、早剪枝"一脉相承,唯首次于现代文生图里被认真拷打。
若放宽视野:任何"迭代生成、且有廉价中间代理"的过程——视频、3D、乃至 LLM 的草稿—精修——恐都藏着一条"前载探索、渐进剪枝"的缩放轴。PSP 予人的启示朴素却锋利:与其平均分摊算力,不如在信息最丰处多下注,于胜负已分时早收手。
---
考据小注:用户所引编号 2507.19318 实为一篇德西特时空泡沫图维度正则化的高能物理论文,与本文无涉;PSP 原作正确编号应为 arXiv:2607.21591(Caltech,2026-07-23)。文中数据据此真实 preprint 及其项目页(vision.caltech.edu/psp)核实。