静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-15 07:55

扩散模型的推理期缩放:渐进式种子剪枝 PSP

副标题:把"花算力换质量"这桩旧账,重新算一遍

一、核心问题:扩散模型为何长不出"慢思考"

大语言模型(LLM)早已悟得一事:临场多想一想,答案便会更好。这叫"推理期缩放"(inference-time scaling,测试阶段多投算力)——best-of-N 多采样几回挑最优、Chain-of-Thought 逼它步步推演、乃至树搜索反复试探。投得越多,分越高,近乎一条平滑上坡。

扩散模型(diffusion,以逐步去噪从噪声生成图像的网络)却相反。它的"默认旋钮"是加多去噪步数,但学界早有定论:多加步数往往是笔亏本买卖。真正微妙的是"种子"——那张最初喂进去的纯噪声。同一提示词、同一模型,换一颗种子,成品便天差地别。质量对种子高度敏感,本是隐患,却也指了条路:既然种子定生死,何不多试几颗、择优而从?于是有了 best-of-N(并行跑 N 条、末端挑奖赏最高者)等法。

然旧法皆守一桩心照不宣的规矩:内存恒定——同时养着 N 条候选,从头到尾一样多,直到最后一刻才裁。这好比雇了 N 个画师,人人画完整幅,才看谁佳。浪费在明处:多数人早露怯态,你却仍付他画完的工钱。

二、一句话洞见

> 放宽"内存恒定"这道枷锁,以"前期广撒网、早期猛淘汰"换同一笔算力花得更聪明——此即 PSP 的全部智慧。

三、通俗类比:一场倒计时的选秀海选

把生成图像想成选秀。终点是成品图,每去噪一步,便如选手闯过一轮。

  • Best-of-N 是:请 4 位选手,每人从头唱到尾,末了评委打分选冠军。中途你早听出 3 人走音,却照付全额出场费。
  • PSP 是:一上来请 8 位(多一倍),唱到四分之一、评委已能辨优劣时,砍半;唱到一半、高下更明时,再砍半,仅留 2 位进决赛圈,把余下预算尽数砸于其上精雕细琢。
妙处在于"评委"廉价。扩散模型每走一步,本就顺手算出一张"此刻估出的成品图"(论文记作 x̂₀,即去噪估计)。拿这半成品去问奖励模型(ImageReward,一个给"图与提示词多贴合"打分的现成裁判),不费模型额外一次前向计算。于是"海选打分"近乎白送。

四、方法拆解:账是怎么平的

PSP 由 Caltech 的 Guimarães 与 Perona 提出,训练无关、梯度无关,扩散与流匹配(flow-matching,另一类以"速度场"去噪的生成范式)主干通吃。它用确定性求解器(DDIM η=0 或 Euler),令所有随机性只源于初始种子——正合"种子搜索"的题面。

算法极简(默认 N̄=4,即等效算力为单条轨迹之 4 倍): 1. 撒下 2N̄ = 8 颗独立噪声种子; 2. 自 t=T 至 1,每步:用生成器已有预测顺手估出 x̂₀ → 奖励模型打分 → 按预定时间表只留高分者 → 幸存者去噪一步; 3. 时间表:8 颗 → 25% 进度砍到 4 → 50% 进度砍到 2 → 直至终点。

算力账(以去噪步计):C = Σ kₜ = 8×0.25T + 4×0.25T + 2×0.5T = 4T,恰等于跑 4 条完整轨迹的 best-of-N。换言之:PSP 探了 8 颗种子的量,却只花 4 颗的工钱。中间打分复用生成器内部量,零额外前向;奖励模型开销可忽略。

五、实验与结论

在 SD v1.5、SDXL、SD 3.5 三主干上,以同一奖励 ImageReward、同一总去噪步为公平擂台,对比 best-of-N、重要性采样(FK-Steering)、树搜索(DSearch、BFS 等)。N̄=4 时:

  • SDXL:GenEval 0.645 对 0.629(BoN),人类对齐 0.713 对 0.682;
  • SD 3.5:GenEval 0.747 持平,人类对齐 0.841 对 0.831;
  • SD v1.5:GenEval 0.574 对 0.542。
人类评估扎实:249 名标注员、8295 张图、每图 3 评、一致率 80.3%。更有趣的反差:BFS 在 ImageReward 裸分上略高(SDXL 1.247 > 1.224),却在 GenEval 与人类对齐上输给 PSP——标量奖励会被"刷分",而 PSP 因早淘汰、少过度优化,反而更贴提示词本意。效率上,SDXL 的 PSP 耗时 13.74s,贴近 BoN(N=4) 之 12.48s,却相当于探了 BoN(N=8) 需 23.90s 才有的种子池。

六、意义与局限

意义在"开了一维"。它证得:扩散模型的推理期缩放,不必只在"步数"或"末端点兵"上做文章;"何时养多少人、何时裁"自身便是可调旋钮。小模型配大 N̄,竟能在相近 FLOPs 下逼近大模型——给"用算力换质量"添了新算盘。它还可叠于 DPO 微调之上,亦能用以海选"提示词改写"。

局限亦实在:其一,倚仗标量奖励,故在"目标早期即定形"的提示词对齐上最强,对纯美学引导增益偏小;其二,早期广撒网推高峰值显存(SDXL 13.27 对 8.28 GiB);其三,终归是个推理调度器,替代不了控制类条件或后期细节精修。

七、延伸思考:与 LLM 慢思考的同与异

两界皆把"测试期算力"视作新边疆。LLM 借语言天然可逐步验证,树搜索水到渠成;扩散模型因"中间产物是噪声"而难验证,PSP 之巧,正是用"去噪估计 x̂₀"这免费副产品充当早期评委,把不可验证化作可早筛。此恰与粒子滤波(KLD-sampling,2001)的"变粒子数、早剪枝"一脉相承,唯首次于现代文生图里被认真拷打。

若放宽视野:任何"迭代生成、且有廉价中间代理"的过程——视频、3D、乃至 LLM 的草稿—精修——恐都藏着一条"前载探索、渐进剪枝"的缩放轴。PSP 予人的启示朴素却锋利:与其平均分摊算力,不如在信息最丰处多下注,于胜负已分时早收手。

---

考据小注:用户所引编号 2507.19318 实为一篇德西特时空泡沫图维度正则化的高能物理论文,与本文无涉;PSP 原作正确编号应为 arXiv:2607.21591(Caltech,2026-07-23)。文中数据据此真实 preprint 及其项目页(vision.caltech.edu/psp)核实。

暂无表态