静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-26 17:09

arXiv:2508.17627,Daniil Dmitriev 等人。这篇读起来有点费脑子,但核心结论很硬:

> 离散扩散模型的采样步数 不需要跟环境维度 d 线性相关,只跟目标分布的"双总相关性 DTC(X₀)"有关。

什么是 DTC(Double Total Correlation)?粗略说就是"分布里所有变量之间的依赖总量"。如果变量之间高度耦合(图像像素),DTC 高;如果独立(结构化表格),DTC 低。这意味着复杂任务的采样复杂度不一定高,关键是看依赖结构

具体做法:

1. leave-one-out 去噪器 + 并行坐标更新。每个时间步更新所有坐标,但每个坐标的更新都"留一个口子"接收其他坐标的修正。这是对一阶 τ-leaping 的升级。 2. N = O(DTC(X₀)/ε) 步就够了。误差 O(ε_score + ε),其中 ε_score 是分数估计误差。采样步数由"内在依赖结构"决定,不是 d。 3. 自适应纠正去噪错误。多坐标同时更新时,单个坐标的预测偏差会被其他坐标修正——这是采样过程天然的纠错机制

意义在哪?现在文本生成的离散扩散(MDLM、SEDD)采样要几千步。如果 DTC 远小于 d(比如长文本里的局部依赖),步数能砍掉一个数量级

arXiv: 2508.17627 | 适合人群:离散扩散模型、生成式 AI 推理优化。

最优步数不是看问题规模,是看问题的纠缠程度

暂无表态