PPR-2211.01095
Paper
DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
| id | |
|---|---|
| updated | |
| type | paper |
| title | DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models |
| alias | DPM-Solver++, DPM-Solver++(2M), DPM-Solver++(2S) |
| authors | Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, Jun Zhu |
| venue | Machine Intelligence Research 22(4):730-751 (2025) |
| arxiv | 2211.01095 |
| doi | 10.1007/s11633-025-1562-4 |
| tier | 0 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2211.01095v3 |
| source-hash | sha256:2d849e7ff352deedce25a919eb60011c59b399bb49c7dd2579d1e61d530ca780 |
| admitted-under | U0-user-directive |
| admission-note | 用户 2026-09-10 指令:为 DPM-Solver++ 概念缺口补定义来源(TRIAGE INBOX 条目),供 CPT-030 的 defined-by 锚定。 |
定位
DPM-Solver++(Lu 等,2022;arXiv 预印本)解决的是引导采样(guided sampling)的加速问题——即需要较大引导尺度(classifier guidance、classifier-free guidance(CPT-003) 等)才能获得最佳样本质量的场景。当时该场景的常用快速采样器是 DDIM:一阶、确定性,通常需 100–250 步才给出高质量样本。论文先指出把此前为无引导场景设计的高阶求解器(包括 DPM-Solver 本身、iPNDM、DEIS 等)直接用于大引导尺度时会失效,并把障碍拆成两条。
其一,大引导尺度使高阶求解器不稳定:引导会同时放大模型的输出与其高阶导数,而导数决定求解器的收敛半径;放大使高阶求解器需要远小于名义步长才能收敛,阶数越高越敏感。论文用 classifier guidance 尺度 8.0、15 次函数求值的 ImageNet 256 样本显示,这些高阶求解器的样本质量反而差于一阶 DDIM。其二,训练-测试不匹配:数据位于有界区间(图像通常 \([-1,1]\)),而大引导尺度把条件噪声预测推离真值,使扩散 ODE 的收敛解 \(\mathbf x_0\) 落到界外,生成饱和、不自然的样本。
对策是三件事的组合:改用数据预测模型(data prediction,\(\mathbf x_\theta\):由含噪样本预测干净数据)求解同一个扩散 ODE;引入阈值化把预测的数据裁剪回数据界内;以及提供多步形式的求解器,用更小的有效步长缓解不稳定。论文自述结果是引导采样在 15–20 步内达到高质量(像素空间与潜空间 DPM 均验证)。
方法(机制要点)
换参数化而不换 ODE。 数据预测模型定义为 \(\mathbf x_\theta := (\mathbf x_t - \sigma_t\epsilon_\theta(\mathbf x_t,t))/\alpha_t\),它与噪声预测模型对应同一个扩散 ODE,但对 \(\mathbf x_\theta\) 应用同一套“半线性 + 常数变易法 + 换元到 \(\lambda_t=\log(\alpha_t/\sigma_t)\)”的推导,精确解取另一形式(论文 Proposition 1):
论文强调这与噪声预测形式的精确解不等价于同一求解器族:被解析积出的线性项不同(\(\frac{\alpha_t}{\alpha_s}\mathbf x_s\) vs \(\frac{\sigma_t}{\sigma_s}\mathbf x_s\)),待近似的积分核也不同(\(e^{-\lambda}\epsilon_\theta\) vs \(e^{\lambda}\mathbf x_\theta\)),因此泰勒展开后得到的是本质不同的高阶求解器。一阶情形仍退化为 DDIM。
单步与多步。 单步形式 DPM-Solver++(2S) 每步需要 2 次网络求值(引入 \(\lambda\) 中点处的中间时刻 \(s_i\)),中间值用完即弃。多步形式 DPM-Solver++(2M) 复用前两步已算出的值来估计导数(Adams–Bashforth 型),不需要额外中间求值:在给定总求值预算 \(N\) 下多步可用 \(M=N\) 步,而 \(k\) 阶单步最多用 \(M\le N/k\) 步,故多步的每步步长约为单步的 \(1/k\),高阶误差项相应更小——论文报告多步略优于单步。
阈值化。 对有界数据,把 \(\mathbf x_\theta\) 逐元素裁剪进数据界(dynamic thresholding 一类做法)可把越界样本推回,直接缓解大引导尺度下的训练-测试不匹配。该手段与 \(\mathbf x_\theta\) 参数化天然配套(裁剪对象就是数据预测),这是选择该参数化的动机之一。
SDE 版本。 论文另对扩散 SDE 做同样的变易常数推导(\(f,g\) 在 \(\lambda\) 变量下的形式),给出二阶 SDE 求解器 SDE-DPM-Solver++(2M) 等;其中 SDE-DPM-Solver++1 等价于带特定 \(\eta\) 的 DDIM。
实验结果(摘要)
ImageNet 256、classifier guidance 尺度 8.0、15 次函数求值:论文 Fig. 1 以并列样本显示 DPM-Solver++(2M) 优于 DDIM 与其它高阶求解器(DPM-Solver 的 fast2/fast3、iPNDM、DEIS-1/2 等),后者的样本质量随阶数升高而更差,甚至不如 DDIM。像素空间引导采样用 DeepFloyd-IF 验证(SDE-DPM-Solver++(2M) 相对其它采样器的对照)。论文自述引导采样在 15–20 步内达到高质量;无引导场景下与原 DPM-Solver 同属一档。
与本库的关系
准入方式为 U0(用户指令,见 frontmatter admission-note):本卡为 CPT-030(DPM-Solver++)提供 defined-by 锚点,补上“库内引用 DPM-Solver++ 而无定义”的缺口。本卡是 PPR-2206.00927(CPT-029)的变体论文,二者共享“精确解 + 泰勒展开 + 指数积分器”的框架。下游引用:PPR-2501.15564(Diffusion Planner)明确声明用 DPM-Solver++ 作反向过程求解器并采用 VP 调度 \(\sigma_t=(1-t)\beta_{\min}+t\beta_{\max}\),EVI-036 记录其对去噪步数与采样温度的扫描——因此该文的“步数稳健”“低温度提高稳定性”等结论都绑定在本求解器上。加工深度为 Tier-0(DA5),不产 Claim/EVI/FRM;升级 Tier-1 需人工确认。
发表信息:期刊版本见 Machine Intelligence Research 22(4):730–751 (2025),DOI 10.1007/s11633-025-1562-4;本卡锚定的原文是 arXiv:2211.01095v3(缓存 tarball),与期刊版未逐字比对。Semantic Scholar 引用数 1128(2026-09-10 查询)。
关联(6)
- PPR-2206.00927 DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
- PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
- EVI-036 Fig. 7:低温度采样增强轨迹稳定性、步数在 DPM-Solver++(CPT-030)下稳健;w/ refine. 用更低温度(0.1 vs 0.5)以利精修判断——方法使用边界面,非引导窗口消融。
- CPT-003 classifier-free guidance
- CPT-029 DPM-Solver
- CPT-030 DPM-Solver++