Research KB 登录

PPR-2211.01095 Paper

DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models

id
updated
type paper
title DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
alias DPM-Solver++, DPM-Solver++(2M), DPM-Solver++(2S)
authors Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, Jun Zhu
venue Machine Intelligence Research 22(4):730-751 (2025)
arxiv 2211.01095
doi 10.1007/s11633-025-1562-4
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2211.01095v3
source-hash sha256:2d849e7ff352deedce25a919eb60011c59b399bb49c7dd2579d1e61d530ca780
admitted-under U0-user-directive
admission-note 用户 2026-09-10 指令:为 DPM-Solver++ 概念缺口补定义来源(TRIAGE INBOX 条目),供 CPT-030 的 defined-by 锚定。

定位

DPM-Solver++(Lu 等,2022;arXiv 预印本)解决的是引导采样(guided sampling)的加速问题——即需要较大引导尺度(classifier guidance、classifier-free guidance(CPT-003) 等)才能获得最佳样本质量的场景。当时该场景的常用快速采样器是 DDIM:一阶、确定性,通常需 100–250 步才给出高质量样本。论文先指出把此前为无引导场景设计的高阶求解器(包括 DPM-Solver 本身、iPNDM、DEIS 等)直接用于大引导尺度时会失效,并把障碍拆成两条。

其一,大引导尺度使高阶求解器不稳定:引导会同时放大模型的输出与其高阶导数,而导数决定求解器的收敛半径;放大使高阶求解器需要远小于名义步长才能收敛,阶数越高越敏感。论文用 classifier guidance 尺度 8.0、15 次函数求值的 ImageNet 256 样本显示,这些高阶求解器的样本质量反而差于一阶 DDIM。其二,训练-测试不匹配:数据位于有界区间(图像通常 \([-1,1]\)),而大引导尺度把条件噪声预测推离真值,使扩散 ODE 的收敛解 \(\mathbf x_0\) 落到界外,生成饱和、不自然的样本。

对策是三件事的组合:改用数据预测模型(data prediction,\(\mathbf x_\theta\):由含噪样本预测干净数据)求解同一个扩散 ODE;引入阈值化把预测的数据裁剪回数据界内;以及提供多步形式的求解器,用更小的有效步长缓解不稳定。论文自述结果是引导采样在 15–20 步内达到高质量(像素空间与潜空间 DPM 均验证)。

方法(机制要点)

换参数化而不换 ODE。 数据预测模型定义为 \(\mathbf x_\theta := (\mathbf x_t - \sigma_t\epsilon_\theta(\mathbf x_t,t))/\alpha_t\),它与噪声预测模型对应同一个扩散 ODE,但对 \(\mathbf x_\theta\) 应用同一套“半线性 + 常数变易法 + 换元到 \(\lambda_t=\log(\alpha_t/\sigma_t)\)”的推导,精确解取另一形式(论文 Proposition 1):

\[\mathbf x_t = \frac{\sigma_t}{\sigma_s}\mathbf x_s + \sigma_t\int_{\lambda_s}^{\lambda_t} e^{\lambda}\,\hat{\mathbf x}_\theta(\hat{\mathbf x}_\lambda,\lambda)\,\mathrm d\lambda .\]

论文强调这与噪声预测形式的精确解不等价于同一求解器族:被解析积出的线性项不同(\(\frac{\alpha_t}{\alpha_s}\mathbf x_s\) vs \(\frac{\sigma_t}{\sigma_s}\mathbf x_s\)),待近似的积分核也不同(\(e^{-\lambda}\epsilon_\theta\) vs \(e^{\lambda}\mathbf x_\theta\)),因此泰勒展开后得到的是本质不同的高阶求解器。一阶情形仍退化为 DDIM。

单步与多步。 单步形式 DPM-Solver++(2S) 每步需要 2 次网络求值(引入 \(\lambda\) 中点处的中间时刻 \(s_i\)),中间值用完即弃。多步形式 DPM-Solver++(2M) 复用前两步已算出的值来估计导数(Adams–Bashforth 型),不需要额外中间求值:在给定总求值预算 \(N\) 下多步可用 \(M=N\) 步,而 \(k\) 阶单步最多用 \(M\le N/k\) 步,故多步的每步步长约为单步的 \(1/k\),高阶误差项相应更小——论文报告多步略优于单步。

阈值化。 对有界数据,把 \(\mathbf x_\theta\) 逐元素裁剪进数据界(dynamic thresholding 一类做法)可把越界样本推回,直接缓解大引导尺度下的训练-测试不匹配。该手段与 \(\mathbf x_\theta\) 参数化天然配套(裁剪对象就是数据预测),这是选择该参数化的动机之一。

SDE 版本。 论文另对扩散 SDE 做同样的变易常数推导(\(f,g\)\(\lambda\) 变量下的形式),给出二阶 SDE 求解器 SDE-DPM-Solver++(2M) 等;其中 SDE-DPM-Solver++1 等价于带特定 \(\eta\) 的 DDIM。

实验结果(摘要)

ImageNet 256、classifier guidance 尺度 8.0、15 次函数求值:论文 Fig. 1 以并列样本显示 DPM-Solver++(2M) 优于 DDIM 与其它高阶求解器(DPM-Solver 的 fast2/fast3、iPNDM、DEIS-1/2 等),后者的样本质量随阶数升高而更差,甚至不如 DDIM。像素空间引导采样用 DeepFloyd-IF 验证(SDE-DPM-Solver++(2M) 相对其它采样器的对照)。论文自述引导采样在 15–20 步内达到高质量;无引导场景下与原 DPM-Solver 同属一档。

与本库的关系

准入方式为 U0(用户指令,见 frontmatter admission-note):本卡为 CPT-030(DPM-Solver++)提供 defined-by 锚点,补上“库内引用 DPM-Solver++ 而无定义”的缺口。本卡是 PPR-2206.00927CPT-029)的变体论文,二者共享“精确解 + 泰勒展开 + 指数积分器”的框架。下游引用:PPR-2501.15564(Diffusion Planner)明确声明用 DPM-Solver++ 作反向过程求解器并采用 VP 调度 \(\sigma_t=(1-t)\beta_{\min}+t\beta_{\max}\)EVI-036 记录其对去噪步数与采样温度的扫描——因此该文的“步数稳健”“低温度提高稳定性”等结论都绑定在本求解器上。加工深度为 Tier-0(DA5),不产 Claim/EVI/FRM;升级 Tier-1 需人工确认。

发表信息:期刊版本见 Machine Intelligence Research 22(4):730–751 (2025),DOI 10.1007/s11633-025-1562-4;本卡锚定的原文是 arXiv:2211.01095v3(缓存 tarball),与期刊版未逐字比对。Semantic Scholar 引用数 1128(2026-09-10 查询)。

关联(6)

  • PPR-2206.00927 DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
  • PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
  • EVI-036 Fig. 7:低温度采样增强轨迹稳定性、步数在 DPM-Solver++(CPT-030)下稳健;w/ refine. 用更低温度(0.1 vs 0.5)以利精修判断——方法使用边界面,非引导窗口消融。
  • CPT-003 classifier-free guidance
  • CPT-029 DPM-Solver
  • CPT-030 DPM-Solver++