CPT-030
Concept
DPM-Solver++
| id | |
|---|---|
| type | concept |
| name | DPM-Solver++ |
| aliases | DPM-Solver++(2M), DPM-Solver++(2S), data-prediction diffusion ODE solver |
| defined-by | PPR-2211.01095 |
| updated |
Definition
DPM-Solver++ 是 DPM-Solver 族中面向引导采样(guided sampling,需要较大引导尺度的 classifier guidance、classifier-free guidance 等场景)的变体。它求解同一个扩散 ODE,但改用数据预测模型
\[\mathbf x_\theta := \frac{\mathbf x_t - \sigma_t\epsilon_\theta(\mathbf x_t,t)}{\alpha_t}\]
(由含噪样本预测干净数据)并对其应用同一套推导(半线性 + 变易常数 + 换元到 \(\lambda_t=\log(\alpha_t/\sigma_t)\)),得到形式不同的精确解
\[\mathbf x_t = \frac{\sigma_t}{\sigma_s}\mathbf x_s + \sigma_t\int_{\lambda_s}^{\lambda_t} e^{\lambda}\,\hat{\mathbf x}_\theta(\hat{\mathbf x}_\lambda,\lambda)\,\mathrm d\lambda ,\]
再对 \(\hat{\mathbf x}_\theta\) 关于 \(\lambda\) 做泰勒展开得同阶但本质不同的求解器族(被解析积出的线性项与待近似积分核都与噪声预测版本不同)。在此之上叠加两项手段:
- 阈值化(thresholding):把 \(\mathbf x_\theta\) 逐元素裁剪进数据界(有界数据,如图像的 \([-1,1]\))。用途是压制大引导尺度下的“训练-测试不匹配”——引导把条件噪声预测推离真值,使扩散 ODE 的收敛解 \(\mathbf x_0\) 落到数据界外,生成饱和样本;裁剪把预测推回界内。该手段与 \(\mathbf x_\theta\) 参数化天然配套(裁剪对象即数据预测),是选择该参数化的动机之一。
- 多步形式:DPM-Solver++(2M) 复用前两步已有取值估计导数(Adams–Bashforth 型),不需中间求值;在给定总函数求值预算 \(N\) 下多步可取 \(M=N\) 步,而 \(k\) 阶单步最多 \(M\le N/k\) 步,故多步每步长约为单步的 \(1/k\)、高阶误差项更小。单步形式 DPM-Solver++(2S) 每步 2 次求值、引入 \(\lambda\) 中点处的中间时刻。
同族另有扩散 SDE 的版本(SDE-DPM-Solver++(2M) 等,由 SDE 的变易常数解离散得到),其中 SDE-DPM-Solver++1 等价于带特定 \(\eta\) 的 DDIM。论文自述的适用规模:引导采样 15–20 步给出高质量样本。
Disambiguation
- 与 DPM-Solver(CPT-029):同一精确解框架、不同的参数化(\(\mathbf x_\theta\) vs \(\epsilon_\theta\)),因而求解器族本质不同;本变体额外有阈值化与多步,动机是引导场景——论文实测此前的高阶求解器在 guidance scale 8.0、15 次求值下样本质量反而差于一阶 DDIM,且阶数越高越差(引导放大模型高阶导数 → 收敛半径变窄)。
- 与 DDIM:DDIM 是一阶确定性基线,引导采样通常需 100–250 步;本族一阶情形仍退化为 DDIM,SDE 分支的 ++1 与带特定 \(\eta\) 的 DDIM 等价。
- 与 classifier-free guidance(CPT-003):后者是引导信号的构造方式(用条件/无条件预测之差近似引导梯度),本卡是承接该引导信号、负责其数值求解的求解器——控制大引导尺度下的稳定性与有界性;两者是引导管线中相邻但不同的部件。
关联(7)
- PPR-2206.00927 DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
- PPR-2211.01095 DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
- PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- EVI-036 Fig. 7:低温度采样增强轨迹稳定性、步数在 DPM-Solver++(CPT-030)下稳健;w/ refine. 用更低温度(0.1 vs 0.5)以利精修判断——方法使用边界面,非引导窗口消融。
- CPT-003 classifier-free guidance
- CPT-029 DPM-Solver