CPT-006
Concept
Latent Diffusion Model
| id | CPT-006 |
|---|---|
| type | concept |
| name | Latent Diffusion Model |
| aliases | LDM, latent diffusion |
| defined-by | SRC-2212.09748, SRC-2112.10752 |
Definition
在 VAE 隐空间(而非像素空间)训练 diffusion 模型的两阶段框架 (canonical 定义源:Rombach et al., SRC-2112.10752):(1) 感知压缩段——学习 encoder E(autoencoder,LPIPS 感知损失 + PatchGAN 对抗目标,KL 或 VQ 正则)把图像 x 压缩为低维、感知等价的 表示 z=E(x)(下采样因子 f,抽掉高频细节);(2) 语义压缩/生成段—— 在 z 上训练 diffusion 模型(ε-prediction,E 冻结),采样后用 decoder D 还原 x=D(z)。DiT 的模型即 LDM——它替换的是 LDM 框架内的 backbone(U-Net→ViT),first-stage 沿用本文的 f=8 VAE(32×32×4)。 与 VQGAN/DALL·E 的关键差异:LDM 的 2D 卷积 backbone 使其无需极高压缩 比即可保持高保真重建,从而可温和扩展到更高分辨率。
Disambiguation
引用(4)
- CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
- CPT-001 Diffusion Transformer (DiT)
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。