Research KB

CPT-006 Concept

Latent Diffusion Model

id CPT-006
type concept
name Latent Diffusion Model
aliases LDM, latent diffusion
defined-by SRC-2212.09748, SRC-2112.10752

Definition

在 VAE 隐空间(而非像素空间)训练 diffusion 模型的两阶段框架 (canonical 定义源:Rombach et al., SRC-2112.10752):(1) 感知压缩段——学习 encoder E(autoencoder,LPIPS 感知损失 + PatchGAN 对抗目标,KL 或 VQ 正则)把图像 x 压缩为低维、感知等价的 表示 z=E(x)(下采样因子 f,抽掉高频细节);(2) 语义压缩/生成段—— 在 z 上训练 diffusion 模型(ε-prediction,E 冻结),采样后用 decoder D 还原 x=D(z)。DiT 的模型即 LDM——它替换的是 LDM 框架内的 backbone(U-Net→ViT),first-stage 沿用本文的 f=8 VAE(32×32×4)。 与 VQGAN/DALL·E 的关键差异:LDM 的 2D 卷积 backbone 使其无需极高压缩 比即可保持高保真重建,从而可温和扩展到更高分辨率。

Disambiguation

  • 与 DiT(CPT-001)的关系:LDM 是训练空间维度的概念 (像素 vs 隐空间),DiT 是 backbone 维度(U-Net vs transformer);DiT 论文的模型同时是 LDM 与 transformer backbone,两概念正交。
  • 与 pixel-space DDPM(ADM 系列)对比:LDM 用 VAE 隐表示换取 计算效率(DiT 的 Figure 2 bubbles 显示 LDM 以 ADM 的一小部分 Gflops 达到相近质量;LDM 自身的量化证据见 CLM-014:训练算力约 3.4× 更少、采样吞吐约 3.3× 更快、FID 更低)。

引用(4)

  • CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
  • CPT-001 Diffusion Transformer (DiT)
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(6)

  • CPT-001 Diffusion Transformer (DiT)
  • CPT-002 adaLN-Zero
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-008 Perceptual autoencoder (first stage)
  • CPT-009 Cross-attention conditioning
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。