Research KB

SRC-2112.10752 Source

Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

id SRC-2112.10752
type source
kind paper
title High-Resolution Image Synthesis with Latent Diffusion Models
authors Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer
venue CVPR 2022
arxiv 2112.10752
version arXiv:2112.10752v2
source-hash sha256:cf7f4785e3010fb19b000d7b088f42ad37f433cc6fc063f7c925609b5e824782
tier 1
lifecycle FORMALIZED
epistemic n/a
ingested 2026-09-03
local-formalization ./FRM-2112.10752.md

Rombach 等人的 Latent Diffusion Model(LDM)——即 SRC-2212.09748(DiT)所引用的 “latent diffusion”(也是 Stable Diffusion 的学术源头)。核心动作:把图像合成拆成两段 ——先用一个感知 autoencoder(LPIPS 感知损失 + PatchGAN 对抗目标,配 KL 或 VQ 两种正则) 把像素空间压成一个低维、感知上等价的 latent 空间(抽掉高频、人眼不可辨的细节), 再在这个 latent 空间上训一个扩散模型(time-conditional U-Net,ε-prediction 的 reweighted 目标)去学语义构成。靠卷积 backbone 的归纳偏置,它能温和地扩展到更高维的 latent(不像 VQGAN / DALL·E 那样被 1D AR 展平逼着选极高压缩比),于是可以自选更低的压缩率、 重建保真更高,还能以卷积方式直接用于兆像素级大图(~1024² 乃至更大);再加上 cross-attention 条件注入与 classifier-free guidance,text / class / layout / image-to-image (SR、inpainting)都能灵活挂上,同时相对像素空间扩散模型大幅压低训练与采样开销 (class-conditional ImageNet 256 FID 3.60、CelebA-HQ 无条件 5.11、text-to-image MS-COCO FID 12.61、 inpainting 新 SOTA 等,详见各 claim)。在本库中它承担 DiT(FRM-2212.09748 之 CPT-001 “transformer- backbone 的 latent DDPM” 所用的 latent 空间正出于此处)的上游基座角色,是与 DiT 互证 的第二来源。

引用(2)

  • CPT-001 Diffusion Transformer (DiT)
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(27)

  • CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
  • CLM-013 LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。
  • CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
  • CLM-015 LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。
  • CLM-016 f 消融中 f=4/8 平衡训练进度与渐近质量;f=1/2 太慢、f=16/32 过早停滞(LDM-1 与 LDM-8 差距 38 FID)。
  • CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
  • CLM-018 推理期 CFG 大幅抬升 LDM 质量且几乎不加训练成本:LDM-KL-8 在 MS-COCO FID 23.35→12.61(s=1.5)。
  • CLM-019 1.45B KL-LDM + cross-attn 文本条件在 MS-COCO 达与 Make-A-Scene/GLIDE 相当量级且参数量显著更少。
  • CLM-020 无条件合成 SOTA:LDM 在 CelebA-HQ 256² FID 5.11,并在 FFHQ/LSUN 上与最强 GAN/扩散竞争。
  • CLM-021 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
  • CLM-022 image-to-image 高质高效:LDM-SR 在 ImageNet 4× 超分 256² FID 优于 SR3;inpainting 亦优于现有方法。
  • CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。
  • CPT-006 Latent Diffusion Model
  • CPT-008 Perceptual autoencoder (first stage)
  • CPT-009 Cross-attention conditioning
  • EVI-013 §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-019)。
  • EVI-020 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。