Research KB 登录

PPR-2112.10752 Paper

High-Resolution Image Synthesis with Latent Diffusion Models

id
updated
type paper
title High-Resolution Image Synthesis with Latent Diffusion Models
alias LDM, Latent Diffusion
authors Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer
venue CVPR 2022
arxiv 2112.10752
version arXiv:2112.10752v2
source-hash sha256:cf7f4785e3010fb19b000d7b088f42ad37f433cc6fc063f7c925609b5e824782
tier 1
lifecycle FORMALIZED
epistemic n/a
ingested 2026-09-03
local-formalization ./FRM-2112.10752.md

Rombach 等人的 Latent Diffusion Model(CPT-006;LDM)——即 PPR-2212.09748(DiT)所引用的“latent diffusion”(也是 Stable Diffusion 的学术源头)。核心动作:把图像合成拆成两段——先用一个感知 autoencoder(LPIPS 感知损失 + PatchGAN 对抗目标,配 KL 或 VQ 两种正则)把像素空间压成一个低维、感知上等价的 latent 空间(抽掉高频、人眼不可辨的细节),再在这个 latent 空间上训一个扩散模型(time-conditional U-Net,ε-prediction 的 reweighted 目标)去学语义构成。靠卷积 backbone 的归纳偏置,它能温和地扩展到更高维的 latent(不像 VQGAN / DALL·E 那样被 1D AR 展平逼着选极高压缩比),于是可以自选更低的压缩率、重建保真更高,还能以卷积方式直接用于兆像素级大图(~1024² 乃至更大);再加上 cross-attention(CPT-009)条件注入与 classifier-free guidance(CPT-003),text / class / layout / image-to-image(SR、inpainting)都能灵活挂上,同时相对像素空间扩散模型大幅压低训练与采样开销(class-conditional ImageNet 256 FID 3.60、CelebA-HQ 无条件 5.11、text-to-image MS-COCO FID 12.61、inpainting 新 SOTA 等,详见各 claim)。在本库中它承担 DiT(FRM-2212.09748CPT-001 “transformer- backbone 的 latent DDPM” 所用的 latent 空间正出于此处)的上游基座角色,是与 DiT 互证的第二来源。

关联(41)

  • PPR-006 Learning Structured Output Representation using Deep Conditional Generative Models
  • PPR-2205.09991 Planning with Diffusion for Flexible Behavior Synthesis
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2510.11690 Diffusion Transformers with Representation Autoencoders
  • PPR-2605.12964 Asymmetric Flow Models
  • BMK-004 ImageNet class-conditional generation (256×256 / 512×512)
  • BMK-005 CelebA-HQ unconditional generation (256×256)
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • FRM-2211.15654 OpenScene 五层重建:CLIP 共嵌入不变量下的三级特征构造(多视图融合 f2D → 余弦蒸馏 f3D → prompt-相似度 ensemble f2D3D)与零样本推理;断言投影待 G1 签发后进行。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
  • CLM-013 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。
  • CLM-014 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
  • CLM-015 LDM 全 2D-conv 流程(conv AE + conv DM)可容忍比 1D-AR tokenize 更温和的压缩且重建更保真;优势集中在低压缩区间(f=8 显著优于 DALL·E,f=16 与 VQGAN 相当)。
  • CLM-016 下采样因子 f 的选取存在数据集相关的甜区:f 过小训练进度结构性缓慢,f 过大因 first-stage 信息损失保真度早期停滞;复杂数据集甜区在 f=4/8,较简单数据可用更高 f 换采样速度。
  • CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
  • CLM-018 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
  • CLM-020 likelihood-based 目标的 mode-covering 行为在 Precision/Recall 上系统性地优于 GAN(逐数据集、针对对抗基线),支持其分布覆盖优势的指标层证据;同口径下 LDM 于 CelebA-HQ 取得新 SOTA FID,其余数据集与最强 GAN/扩散竞争。
  • CLM-021 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
  • CLM-022 对密集条件 i2i 任务,latent 扩散配方同时给出感知质量与效率收益:(SR) LDM-SR 在感知指标上胜过专用像素扩散 SR3 与回归基线,但 PSNR/SSIM 由回归基线占先;(Inpainting) latent 化显著提吞吐并改善 FID,分布级质量超专用 SOTA 修复器 LaMa 而 LPIPS 略高。
  • CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。
  • EVI-013 §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-003 classifier-free guidance
  • CPT-006 Latent Diffusion Model
  • CPT-008 Perceptual autoencoder (first stage)
  • CPT-009 Cross-attention conditioning
  • CPT-010 DiT cross-attention conditioning
  • CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
  • SYN-002 三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。
  • DIS-001 术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。