Research KB

EVI-013 Evidence

§1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。

id EVI-013
type evidence
claims CLM-013
source SRC-2112.10752
observation §1 Introduction(perceptual/semantic 两段分解论述)+ §2.3 Perceptual Image Compression + §2.4 Latent Diffusion Models(Eq. dmloss/ldmloss)
method 第一段:autoencoder(E,D),x∈R^(Hp×Wp×3) → z=E(x)(下采样因子 f),重构 x̂=D(z);损失=LPIPS 感知 + patch-based 对抗目标;两种正则:KL(对标准正态加轻 KL 罚,类 VAE)与 VQ(解码器内置向量量化层,可视为量化被吸收的 VQGAN 变体)。第二段:latent 上训 ε-prediction 扩散模型(time-conditional U-Net),reweighted 简化目标 ||ε−ε_θ(z_t,t)||²。
scope 256²/512²(conv 扩至 ~1024²);ImageNet/CelebA-HQ/FFHQ/LSUN/LAION/COCO/OpenImages/Places;f=1..32 全消融;169M–1.45B params

Result

像素空间 DM 的学习可拆为感知压缩(去掉高频细节、语义变化很小)与语义压缩(学数据的语义/概念组合)两阶段。LDM 用显式分离替代隐式混合:first-stage autoencoder 提供与像素感知等价但算力更省的表示空间;second-stage DM 在该空间训练,采样后单次过 decoder 得图像。

Caveats

f=1(LDM-1)即退化为像素 DM,是整套消融的下界参照。KL 与 VQ 两种 first-stage 的重建能力略有差异(VQ 略逊),但实验观察到 VQ 正则化有时反而给出更好的 LDM 样张质量(见 CLM 相关消融讨论)。感知等价性是经验意义上的(LPIPS/对抗目标保证局部真实感),非数学同构。

引用(2)

  • CLM-013 LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(3)

  • CLM-013 LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-013 两段分解核验:感知压缩 AE + 潜空间 DM 与 §1/§2.3/§2.4(Eq.4-5)一致,DiT FRM-2212.09748 AX-2 同向互证,scope 未超。supported。