CLM-013
Claim
LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。
| id | CLM-013 |
|---|---|
| type | claim |
| source | SRC-2112.10752 |
| scope | 256^2/512^2 (conv 扩展至 ~1024^2/兆像素); ImageNet / CelebA-HQ / FFHQ / LSUN / LAION-400M / MS-COCO / OpenImages / Places; f=4..8 (消融 f=1..32); 169M–1.45B params; single A100 2M steps 的消融设定 |
| epistemic | supported |
| lifecycle | RECONCILED |
| created | 2026-09-03 |
| updated | 2026-09-03 |
Proposition
LDM 把高分辨率图像合成分解为两段:(1) 感知压缩段——用一个 autoencoder (LPIPS 感知损失 + patch-based 对抗目标,KL 或 VQ 两种正则可选)把像素映射为 低维、感知上等价的 latent(抽掉高频、人眼不可辨细节);(2) 语义压缩/生成段—— 在该 latent 上训一个扩散模型(ε-prediction 的 reweighted 目标,U-Net backbone)学语义构成。分离的动机:像素空间 DM 事实上同时承担两件事,而 感知无关细节占用大量容量;显式分离后生成模型只须关注语义比特。
Evidence refs
Notes
两阶段命名出自引言("perceptual compression" 与 "semantic compression")。 autoencoder 只需训一次即可被多个 DM 复用(不同条件/任务共享同一 latent)。 与 VQGAN/DALL·E 的差异点在 CPT 层面的区分(1D AR 展平 vs 2D conv)另见 CLM-015。
引用(3)
- CLM-015 LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。
- EVI-013 §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
被引用(3)
- EVI-013 §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- VER-013 两段分解核验:感知压缩 AE + 潜空间 DM 与 §1/§2.3/§2.4(Eq.4-5)一致,DiT FRM-2212.09748 AX-2 同向互证,scope 未超。supported。