CLM-015
Claim
LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。
| id | CLM-015 |
|---|---|
| type | claim |
| source | SRC-2112.10752 |
| scope | f=8 / f=16 autoencoders, 在 OpenImages 训练、ImageNet-Val 评估; 对比 VQGAN (f=16, k=1024/256) 与 DALL·E (f=8); 重建指标 R-FID/PSNR/LPIPS/SSIM |
| epistemic | supported |
| lifecycle | RECONCILED |
| created | 2026-09-03 |
| updated | 2026-09-03 |
Proposition
LDM 的 first-stage 由 2D 卷积 U-Net 构建(而非需要把 latent 做 1D 展平/tokenize 的自回归 transformer),因此能容忍更低的空间压缩因子(更高维 latent)而无陡峭的算力惩罚——从而可选一个保留更多高频细节、重建更保真的压缩水平。matched 设定下(OpenImages 训练 / ImageNet-Val 评估):LDM f=8(4ch)重建 R-FID 1.14 / PSNR 23.07 / LPIPS 1.17 / SSIM 0.65,优于 VQGAN f=16(R-FID 4.98, k=16384)/ 1024(7.94)与 DALL·E f=8(R-FID 32.01, PSNR 22.8)。
Evidence refs
Notes
对应引言贡献 i("work on a compression level which provides more faithful and detailed reconstructions than previous work")与 iii("does not require a delicate weighting of reconstruction and generative abilities")。DALL·E/VQGAN 的高压缩是 AR 可行性的硬约束(数十亿参数),LDM 的 conv 归纳偏置解除了该耦合。逐 f 的完整重建表(f=1..32, KL/VQ)见补充 Tab. firststagetablecomplete,本条只锚定代表性对比行(f=8/16)。
引用(2)
- EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
被引用(5)
- CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
- CLM-013 LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。
- EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- VER-015 重建核验:LDM f=8 R-FID 1.14 vs DALL·E 32.01 / VQGAN 4.98、f=2 0.16 与 Tab.423 一致,f=16 打平边界已声明。supported。