EVI-015
Evidence
Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
| id | EVI-015 |
|---|---|
| type | evidence |
| claims | CLM-015 |
| source | SRC-2112.10752 |
| observation | Tab.423 firststage(OpenImages 训练的 autoencoder,ImageNet-Val 评估;对比 DALL·E f=8、VQGAN f=16 与 LDM f=8/16/2 的重建指标)+ §4 / 引言贡献 i, iii |
| method | first-stage autoencoder,下采样因子 f,code dim |Z|;重建指标:R-FID(原图 vs 重构图,↓)、IS、PSNR(↑)、LPIPS(↓)、SSIM(↑)。OpenImages 训练,ImageNet-Val 评估。 |
| scope | f=8/16/2(LDM)、DALL·E f=8、VQGAN f=16(k=16384/1024);OpenImages→ImageNet-Val |
Result
matched 压缩下 LDM 的重建质量:
- f=8, LDM (|Z|=16384, 4ch):R-FID 1.14, IS 201.92, PSNR 23.07, LPIPS 1.17, SSIM 0.65。
- 对比 DALL·E f=8 (8192):R-FID 32.01, PSNR 22.8, SSIM 0.73。→ 同为 8× 压缩,LDM 的 R-FID 1.14 远优于 DALL·E 的 32.01(相差约 28 倍)。
- f=16, LDM (8ch):R-FID 5.15, IS 144.55, PSNR 20.83, SSIM 0.54;对比 VQGAN f=16 (16384,256):R-FID 4.98, PSNR 19.9(两者 f=16 下重建能力大体相当);VQGAN f=16 (1024,256):R-FID 7.94。
- f=2 (|Z|=2048, 2ch):R-FID 0.16, IS 232.75, PSNR 30.85, LPIPS 0.27, SSIM 0.91 —— 极低压缩下仍有近乎无损的重建,这是 AR 类方案难以企及的区间。
Caveats
R-FID 越低代表重建越忠实(原图与重构图的 Inception 特征距离小)。LDM 的优势主要体现在低压缩区间(f=2/8):f=8 下 R-FID 1.14 vs DALL·E 32.01;而 f=16 下 LDM(5.15)与 VQGAN(4.98)基本打平——即 LDM 并非在所有 f 上都赢,而是"能在更低 f 处保持高保真",这正是其可扩展到高分辨率的根基。code dim |Z| 与通道数是受控变量;DALL·E 的 "- " 表示其 IS 未在该表列出。该表为补充材料完整版(firststagetablecomplete),主文 Tab.423 为其精简视图。
引用(2)
- CLM-015 LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
被引用(3)
- CLM-015 LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- VER-015 重建核验:LDM f=8 R-FID 1.14 vs DALL·E 32.01 / VQGAN 4.98、f=2 0.16 与 Tab.423 一致,f=16 打平边界已声明。supported。