EVI-001
Evidence
Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-001)。
| id | EVI-001 |
|---|---|
| type | evidence |
| claims | CLM-001 |
| source | SRC-2212.09748 |
| observation | Table 2 (Class-Conditional ImageNet 256x256) + §5.1 正文 + Appendix A.1 (subset-channel guidance) |
| method | FID-50K via ADM TensorFlow evaluation suite, 250 DDPM steps, ft-EMA VAE decoder, EMA 权重; guidance 仅施加于 4 通道 latent 的前 3 通道 |
| scope | Table 2 全部行目:与 BigGAN-deep / StyleGAN-XL / ADM 系列 / CDM / LDM 系列的同表对比 |
Result
DiT-XL/2-G(三通道 cfg=1.50):FID-50K 2.27,sFID 4.60,IS 278.24, Precision 0.83,Recall 0.57。对比行:LDM-4-G (cfg=1.50) 3.60、 ADM-G+U 3.94、StyleGAN-XL 2.30、BigGAN-deep 6.95。 2.27 出自三通道 guidance;等效四通道 guidance(scale 1.375) 给出 FID-50K 2.20(Appendix A.1)。 无 guidance DiT-XL/2:FID 9.62(7M steps),recall 0.67 为全表最高。 计算开销上下文(§5.1、Table 6):DiT-XL/2 118.6G vs LDM-4 103.6G(latent U-Net)vs ADM 1120G / ADM-U 742G(pixel U-Net)。
Caveats
FID 对实现细节敏感,论文专门用 ADM 的评估套件保证口径一致。 DiT-XL/2 训练 7M steps(约为对比模型常规预算的数倍); 2.35M steps 时 FID 2.55(无 guidance 10.67),仍优于此前全部 diffusion 模型。 2.27 对 StyleGAN-XL 2.30 的幅度为 0.03,"all prior generative models 中最低 FID"的结论依赖此对比口径与 FID 单一指标:sFID 上 StyleGAN-XL(4.02)仍优于 DiT(4.60),IS 上 DiT(278.24)高于 StyleGAN-XL(265.12)。
引用(2)
- CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(4)
- CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
- EVI-009 §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-001 核验 CLM-001 DiT SOTA:Table 2/§5.1/App.A.1 数字(2.27、LDM-4-G 3.60、StyleGAN-XL 2.30)与 v2 源逐项一致,含审计修正史;scope 未超。supported。