CLM-004
Claim
DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。
| id | CLM-004 |
|---|---|
| type | claim |
| source | SRC-2212.09748 |
| scope | class-conditional ImageNet 512x512; latent diffusion on SD f8 VAE (64x64x4 latents, 1024 tokens at p=2) with ft-EMA decoder; DiT-XL/2 trained 3M steps; 250 DDPM sampling steps; classifier-free guidance scale 1.50 |
| epistemic | supported |
| lifecycle | RECONCILED |
| created | 2026-09-03 |
| updated | 2026-09-03 |
Proposition
在 class-conditional ImageNet 512×512 生成基准上,DiT-XL/2 配合 classifier-free guidance(cfg=1.50)达到 FID-50K 3.04,优于此前 所有 diffusion 模型(此前最佳 ADM-G+U 3.85),但未超过 GAN 基线 StyleGAN-XL(2.41)。
Evidence refs
Notes
Table 3 同时给出 sFID 5.02 / IS 240.82 / Precision 0.84 / Recall 0.54。 512 的 Precision/Recall 按 ADM 惯例仅用 1000 张真实样本计算 (Table 3 caption)。模型与 256 版超参一致(3M steps、524.6 Gflops、 1024 tokens)。摘要与 §5.1 的 "outperform all prior diffusion models" 不含 GAN——512 上整体最优生成模型仍是 StyleGAN-XL, 与 256(CLM-001 反超 StyleGAN-XL)方向不同。
引用(3)
- CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
- EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(3)
- EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-004 核验 CLM-004 512 SOTA:Table 3(3.04/3.85/2.41)与 §5.1 512 段(3M 步、1024 tokens、524.6G)逐项一致。supported。