Research KB

CLM-004 Claim

DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。

id CLM-004
type claim
source SRC-2212.09748
scope class-conditional ImageNet 512x512; latent diffusion on SD f8 VAE (64x64x4 latents, 1024 tokens at p=2) with ft-EMA decoder; DiT-XL/2 trained 3M steps; 250 DDPM sampling steps; classifier-free guidance scale 1.50
epistemic supported
lifecycle RECONCILED
created 2026-09-03
updated 2026-09-03

Proposition

在 class-conditional ImageNet 512×512 生成基准上,DiT-XL/2 配合 classifier-free guidance(cfg=1.50)达到 FID-50K 3.04,优于此前 所有 diffusion 模型(此前最佳 ADM-G+U 3.85),但未超过 GAN 基线 StyleGAN-XL(2.41)。

Evidence refs

Notes

Table 3 同时给出 sFID 5.02 / IS 240.82 / Precision 0.84 / Recall 0.54。 512 的 Precision/Recall 按 ADM 惯例仅用 1000 张真实样本计算 (Table 3 caption)。模型与 256 版超参一致(3M steps、524.6 Gflops、 1024 tokens)。摘要与 §5.1 的 "outperform all prior diffusion models" 不含 GAN——512 上整体最优生成模型仍是 StyleGAN-XL, 与 256(CLM-001 反超 StyleGAN-XL)方向不同。

引用(3)

  • CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
  • EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(3)

  • EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-004 核验 CLM-004 512 SOTA:Table 3(3.04/3.85/2.41)与 §5.1 512 段(3M 步、1024 tokens、524.6G)逐项一致。supported。