EVI-004
Evidence
Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。
| id | EVI-004 |
|---|---|
| type | evidence |
| claims | CLM-004 |
| source | SRC-2212.09748 |
| observation | Table 3 (Class-Conditional ImageNet 512x512) + §5.1 512×512 正文 |
| method | FID-50K via ADM TensorFlow evaluation suite, 250 DDPM steps, ft-EMA VAE decoder; Precision/Recall 用 1000 真实样本(循 ADM 惯例) |
| scope | Table 3 全部行目:BigGAN-deep / StyleGAN-XL / ADM 系列 / DiT 系列 |
Result
DiT-XL/2-G(cfg=1.50):FID-50K 3.04,sFID 5.02,IS 240.82, Precision 0.84,Recall 0.54。对比行:ADM-G+U 3.85、ADM-G 7.72、 ADM-U 9.96、ADM 23.24、StyleGAN-XL 2.41、BigGAN-deep 8.43。 DiT 行内梯度(无 guidance → cfg1.25 → cfg1.50): 12.03 → 4.64 → 3.04。 计算开销:DiT-XL/2 524.6G vs ADM 1983G / ADM-U 2813G (§5.1、Table 6)。
Caveats
3.04 对 StyleGAN-XL 2.41 差 0.63——512 上 GAN 仍占优。Table 4 报告的 512 无 guidance FID 为 11.93(ft-MSE decoder、3M steps), 与 Table 3 的 12.03(ft-EMA)存在 decoder 口径差(CPT-005)。
引用(3)
- CLM-004 DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。
- CPT-005 VAE decoder variants (ft-MSE / ft-EMA)
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(3)
- CLM-004 DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-004 核验 CLM-004 512 SOTA:Table 3(3.04/3.85/2.41)与 §5.1 512 段(3M 步、1024 tokens、524.6G)逐项一致。supported。