CLM-001
Claim
DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
| id | CLM-001 |
|---|---|
| type | claim |
| source | SRC-2212.09748 |
| scope | class-conditional ImageNet 256x256; latent diffusion on SD f8 VAE (8x downsample, 32x32x4) with ft-EMA decoder; DiT-XL/2 trained 7M steps; 250 DDPM sampling steps; classifier-free guidance scale 1.50 applied to 3 of 4 latent channels |
| epistemic | supported |
| lifecycle | RECONCILED |
| created | 2026-09-02 |
| updated | 2026-09-03 |
Proposition
在 class-conditional ImageNet 256×256 生成基准上,DiT-XL/2 配合 classifier-free guidance(三通道,cfg=1.50)达到 FID-50K 2.27,为 此前所有生成模型中最低的 FID-50K——既优于此前所有 diffusion 模型 (此前最佳 LDM-4-G 3.60),也优于 GAN 基线 StyleGAN-XL(2.30)。
Evidence refs
Notes
Table 2(256×256)同时报告 sFID 4.60 / IS 278.24 / Precision 0.83 / Recall 0.57。论文原文表述(§5.1):"Our method achieves the lowest FID of all prior generative models, including the previous state-of-the-art StyleGAN-XL." 可复现关键细节:2.27 使用三通道 guidance(latent 共 4 通道,仅对前 3 通道施加 guidance,scale 1.5);等效四通道 guidance(scale 1.375) 给出 FID-50K 2.20(Appendix A.1)。 仅训 2.35M steps(与 ADM 预算相当)时 FID 2.55,仍优于此前全部 diffusion 模型。无 guidance 的 DiT-XL/2(7M steps)FID 9.62, recall 0.67 为 Table 2 中最高,且在所有测试 guidance scale 下 recall 高于 LDM-4 与 LDM-8。
引用(2)
- EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-001)。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(17)
- CLM-004 DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。
- CLM-007 VAE decoder(original/ft-MSE/ft-EMA)可免重训互换,FID 2.46/2.30/2.27,差异有限且均优于此前 diffusion。
- CLM-008 3 通道子集 guidance(DiT 实际做法)经 scale 换算后与全 4 通道效果近似:3ch (1+x) ≈ 4ch (1+¾x)。
- CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone 并取得更优质量。
- CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
- CPT-002 adaLN-Zero
- EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-001)。
- EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
- EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-001 核验 CLM-001 DiT SOTA:Table 2/§5.1/App.A.1 数字(2.27、LDM-4-G 3.60、StyleGAN-XL 2.30)与 v2 源逐项一致,含审计修正史;scope 未超。supported。
- VER-007 核验 CLM-007 decoder 消融:Table 5(2.46/2.30/2.27)与 §A.4(encoder 相同、免重训互换、LDM decoder 下仍最优)一致。supported。
- VER-008 核验 CLM-008 subset-channel guidance:App.A.1(3ch@1.5→2.27、4ch@1.375→2.20、近似式)逐字核对一致,'近似'不确定性保留。supported。
- VER-012 核验 CLM-012 CFG 梯度:Table 2/3 行内(256: 9.62/3.22/2.27;512: 12.03/4.64/3.04)逐格一致,scale 边界与质量-多样性权衡已记。supported。
- VER-014 算力主张核验:271 vs 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94 与 compute_vs_fid 表逐项吻合,两 cfg 口径已分离。supported。
- VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。
- VER-020 无条件合成核验:CelebA-HQ 5.11 SOTA、FFHQ 4.98、LSUN-Bedrooms 2.95 vs ADM 1.90 与无条件表一致,SOTA 限 CelebA-HQ、P/R 逐数据集。supported。