BMK-004
Benchmark
ImageNet class-conditional generation (256×256 / 512×512)
| id | |
|---|---|
| updated | |
| type | benchmark |
| title | ImageNet class-conditional generation (256×256 / 512×512) |
| venue | Deng et al. 2009 (dataset); FID-50K protocol via ADM evaluation suite |
| version | ImageNet-1k; protocol as consumed by PPR-2212.09748 (DiT) / PPR-2112.10752 (LDM) |
| tier | 0 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-07 |
协议
- 任务:ImageNet-1k 1000 类类条件生成,256×256 与 512×512 两档。
- 主指标:FID-50K(5 万样本),250 DDPM 采样步;DiT 论文全部 FID 用 ADM TensorFlow 评估套件导出计算(规避 FID 实现敏感性,parmar2021cleanfid)。
- 次指标:sFID、Inception Score、Precision/Recall。
- guidance 口径:DiT 论文主表 FID 分 with/without CFG 两种口径报告(§5 主结果用 CFG;scaling 分析不用);SOTA 数字均 CFG 口径。
- decoder 口径(DiT):ft-MSE 与 ft-EMA 两种微调 VAE decoder(encoder 为 SD 的 f=8 VAE);Table 4 用 ft-MSE,主 SOTA 用 ft-EMA。decoder 选择影响“是否超过 GAN 基线”的边界判定(CLM-007)。
已知偏差
- FID 对实现细节敏感(clean-fid 论点);跨论文 FID 比较须确认评估套件一致。
- LDM 侧(PPR-2112.10752)ImageNet 为类条件 256 训练(LDM-4/-8),其 FID 由自家评估管线报告,与 DiT 的 ADM 套件口径存在不可忽略的实现差异——两源 ImageNet 数字不做直接差值比较。
承重关系
- PPR-2212.09748:全部主结果(EVI-001/003/004/012 等)。
- PPR-2112.10752:类条件 LDM-4/-8 训练与 f 消融(EVI-015/016)。
- CLM-009(256/512 分辨率边界,EVI-004 Caveats)、CLM-003(400K 网格)、CLM-012(CFG 口径)以本基准为口径前提。
关联(9)
- PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
- CLM-007 DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
- CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
- CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
- EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
- EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
- EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。