Research KB 登录

BMK-004 Benchmark

ImageNet class-conditional generation (256×256 / 512×512)

id
updated
type benchmark
title ImageNet class-conditional generation (256×256 / 512×512)
venue Deng et al. 2009 (dataset); FID-50K protocol via ADM evaluation suite
version ImageNet-1k; protocol as consumed by PPR-2212.09748 (DiT) / PPR-2112.10752 (LDM)
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-07

协议

  • 任务:ImageNet-1k 1000 类类条件生成,256×256 与 512×512 两档。
  • 主指标:FID-50K(5 万样本),250 DDPM 采样步;DiT 论文全部 FID 用 ADM TensorFlow 评估套件导出计算(规避 FID 实现敏感性,parmar2021cleanfid)。
  • 次指标:sFID、Inception Score、Precision/Recall。
  • guidance 口径:DiT 论文主表 FID 分 with/without CFG 两种口径报告(§5 主结果用 CFG;scaling 分析不用);SOTA 数字均 CFG 口径。
  • decoder 口径(DiT):ft-MSE 与 ft-EMA 两种微调 VAE decoder(encoder 为 SD 的 f=8 VAE);Table 4 用 ft-MSE,主 SOTA 用 ft-EMA。decoder 选择影响“是否超过 GAN 基线”的边界判定(CLM-007)。

已知偏差

  • FID 对实现细节敏感(clean-fid 论点);跨论文 FID 比较须确认评估套件一致。
  • LDM 侧(PPR-2112.10752)ImageNet 为类条件 256 训练(LDM-4/-8),其 FID 由自家评估管线报告,与 DiT 的 ADM 套件口径存在不可忽略的实现差异——两源 ImageNet 数字不做直接差值比较。

承重关系

关联(9)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
  • CLM-007 DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
  • CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
  • CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
  • EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
  • EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
  • EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。