Research KB

EVI-014 Evidence

Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。

id EVI-014
type evidence
claims CLM-014
source SRC-2112.10752
observation Tab.13 compute_vs_fid(训练 V100-days + 推理 samples/s,A100)+ 主 ImageNet 256² 表(LDM-4/LDM-4-G vs ADM/ADM-G/BigGAN-deep,250 步)
method class-conditional ImageNet 256²;LDM-4 400M latent U-Net,f=4;ADM 554M pixel U-Net;250 DDIM steps;两配置:主结果 cfg=1.5,算力表 cfg=1.25(178K steps, batch 1200)。
scope LDM-4 400M vs ADM 554M;250 步;cfg 1.5(主)/1.25(算力表)

Result

训练算力(V100-days):LDM-4-G 271 vs ADM 916 → ≈3.4× 更少。推理吞吐(samples/s, A100):LDM-4-G 0.4 vs ADM 0.12 → ≈3.3× 更快。参数量:400M vs 554M。质量:LDM-4-G 主表 cfg=1.5 FID 3.60 / IS 247.67 / prec 0.87 / recall 0.48;算力表 cfg=1.25 FID 3.95 / IS 178.22 / prec 0.81 / recall 0.55。对比 ADM(250 步)FID 10.94;ADM-G FID 4.59(608M);BigGAN-deep 6.95(340M)。

Caveats

两处 LDM-4-G 数值来自不同配置,勿混:主表 cfg=1.5 的 FID 3.60;算力表 cfg=1.25(178K, batch 1200)的 271 V100-days + 0.4 samples/s + FID 3.95。ADM 行按 250 步取(916, 0.12, 554M, 10.94),与 250 步 LDM 直接可比;ADM 另有 1000 步行(232 V100-days)不属此口径。"3.4×/3.3×" 为 916/271 与 0.4/0.12 之比,随所选口径浮动,非固定常数。DiT 侧 CLM-001 把 "LDM-4-G 3.60" 记为"此前所有 diffusion 模型最佳",与本表一致,形成跨来源锚点。

引用(3)

  • CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
  • CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(3)

  • CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-014 算力主张核验:271 vs 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94 与 compute_vs_fid 表逐项吻合,两 cfg 口径已分离。supported。