Research KB

CLM-014 Claim

latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。

id CLM-014
type claim
source SRC-2112.10752
scope class-conditional ImageNet 256x256; LDM-4 (400M latent U-Net, f=4) vs ADM (554M, pixel-space); 250 DDIM steps; 主结果 cfg=1.5 / 算力表 cfg=1.25(178K steps, batch 1200) 两配置
epistemic supported
lifecycle RECONCILED
created 2026-09-03
updated 2026-09-03

Proposition

在预训练 autoencoder 的 latent 空间训 DM,相对像素空间 DM 显著同时压低训练算力采样/推理成本,且质量不降反升(量化,class-cond ImageNet 256,250 步):LDM-4-G 约 271 V100-days(cfg=1.25, 178K steps, batch 1200)vs ADM 约 916 V100-days —— 约 3.4× 更少训练算力;推理吞吐 0.4 samples/s(A100)vs ADM 0.12 —— 约 3.3× 更快采样;参数量 400M vs 554M;且 LDM-4-G 的 FID(算力表 cfg=1.25 为 3.95;主表 cfg=1.5 为 3.60)优于 ADM 的 10.94。

Evidence refs

Notes

两口径严格区分:主结果表(cfg=1.5)FID 3.60 / IS 247.67 / prec 0.87 / recall 0.48;算力表(cfg=1.25, 178K steps, batch 1200)FID 3.95 / 271 V100-days / 0.4 samples/s。ADM 行同取 250 步口径(916 V100-days, 0.12 samples/s, 554M, FID 10.94)。"substantially reducing compute" 亦见摘要与结论。与 DiT 侧(SRC-2212.09748 CLM-001)"此前最佳 LDM-4-G 3.60"互为跨来源锚点。

引用(4)

  • CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
  • EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(5)

  • CPT-006 Latent Diffusion Model
  • EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-013 两段分解核验:感知压缩 AE + 潜空间 DM 与 §1/§2.3/§2.4(Eq.4-5)一致,DiT FRM-2212.09748 AX-2 同向互证,scope 未超。supported。
  • VER-014 算力主张核验:271 vs 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94 与 compute_vs_fid 表逐项吻合,两 cfg 口径已分离。supported。