Research KB

CLM-016 Claim

f 消融中 f=4/8 平衡训练进度与渐近质量;f=1/2 太慢、f=16/32 过早停滞(LDM-1 与 LDM-8 差距 38 FID)。

id CLM-016
type claim
source SRC-2112.10752
scope class-conditional ImageNet 256^2; f∈{1,2,4,8,16,32}; 参数量对齐 ~391–396M; 2M steps; 单 A100; linear 噪声调度, 1000 步 diffusion; 训练进度与采样速度曲线 (Fig. cin_traincourse/speedplot)
epistemic supported
lifecycle RECONCILED
created 2026-09-03
updated 2026-09-03

Proposition

在下采样因子 f∈{1,2,4,8,16,32} 的消融中(参数量对齐、class-cond ImageNet、2M steps、单 A100),f=4 与 f=8 取得训练进度速度与渐近样张质量的最优平衡:f=1/2 把过多感知压缩留给(缓慢的)扩散模型、训练进度慢;f=16/32 过度压缩丢失信息、保真度较早停滞。像素基线(LDM-1)与 LDM-8 之间的 FID gap 在 2M steps 后达 38。复杂数据集(ImageNet)需更低压缩(f=4/8)以维持质量;CelebA-HQ 等较简单数据可用更高 f 提速。

Evidence refs

Notes

正文逐句依据(§4.1):"small downsampling factors for LDM-{1,2} result in slow training progress, whereas overly large values of f cause stagnating fidelity after comparably few training steps";归因 i) 大部分感知压缩留给 DM,ii) first-stage 压缩过强致信息损失。LDM-{4-16} "strike a good balance between efficiency and perceptually faithfully results"。z-shape 与模型尺寸(~391–396M)见 Tab. cin_hyperparams。

引用(2)

  • EVI-016 §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(3)

  • EVI-016 §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-016 f 甜区核验:f=4/8 最优与 §4.1 消融、FID gap 38(LDM-1 vs LDM-8 @2M)正文引语一致,scope 限 ImageNet/2M/单 A100。supported。