Research KB

EVI-018 Evidence

主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。

id EVI-018
type evidence
claims CLM-018
source SRC-2112.10752
observation 主文 Tab.(Text-Conditional Image Synthesis, MS-COCO, 250 DDIM steps:LDM-KL-8 vs LDM-KL-8-G)+ class-conditional ImageNet 256² 主表(LDM-4 vs LDM-4-G, cfg=1.5)+ Changelog(v2 的 T2I 数由 1.45B + CFG 产生)
method T2I:LAION-400M,1.45B KL-LDM,BERT tokenizer,τ=transformer,MS-COCO val,250 DDIM steps,guided 版 cfg s=1.5。Class-cond:ImageNet 256²,LDM-4 400M,250 步,cfg=1.5(三/四通道口径见表内注)。
scope T2I 1.45B(23.35→12.61); class-cond ImageNet 256²(10.56→3.60); 250 步; cfg 1.5

Result

开启 CFG(s=1.5)前后:

  • text-to-image(MS-COCO, 250 步):LDM-KL-8 FID 23.35 → LDM-KL-8-G 12.61(降幅 ≈47%);IS 19.9326.62
  • class-conditional ImageNet 256²(250 步):LDM-4 FID 10.56 / IS 103.49 → LDM-4-G FID 3.60 / IS 247.67(prec 0.87),降幅 ≈66%。

同表参照(T2I, 250 步):CogView 27.10;LAFITE 26.94;GLIDE 12.24;Make-A-Scene 11.84;LDM-KL-8 23.35/19.93;LDM-KL-8-G 12.61/26.62。

Caveats

"CFG 大幅提质"是推理期效应——同一份训练好的权重,仅采样时用 ε̂(s)=ε(∅)+s·(ε(c)−ε(∅)) 外推即改变 FID,不增加训练成本;故 23.35 与 12.61 的差异不能归于"训了更大的模型"。需注意 guidance scale 与通道数的口径:DiT 侧把 cfg 施加在 4 通道 latent 的前 3 通道(等效换算 3ch 1.5≈4ch 1.375),LDM 主表的 1.5 为通道无关标称值;不同 scale 下 FID 单调下降但样本多样性(recall)略降(见 CLM-001 的 2.27 讨论)。T2I 的 23.35/12.61 与 class-cond 的 10.56/3.60 分属两张不同的表、两套数据(LAION/MS-COCO vs ImageNet),不要跨表相减。

引用(3)

  • CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
  • CLM-018 推理期 CFG 大幅抬升 LDM 质量且几乎不加训练成本:LDM-KL-8 在 MS-COCO FID 23.35→12.61(s=1.5)。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(3)

  • CLM-018 推理期 CFG 大幅抬升 LDM 质量且几乎不加训练成本:LDM-KL-8 在 MS-COCO FID 23.35→12.61(s=1.5)。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。