CPT-003
Concept
classifier-free guidance
| id | CPT-003 |
|---|---|
| type | concept |
| name | classifier-free guidance |
| aliases | CFG, guidance scale |
| defined-by | SRC-2212.09748 |
Definition
条件采样技术:训练时随机丢弃条件 c(替换为可学习的 null embedding ∅),采样时以 ε̂_θ(x_t, c) = ε_θ(x_t, ∅) + s·(ε_θ(x_t, c) − ε_θ(x_t, ∅)) 向条件方向外推;s > 1 为 guidance scale,s = 1 退化为标准条件采样。 (以上为 DiT 论文 §2.1 的复述;canonical 定义源 Ho & Salimans arXiv:2207.12598 尚未入库——Phase 3 侧翼候选。)
Disambiguation
- 与 classifier guidance 的区别:无需外部分类器,以同模型的 无条件输出为基线。
- DiT 的用法特例:guidance 仅施加于 latent 前 3/4 通道(CLM-008); 等效换算 3ch scale (1+x) ≈ 4ch scale (1+¾x)。
- s 的两处口径:Table 2/3 的 cfg=1.25/1.50(评估用,3ch)与样图 caption 的 1.5–6.0(展示用,不出指标)。
引用(2)
- CLM-008 3 通道子集 guidance(DiT 实际做法)经 scale 换算后与全 4 通道效果近似:3ch (1+x) ≈ 4ch (1+¾x)。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(7)
- CLM-012 CFG 大幅改善 DiT-XL/2:256 上 FID 9.62→3.22→2.27(无/1.25/1.50),512 上 12.03→4.64→3.04。
- CLM-018 推理期 CFG 大幅抬升 LDM 质量且几乎不加训练成本:LDM-KL-8 在 MS-COCO FID 23.35→12.61(s=1.5)。
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。