CLM-002
Claim
同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
| id | CLM-002 |
|---|---|
| type | claim |
| source | SRC-2212.09748 |
| scope | DiT-XL/2, ImageNet 256x256, 400K training steps, batch 256, no classifier-free guidance; FID-50K via ft-MSE VAE decoder |
| epistemic | supported |
| lifecycle | RECONCILED |
| created | 2026-09-02 |
| updated | 2026-09-03 |
Proposition
在 DiT-XL/2 配置与 400K 步训练预算下(ImageNet 256×256),adaLN-Zero block 的 FID-50K 为四种 conditioning 设计中最低(19.47,对照 in-context 35.24 / cross-attention 26.14 / adaLN 25.21),且计算开销 最低之一(118.64G;cross-attention 137.62G 多约 15%)。论文将 adaLN-Zero 相对 vanilla adaLN(25.21→19.47)的优势主要归因于 零初始化使每个 block 初始为恒等函数。
Evidence refs
Notes
四种设计在 Gflops(118.56–137.62G)与参数量(449–675M)上并不相同, 故这是"同配置(XL/2)、同训练预算"的对比,而非严格"同规模"对比; 论文原文框架(§5、Figure 5)是 adaLN-Zero 同时"更优且最省算力" ("yields lower FID ... while being the most compute-efficient")。 结论在训练全程成立(Figure 5),未对全程单独列表。 零初始化归因是论文的解释(Figure 5 推断),非独立消融。 此后论文所有模型均使用 adaLN-Zero block(§5)。
引用(2)
- EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(5)
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。