EVI-002
Evidence
Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
| id | EVI-002 |
|---|---|
| type | evidence |
| claims | CLM-002 |
| source | SRC-2212.09748 |
| observation | Appendix Table 4 ('Details of all DiT models') + Figure 5 (FID over training) |
| method | 四种 conditioning 设计的 DiT-XL/2 各训 400K steps,其余超参相同;FID-50K 无 guidance(ft-MSE VAE decoder) |
| scope | DiT-XL/2 @ 256x256, 400K steps:in-context 119.37G / cross-attn 137.62G / adaLN 118.56G / adaLN-Zero 118.64G flops |
Result
FID-50K(400K steps,无 guidance,ft-MSE decoder): adaLN-Zero 19.47 < adaLN 25.21 < cross-attention 26.14 < in-context 35.24。Figure 5 显示该排序在训练全程保持。 计算开销:cross-attention 增加 ~15% Gflops;adaLN 系列增量可忽略。 参数量(Table 4):in-context 449M / cross-attention 598M / adaLN 600M / adaLN-Zero 675M——四种设计既不同算力也不同参数。
Caveats
单种子、单规模(XL/2)的直接对比;论文未报告方差。 adaLN vs adaLN-Zero 的差距归因于零初始化,是论文的解释 (Figure 5 推断),非独立消融。
引用(2)
- CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(5)
- CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。