Research KB

EVI-002 Evidence

Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。

id EVI-002
type evidence
claims CLM-002
source SRC-2212.09748
observation Appendix Table 4 ('Details of all DiT models') + Figure 5 (FID over training)
method 四种 conditioning 设计的 DiT-XL/2 各训 400K steps,其余超参相同;FID-50K 无 guidance(ft-MSE VAE decoder)
scope DiT-XL/2 @ 256x256, 400K steps:in-context 119.37G / cross-attn 137.62G / adaLN 118.56G / adaLN-Zero 118.64G flops

Result

FID-50K(400K steps,无 guidance,ft-MSE decoder): adaLN-Zero 19.47 < adaLN 25.21 < cross-attention 26.14 < in-context 35.24。Figure 5 显示该排序在训练全程保持。 计算开销:cross-attention 增加 ~15% Gflops;adaLN 系列增量可忽略。 参数量(Table 4):in-context 449M / cross-attention 598M / adaLN 600M / adaLN-Zero 675M——四种设计既不同算力也不同参数。

Caveats

单种子、单规模(XL/2)的直接对比;论文未报告方差。 adaLN vs adaLN-Zero 的差距归因于零初始化,是论文的解释 (Figure 5 推断),非独立消融。

引用(2)

  • CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(5)

  • CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
  • CPT-002 adaLN-Zero
  • CPT-007 adaptive layer norm (adaLN)
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。