Research KB

CPT-002 Concept

adaLN-Zero

id CPT-002
type concept
name adaLN-Zero
aliases adaptive layer norm zero, zero-initialized adaptive layer norm, adaLN-zero
defined-by SRC-2212.09748

Definition

DiT block 的条件注入机制(SRC-2212.09748 §3.2、App. A.5):在 vanilla adaLN(CPT-007)基础上,除从条件嵌入回归逐维 scale/shift(γ, β)外, 额外回归残差门控 α(施加于 block 内每条残差连接之前);调制 MLP 输出 层零初始化使 α 初始为 0,从而每个 DiT block 初始为恒等映射。名称中的 "Zero" 即指这层零初始化(初始化为恒等函数的 adaLN)。

  • 条件来源:timestep t 与 class label c 的嵌入向量之和(逐元素求和, 非拼接、非分别注入;§3.2 "sum of the embedding vectors of t and c")。
  • block 内有两个残差子块(self-attention 路径与 MLP 路径),各有独立的 自适应 LayerNorm,故每个 block 需要两组 (γ, β) 与两个 α(详见 Mechanism 的参数结构)。
  • 恒等初始化的先例:ResNet 系(Goyal 2017 零初始化 block 末端 BN scale γ)与 diffusion U-Net(零初始化残差连接前的末层卷积)——论文明确以此 为其设计来源(§3.2)。

Mechanism

论文对 adaLN-Zero 仅作文字描述 + Figure 3 图示,未给出显式公式;以下为 与论文描述一致的标准实现重建(逐条可与 §3.2 / App. A.5 对应,见 Notes)。

设 z = Emb_t(t) + Emb_c(c)(t 经 256 维频率嵌入 + 两层 SiLU MLP 映射到 hidden size d;c 为 d 维 label 嵌入;二者逐元素求和)。调制参数由单层 线性回归:

(γ₁, β₁, α₁, γ₂, β₂, α₂) = W·SiLU(z) + b,W ∈ ℝ^{6d×d}

DiT block 为 pre-norm 残差结构,两个子块各有一个自适应 LayerNorm( elementwise affine 关闭,γ/β 由调制提供):

self-attention 子块:h₁ = h + α₁ ⊙ Attn(γ₁ ⊙ LN(h) + β₁) MLP 子块:h₂ = h₁ + α₂ ⊙ MLP(γ₂ ⊙ LN(h₁) + β₂)

其中 ⊙ 为逐通道(dimension-wise)缩放,广播到全部 token;γ/β/α 均逐维。

  • 零初始化(§3.2 "initialize the MLP to output the zero-vector for all α";§4.1 "initialize the final linear layer with zeros"):调制输出 线性层零初始化 ⇒ 初始 α = 0 ⇒ 残差门关闭 ⇒ 每 block 输出 = 输入 (恒等映射)。
  • 模型末端、线性 decoder 之前的最终 LayerNorm 在 adaLN 系下亦为自适应 (§3.2 Transformer decoder:adaptive if using adaLN)。
  • 参数结构印证(App. A.5):adaLN-Zero 调制输出为 6×hidden(adaLN 为 4×hidden)。6 = 2 子块 × 3 参数 (γ, β, α),4 = 2 子块 × 2 参数 (γ, β)——两数之差恰好是每条残差路径新增的 α 门控,与 §3.2 的文字描述 自洽。

Design Rationale

  • 恒等初始化的收益主张来自先例而非本论文新证:ResNet 监督训练中零初始化 BN scale γ 可加速大规模训练(Goyal 2017);diffusion U-Net 亦在残差前 零初始化末层卷积(§3.2 引述)。
  • 机制理解:block 初始为恒等 ⇒ 训练早期网络等效更浅、残差路径的梯度不受 随机初始化深层堆叠干扰。论文以"每个 block 初始为恒等函数"解释 adaLN-Zero 相对 vanilla adaLN 的显著优势(CLM-002 归因,见下)。
  • 归因边界:恒等初始化在 DiT 上的收益是论文的解释(Figure 5 推断), 非独立消融实验(EVI-002 Caveats;单种子、无方差报告)。

Cost

  • Gflops:论文明言 "adaLN-Zero adds negligible Gflops to the model" (§3.2)。XL/2 实测 118.64G vs adaLN 118.56G(Table 4),差 0.08G (≈0.07%),调制的计算代价可忽略。
  • 参数量:非可忽略——调制输出宽度 4d→6d,每 block 增 2d² 权重; XL/2(N=28, d=1152)增量 ≈ 28 × 1152 × 2304 ≈ 74.4M,与 Table 4 的 adaLN 600M → adaLN-Zero 675M(+75M)吻合。即"计算可忽略、参数不可 忽略"。
  • 由于 DiT 的 scaling 分析以 Gflops 为复杂度透镜(AX-7),论文视该参数 增量不在复杂度讨论内;但引用消融数字时须注意四种 conditioning 设计的 参数量本就不同(EVI-002)。

Empirical Role

  • CLM-002 / EVI-002:四种 conditioning 消融(in-context / cross-attention / adaLN / adaLN-Zero,DiT-XL/2 @ 400K),adaLN-Zero 质量最优且算力最 省;adaLN → adaLN-Zero 的差距被论文归因于恒等初始化。
  • FRM AR-2:CLM-002 是全部 SOTA 结果的设计前提——§5 明言此后所有模型均 使用 adaLN-Zero,故 CLM-001/004 的数值都在该 block 设计下取得。
  • CLM-012 的 CFG 效应互补:CFG 是采样端机制(CPT-003),adaLN-Zero 是前向 block 内的条件注入,二者正交叠加(CFG 数字均出自 adaLN-Zero 模型)。

Disambiguation

  • 与 vanilla adaLN(CPT-007):adaLN-Zero 是 adaLN 的特化(定义依赖 基础概念)——唯一差异是残差门控 α 与调制输出零初始化;量化差异见 CLM-002/EVI-002
  • 与 FiLM(perez2018film):回归 γ/β 的思想承自 FiLM;adaLN-Zero 增加 α 与零初始化。
  • 与 cross-attention / in-context conditioning:四种 conditioning 设计中 的另外两种;adaLN 与 adaLN-Zero 是算力最省的两种,其中 adaLN-Zero 质量最优(CLM-002)。cross-attention 额外引入一层 cross-attn(~15% Gflops 开销),in-context 把 t/c 嵌入当额外 token 拼进序列。
  • 与 U-Net 的 zero-init:同一"block 初始为恒等"思想,施加于 transformer 残差而非卷积残差。
  • 与 DiT(CPT-001):adaLN-Zero 是 DiT block 设计轴上的选定实现;DiT 设计空间三轴(patch size / block 设计 / 模型规模)中,block 设计轴由 本概念占据,其余轴见 CPT-004(patchify)与 Table 1(模型规模)。
  • 与 CFG(CPT-003):正交——CFG 是采样端机制,adaLN-Zero 是前向注入 (见 Empirical Role)。
  • 与 LDM(CPT-006):正交——LDM 定义训练空间(像素 vs 隐空间), adaLN-Zero 是 backbone 内部机制,与 DiT 同处 backbone 维度。

Notes

  • 本概念目前仅由单一来源 SRC-2212.09748 定义;论文对 adaLN-Zero 仅文字
    • Figure 3 图示描述,无显式公式。
  • Mechanism 一节的方程为标准实现重建(与论文文字逐条对应):参数 结构(2 子块 × 3 参数 = 6d)由 App. A.5 的 "6×/4× hidden size" 相互 印证;"+75M 参数" 的推导为本库演算,与 Table 4 数字吻合。这些属于 KB 外推(unverified),不视为论文原文断言。
  • 恒等初始化收益为论文解释而非独立消融(EVI-002)。
  • 后续 DiT 谱系(Sora、Stable Diffusion 3、Flux 等对 adaLN 式调制的 继承与变体)不在本库 scope,未做跨来源扩展——如需扩展属 coverage gap (D14)。

引用(10)

  • CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
  • CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
  • CLM-012 CFG 大幅改善 DiT-XL/2:256 上 FID 9.62→3.22→2.27(无/1.25/1.50),512 上 12.03→4.64→3.04。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-003 classifier-free guidance
  • CPT-004 patchify
  • CPT-006 Latent Diffusion Model
  • CPT-007 adaptive layer norm (adaLN)
  • EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(3)

  • CPT-007 adaptive layer norm (adaLN)
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-017 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。