CPT-002
Concept
adaLN-Zero
| id | CPT-002 |
|---|---|
| type | concept |
| name | adaLN-Zero |
| aliases | adaptive layer norm zero, zero-initialized adaptive layer norm, adaLN-zero |
| defined-by | SRC-2212.09748 |
Definition
DiT block 的条件注入机制(SRC-2212.09748 §3.2、App. A.5):在 vanilla adaLN(CPT-007)基础上,除从条件嵌入回归逐维 scale/shift(γ, β)外, 额外回归残差门控 α(施加于 block 内每条残差连接之前);调制 MLP 输出 层零初始化使 α 初始为 0,从而每个 DiT block 初始为恒等映射。名称中的 "Zero" 即指这层零初始化(初始化为恒等函数的 adaLN)。
- 条件来源:timestep t 与 class label c 的嵌入向量之和(逐元素求和, 非拼接、非分别注入;§3.2 "sum of the embedding vectors of t and c")。
- block 内有两个残差子块(self-attention 路径与 MLP 路径),各有独立的 自适应 LayerNorm,故每个 block 需要两组 (γ, β) 与两个 α(详见 Mechanism 的参数结构)。
- 恒等初始化的先例:ResNet 系(Goyal 2017 零初始化 block 末端 BN scale γ)与 diffusion U-Net(零初始化残差连接前的末层卷积)——论文明确以此 为其设计来源(§3.2)。
Mechanism
论文对 adaLN-Zero 仅作文字描述 + Figure 3 图示,未给出显式公式;以下为 与论文描述一致的标准实现重建(逐条可与 §3.2 / App. A.5 对应,见 Notes)。
设 z = Emb_t(t) + Emb_c(c)(t 经 256 维频率嵌入 + 两层 SiLU MLP 映射到 hidden size d;c 为 d 维 label 嵌入;二者逐元素求和)。调制参数由单层 线性回归:
(γ₁, β₁, α₁, γ₂, β₂, α₂) = W·SiLU(z) + b,W ∈ ℝ^{6d×d}
DiT block 为 pre-norm 残差结构,两个子块各有一个自适应 LayerNorm( elementwise affine 关闭,γ/β 由调制提供):
self-attention 子块:h₁ = h + α₁ ⊙ Attn(γ₁ ⊙ LN(h) + β₁) MLP 子块:h₂ = h₁ + α₂ ⊙ MLP(γ₂ ⊙ LN(h₁) + β₂)
其中 ⊙ 为逐通道(dimension-wise)缩放,广播到全部 token;γ/β/α 均逐维。
- 零初始化(§3.2 "initialize the MLP to output the zero-vector for all α";§4.1 "initialize the final linear layer with zeros"):调制输出 线性层零初始化 ⇒ 初始 α = 0 ⇒ 残差门关闭 ⇒ 每 block 输出 = 输入 (恒等映射)。
- 模型末端、线性 decoder 之前的最终 LayerNorm 在 adaLN 系下亦为自适应 (§3.2 Transformer decoder:adaptive if using adaLN)。
- 参数结构印证(App. A.5):adaLN-Zero 调制输出为 6×hidden(adaLN 为 4×hidden)。6 = 2 子块 × 3 参数 (γ, β, α),4 = 2 子块 × 2 参数 (γ, β)——两数之差恰好是每条残差路径新增的 α 门控,与 §3.2 的文字描述 自洽。
Design Rationale
- 恒等初始化的收益主张来自先例而非本论文新证:ResNet 监督训练中零初始化 BN scale γ 可加速大规模训练(Goyal 2017);diffusion U-Net 亦在残差前 零初始化末层卷积(§3.2 引述)。
- 机制理解:block 初始为恒等 ⇒ 训练早期网络等效更浅、残差路径的梯度不受 随机初始化深层堆叠干扰。论文以"每个 block 初始为恒等函数"解释 adaLN-Zero 相对 vanilla adaLN 的显著优势(CLM-002 归因,见下)。
- 归因边界:恒等初始化在 DiT 上的收益是论文的解释(Figure 5 推断), 非独立消融实验(EVI-002 Caveats;单种子、无方差报告)。
Cost
- Gflops:论文明言 "adaLN-Zero adds negligible Gflops to the model" (§3.2)。XL/2 实测 118.64G vs adaLN 118.56G(Table 4),差 0.08G (≈0.07%),调制的计算代价可忽略。
- 参数量:非可忽略——调制输出宽度 4d→6d,每 block 增 2d² 权重; XL/2(N=28, d=1152)增量 ≈ 28 × 1152 × 2304 ≈ 74.4M,与 Table 4 的 adaLN 600M → adaLN-Zero 675M(+75M)吻合。即"计算可忽略、参数不可 忽略"。
- 由于 DiT 的 scaling 分析以 Gflops 为复杂度透镜(AX-7),论文视该参数 增量不在复杂度讨论内;但引用消融数字时须注意四种 conditioning 设计的 参数量本就不同(EVI-002)。
Empirical Role
- CLM-002 / EVI-002:四种 conditioning 消融(in-context / cross-attention / adaLN / adaLN-Zero,DiT-XL/2 @ 400K),adaLN-Zero 质量最优且算力最 省;adaLN → adaLN-Zero 的差距被论文归因于恒等初始化。
- FRM AR-2:CLM-002 是全部 SOTA 结果的设计前提——§5 明言此后所有模型均 使用 adaLN-Zero,故 CLM-001/004 的数值都在该 block 设计下取得。
- 与 CLM-012 的 CFG 效应互补:CFG 是采样端机制(CPT-003),adaLN-Zero 是前向 block 内的条件注入,二者正交叠加(CFG 数字均出自 adaLN-Zero 模型)。
Disambiguation
- 与 vanilla adaLN(CPT-007):adaLN-Zero 是 adaLN 的特化(定义依赖 基础概念)——唯一差异是残差门控 α 与调制输出零初始化;量化差异见 CLM-002/EVI-002。
- 与 FiLM(perez2018film):回归 γ/β 的思想承自 FiLM;adaLN-Zero 增加 α 与零初始化。
- 与 cross-attention / in-context conditioning:四种 conditioning 设计中 的另外两种;adaLN 与 adaLN-Zero 是算力最省的两种,其中 adaLN-Zero 质量最优(CLM-002)。cross-attention 额外引入一层 cross-attn(~15% Gflops 开销),in-context 把 t/c 嵌入当额外 token 拼进序列。
- 与 U-Net 的 zero-init:同一"block 初始为恒等"思想,施加于 transformer 残差而非卷积残差。
- 与 DiT(CPT-001):adaLN-Zero 是 DiT block 设计轴上的选定实现;DiT 设计空间三轴(patch size / block 设计 / 模型规模)中,block 设计轴由 本概念占据,其余轴见 CPT-004(patchify)与 Table 1(模型规模)。
- 与 CFG(CPT-003):正交——CFG 是采样端机制,adaLN-Zero 是前向注入 (见 Empirical Role)。
- 与 LDM(CPT-006):正交——LDM 定义训练空间(像素 vs 隐空间), adaLN-Zero 是 backbone 内部机制,与 DiT 同处 backbone 维度。
Notes
- 本概念目前仅由单一来源 SRC-2212.09748 定义;论文对 adaLN-Zero 仅文字
- Figure 3 图示描述,无显式公式。
- Mechanism 一节的方程为标准实现重建(与论文文字逐条对应):参数 结构(2 子块 × 3 参数 = 6d)由 App. A.5 的 "6×/4× hidden size" 相互 印证;"+75M 参数" 的推导为本库演算,与 Table 4 数字吻合。这些属于 KB 外推(unverified),不视为论文原文断言。
- 恒等初始化收益为论文解释而非独立消融(EVI-002)。
- 后续 DiT 谱系(Sora、Stable Diffusion 3、Flux 等对 adaLN 式调制的 继承与变体)不在本库 scope,未做跨来源扩展——如需扩展属 coverage gap (D14)。
引用(10)
- CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
- CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
- CLM-012 CFG 大幅改善 DiT-XL/2:256 上 FID 9.62→3.22→2.27(无/1.25/1.50),512 上 12.03→4.64→3.04。
- CPT-001 Diffusion Transformer (DiT)
- CPT-003 classifier-free guidance
- CPT-004 patchify
- CPT-006 Latent Diffusion Model
- CPT-007 adaptive layer norm (adaLN)
- EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(3)
- CPT-007 adaptive layer norm (adaLN)
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-017 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。