SYN-001
Synthesis
DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
| id | SYN-001 |
|---|---|
| type | synthesis |
| inputs | CLM-002 |
Structure
单来源(SRC-2212.09748)内同族设计的系统对比——D7 修订后"跨来源为 建议性要求"的首个实例。输入 Claim:CLM-002(消融结果,EVI-002 承载 数字);参与概念:CPT-011 / CPT-010 / CPT-007 / CPT-002;术语路由: DIS-001 / DIS-002。
| 设计 | CPT | 机制(条件注入方式) | Gflops | 参数 | FID-50K @400K |
|---|---|---|---|---|---|
| in-context | CPT-011 | t/c 嵌入拼入序列,self-attention 内融合 | 119.37 | 449M | 35.24 |
| cross-attention | CPT-010 | 2-token K/V + 独立交叉注意力层 | 137.62 | 598M | 26.14 |
| adaLN | CPT-007 | token 无关逐维仿射(γ/β 回归) | 118.56 | 600M | 25.21 |
| adaLN-Zero | CPT-002 | adaLN + 残差门控 α + 零初始化恒等 | 118.64 | 675M | 19.47 |
数字均出自 EVI-002(Table 4 + Figure 5;XL/2、无 guidance、ft-MSE decoder)。排序在训练全程保持。
派生观察(KB 外推,unverified——不回写为论文断言)
- 交互强度-质量非单调:条件-特征交互最强的 cross-attention(token 级)劣于 token 无关的 adaLN 系;在 DiT 的 class-conditional 设定下, 条件通路的算力效率与恒等初始化比交互表达能力更关键。此为跨四设计 的结构性解读,论文只给出逐对比较,未做此抽象。
- 参数量与质量无单调关系:最省参数的 in-context(449M)最差,最多 参数的 adaLN-Zero(675M)最好;但四设计参数差源自机制本身(调制宽度 4d vs 6d、附加层),不能据此推断"加参数即提质"——该推断属 CLM-003/ CLM-006 的 Gflops scaling 轴,不在本对比 scope 内。
- 质量差距的两段归因:adaLN → adaLN-Zero(25.21→19.47)归因于零 初始化恒等(论文解释、非独立消融,EVI-002 Caveats);其余排序差距 论文未归因。
Consensus / Disagreement / Gaps
- 共识(单来源内):adaLN-Zero 质量最优且算力最省之一,§5 选定为 此后全部模型的设计;CLM-002 是 SOTA 结果(CLM-001/004)的设计前提 (FRM AR-2)。
- 争议:无——输入仅一条 Claim,无冲突进入本整合(CFL-001 属 LDM 侧术语问题,不涉及本对比)。
- 空白:①单一规模(XL/2)单种子、无方差(EVI-002 Caveats);②四 设计 Gflops/参数量不同,是"同配置同预算"而非"同规模"对比;③条件 机制的跨来源演化(FiLM(CPT-012,SRC-1709.07871)→ adaLN → 各后续谱系)未 ingest,属 coverage gap(D14)——扩展时本卡应升级为跨来源对比。
关联(15)
- SRC-1709.07871 FiLM: Visual Reasoning with a General Conditioning Layer
- SRC-2212.09748 Scalable Diffusion Models with Transformers
- CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
- CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
- CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
- CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
- EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- CPT-010 DiT cross-attention conditioning
- CPT-011 DiT in-context conditioning
- CPT-012 FiLM (feature-wise linear modulation)
- CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
- DIS-001 术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。
- DIS-002 术语 adaLN 的两种读法路由:vanilla adaLN(CPT-007)与其零初始化特化 adaLN-Zero(CPT-002)。