EVI-009
Evidence
§1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。
| id | EVI-009 |
|---|---|
| type | evidence |
| claims | CLM-009 |
| source | SRC-2212.09748 |
| observation | §1 设计论题陈述 + Table 2/Table 3(DiT vs U-Net 系列对比)+ Table 6(U-Net 基线 Gflops) |
| method | 以 ADM 评估套件统一口径,比较 DiT-XL/2 与 U-Net backbone diffusion 基线(ADM/ADM-U/ADM-G/LDM 系列) |
| scope | Table 2/3 全部 U-Net 行目;架构级对比而非受控消融(非同参数量/同预算配对) |
Result
256(Table 2):DiT-XL/2-G 2.27 vs 最佳 U-Net diffusion LDM-4-G 3.60、ADM-G+U 3.94;512(Table 3):3.04 vs ADM-G+U 3.85。 算力(Table 6):DiT-XL/2 118.6G(256)/ 524.6G(512) vs ADM 1120G/1983G、ADM-U 742G/2813G、LDM-4 103.6G——质量更优的 同时算力低于 pixel U-Net 约一个量级。
Caveats
非受控对比:DiT 训练预算(7M/3M steps)高于多数基线的常规预算 (2.35M 时 FID 2.55 仍占优,见 EVI-001);比较混合了架构、预算、 guidance 设定多因素。claim 中 "not crucial" 是论文的诠释——证据 直接支撑的是"可替换且质量不降(反升)"。
引用(3)
- CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone 并取得更优质量。
- EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-001)。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(4)
- CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
- CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone 并取得更优质量。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-009 核验 CLM-009 架构论题:可检验部分(ViT 替换 U-Net 质量反升)与 Table 2/3/6 一致;'归纳偏置非关键'属作者诠释(非受控对比),按 A4 保留。partially-supported。