Research KB

SRC-2212.09748 Source

DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

id SRC-2212.09748
type source
kind paper
title Scalable Diffusion Models with Transformers
authors William Peebles, Saining Xie
venue ICCV 2023 (Oral); arXiv Dec 2022
arxiv 2212.09748
version arXiv:2212.09748v2
source-hash sha256:708ccde1907e7b5df148c57f4eca9a288acbba2f143ebbcd4cfcf687c8bc0148
tier 1
lifecycle FORMALIZED
epistemic n/a
ingested 2026-09-02
source-role g2dp-citation-neighbor
g2dp-anchor SRC-2606.26017
g2dp-relation CITED_BY_G2DP | G2DP 的轨迹生成主干(DiT)
local-formalization ./FRM-2212.09748.md

DiT 原始论文:以标准 ViT 架构替换 latent diffusion 的 U-Net backbone, 并以 Gflops 为复杂度透镜系统研究其 scaling 性质。本库首个入库的 Tier-1 全管线素材。

与 G2DP 的关系(SRC-2606.26017:G2DP 引用本工作(DiT)作为其轨迹生成的主干(decoder)。在 G2DP 框架中,DiT 负责条件扩散式的轨迹 token 生成,占据网格引导(grid-guided)则在此生成之上叠加;因此本卡既是 FRM-2212.09748 的形式化对象,也是 G2DP 引用簇里被 G2DP 直接引用的节点。

引用(1)

  • SRC-2606.26017 G2DP:时空占据栅格+路线进度融合为可微 cost volume,去噪末段注入引导,nuPlan 纯模仿 SOTA;本引用簇中心。

被引用(37)

  • CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
  • CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。
  • CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。
  • CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
  • CLM-004 DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。
  • CLM-005 采样算力不能补偿模型算力:DiT-L/2 多步(1000 步、80.7 Tflops、FID-10K 25.9)仍劣于 XL/2 低步(128 步、15.2 Tflops、23.7)。
  • CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
  • CLM-007 VAE decoder(original/ft-MSE/ft-EMA)可免重训互换,FID 2.46/2.30/2.27,差异有限且均优于此前 diffusion。
  • CLM-008 3 通道子集 guidance(DiT 实际做法)经 scale 换算后与全 4 通道效果近似:3ch (1+x) ≈ 4ch (1+¾x)。
  • CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone 并取得更优质量。
  • CLM-010 DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。
  • CLM-011 patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。
  • CLM-012 CFG 大幅改善 DiT-XL/2:256 上 FID 9.62→3.22→2.27(无/1.25/1.50),512 上 12.03→4.64→3.04。
  • CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-002 adaLN-Zero
  • CPT-003 classifier-free guidance
  • CPT-004 patchify
  • CPT-005 VAE decoder variants (ft-MSE / ft-EMA)
  • CPT-006 Latent Diffusion Model
  • CPT-007 adaptive layer norm (adaLN)
  • EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-001)。
  • EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
  • EVI-003 Figure 8/6 + Table 4:12 变体 Gflops-FID 强负相关;异构同 Gflops 的 S/2 68.40 vs B/4 68.38 相近、缩小 p 单调改善(支撑 CLM-003)。
  • EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。
  • EVI-005 Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。
  • EVI-006 Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。
  • EVI-007 Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。
  • EVI-008 App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-008)。
  • EVI-009 §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。
  • EVI-010 §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。
  • EVI-011 §3.2 + Table 1/4:p 减半时参数量近似不变(S 33M 等)、Gflops ≥4×(S 0.36→1.41→6.06),验证 patchify 标度(支撑 CLM-011/TH-1)。
  • EVI-012 Table 2/3 行内梯度:256 FID 9.62→3.22→2.27、512 12.03→4.64→3.04,档位间改善递减——CFG 效应与饱和(支撑 CLM-012)。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
  • SRC-2606.26017 G2DP:时空占据栅格+路线进度融合为可微 cost volume,去噪末段注入引导,nuPlan 纯模仿 SOTA;本引用簇中心。
  • VER-001 核验 CLM-001 DiT SOTA:Table 2/§5.1/App.A.1 数字(2.27、LDM-4-G 3.60、StyleGAN-XL 2.30)与 v2 源逐项一致,含审计修正史;scope 未超。supported。