CPT-001
Concept
Diffusion Transformer (DiT)
| id | CPT-001 |
|---|---|
| type | concept |
| name | Diffusion Transformer (DiT) |
| aliases | DiT |
| defined-by | SRC-2212.09748 |
Definition
以标准 Vision Transformer 为 backbone 的(潜空间)去噪扩散模型: VAE 潜表示经 patchify 化为 token 序列,由若干 transformer block 处理条件去噪,线性解码出噪声与协方差预测。区别于 U-Net backbone 的 DDPM(ADM/LDM 系列)。
Disambiguation
- 与 Latent Diffusion Model (CPT-006) 的关系:DiT 是 backbone 维度的 概念,LDM 是训练空间维度的概念;DiT 论文的模型同时是 LDM。
- 与通用词 "diffusion transformer"(任何 transformer 结构的扩散模型, 如 U-ViT、SDiT 等后续变体)区分:本库中 DiT 特指 Peebles & Xie 2022 的架构及其直接谱系。
引用(2)
- CPT-006 Latent Diffusion Model
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(5)
- CPT-002 adaLN-Zero
- CPT-006 Latent Diffusion Model
- CPT-007 adaptive layer norm (adaLN)
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。