| CPT-001 | Diffusion Transformer (DiT) · [definition] 以标准 vision transformer 为 backbone 的(潜空间)去噪扩散模型: vae 潜表示经 patchify 化为 token 序列 [body] | Concept |
| CPT-002 | adaLN-Zero · [definition] dit block 的条件注入机制(src-2212.09748 §3.2、app. a.5):在 vanilla adaln(cpt-007)基础上,除 [body] | Concept |
| CPT-003 | classifier-free guidance · [definition] 条件采样技术:训练时随机丢弃条件 c(替换为可学习的 null embedding ∅),采样时以 ε̂_θ(x_t, c) = ε_θ(x_t, ∅) [body] | Concept |
| CPT-004 | patchify · [definition] dit 的第一层:将空间表示(noised latent,i×i×c)线性嵌入为长度 t = (i/p)² 的 token 序列,每 token 维度 d [body] | Concept |
| CPT-005 | VAE decoder variants (ft-MSE / ft-EMA) · [definition] dit 实验所用 vae 解码器权重三选一:ldm 原 f8 模型的 original decoder,及其仅微调 decoder 权重的两个变体 ft- [body] | Concept |
| CPT-006 | Latent Diffusion Model · [definition] 在 vae 隐空间(而非像素空间)训练 diffusion 模型的两阶段框架 (canonical 定义源:rombach et al., src-211 [body] | Concept |
| CPT-007 | adaptive layer norm (adaLN) · [definition] dit 四种 conditioning 设计之一(src-2212.09748 §3.2、app. a.5):把标准 transformer block [body] | Concept |
| CPT-008 | Perceptual autoencoder (first stage) · [definition] ldm 两阶段框架中的**感知压缩段**:一个 autoencoder (encoder e + decoder d),把 rgb 图像 x∈r^(h×w [body] | Concept |
| CPT-009 | Cross-attention conditioning · [definition] ldm 把任意条件模态注入扩散 backbone 的**通用 cross-attention 机制**:一个 domain-specific encode [body] | Concept |
第 1 / 1 页