CPT-009
Concept
Cross-attention conditioning
| id | CPT-009 |
|---|---|
| type | concept |
| name | Cross-attention conditioning |
| aliases | cross-attn injection, generic conditioning mechanism, τ-conditioning |
| defined-by | SRC-2112.10752 |
Definition
LDM 把任意条件模态注入扩散 backbone 的通用 cross-attention 机制:一个 domain-specific encoder τ_θ 把条件 y(文本、类标签、 语义布局、低清图像)投影为 M×d 的 token 序列,充当 attention 的 Key/Value;Query 来自 U-Net 在噪声 latent z_t 上的中间特征 φ_i(z_t)。注意力算子为标准 Attention(Q,K,V)=softmax(QK^T/√d)V, 其中 Q=W_Q·φ_i(z_t)、K=W_K·τ_θ(y)、V=W_V·τ_θ(y),W 为可学习投影。条件 LDM 的损失 L=||ε−ε_θ(z_t,t,τ_θ(y))||² 中 τ_θ 与 ε_θ 联合优化。对密集 image-to-image 任务(SR/inpainting)该机制退化为把 y 与 z_t 通道拼接、τ_θ 取恒等——从而同一套注入方式横跨稀疏(text/class) 与稠密(SR/inp)两类条件。
Disambiguation
- 与 class-conditional 注入(ADM 的 AdaIN/标签嵌入)的区别:本机制 把条件当作离散 token 序列经 cross-attention 融合,不限于 单一类别,天然支持变长文本;ADM 的 AdaIN 是逐特征层的仿射调制, 面向固定类别标签。
- 与 CLIP-guidance(CLIP 打分引导)的区别:后者是在推理期用 预训练 CLIP 的特征梯度去"推"生成,不改动 backbone 训练;本机制 是训练期就把 τ_θ 与 ε_θ 联合拟合进 U-Net 的结构性条件通路。
- 与 CPT-006(LDM)的关系:cross-attention 是 LDM 的"条件接口层", LDM 的 unconditional / text / layout / image-to-image 各形态 共享同一 backbone,仅切换 τ_θ 与注入位置。
引用(2)
- CPT-006 Latent Diffusion Model
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
被引用(2)
- CPT-008 Perceptual autoencoder (first stage)
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。