Research KB

CPT-009 Concept

Cross-attention conditioning

id CPT-009
type concept
name Cross-attention conditioning
aliases cross-attn injection, generic conditioning mechanism, τ-conditioning
defined-by SRC-2112.10752

Definition

LDM 把任意条件模态注入扩散 backbone 的通用 cross-attention 机制:一个 domain-specific encoder τ_θ 把条件 y(文本、类标签、 语义布局、低清图像)投影为 M×d 的 token 序列,充当 attention 的 Key/Value;Query 来自 U-Net 在噪声 latent z_t 上的中间特征 φ_i(z_t)。注意力算子为标准 Attention(Q,K,V)=softmax(QK^T/√d)V, 其中 Q=W_Q·φ_i(z_t)、K=W_K·τ_θ(y)、V=W_V·τ_θ(y),W 为可学习投影。条件 LDM 的损失 L=||ε−ε_θ(z_t,t,τ_θ(y))||² 中 τ_θ 与 ε_θ 联合优化。对密集 image-to-image 任务(SR/inpainting)该机制退化为把 y 与 z_t 通道拼接、τ_θ 取恒等——从而同一套注入方式横跨稀疏(text/class) 与稠密(SR/inp)两类条件。

Disambiguation

  • 与 class-conditional 注入(ADM 的 AdaIN/标签嵌入)的区别:本机制 把条件当作离散 token 序列经 cross-attention 融合,不限于 单一类别,天然支持变长文本;ADM 的 AdaIN 是逐特征层的仿射调制, 面向固定类别标签。
  • 与 CLIP-guidance(CLIP 打分引导)的区别:后者是在推理期用 预训练 CLIP 的特征梯度去"推"生成,不改动 backbone 训练;本机制 是训练期就把 τ_θ 与 ε_θ 联合拟合进 U-Net 的结构性条件通路。
  • CPT-006(LDM)的关系:cross-attention 是 LDM 的"条件接口层", LDM 的 unconditional / text / layout / image-to-image 各形态 共享同一 backbone,仅切换 τ_θ 与注入位置。

引用(2)

  • CPT-006 Latent Diffusion Model
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(2)

  • CPT-008 Perceptual autoencoder (first stage)
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。