Research KB

CLM-017 Claim

LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。

id CLM-017
type claim
source SRC-2112.10752
scope UNet + cross-attention 注入; 条件 y ∈ {文本(BERT tokenizer, τ 为 transformer), 类标签(AdaIN/CA), 语义布局, 低清图像(concat)}; LAION-400M 1.45B / OpenImages / COCO / ImageNet; f=4..8
epistemic supported
lifecycle RECONCILED
created 2026-09-03
updated 2026-09-03

Proposition

LDM 给 U-Net backbone 加装一个通用 cross-attention 条件机制:一个 domain-specific encoder τ_θ 把任意条件 y(文本、类标签、语义布局、低清图像)投影为 token,作为 cross-attention 的 Key/Value;Query 来自 UNet 在噪声 latent z_t 上的中间特征 φ_i(z_t)。同一套注意力形式 Attention(Q,K,V)=softmax(QK^T/√d)V 即可挂接多种模态;对密集 image-to-image 任务(SR/inpainting)则退化为把条件与输入拼接。它把一个 backbone 变成可承载文本/类别/布局/图像条件的多模态生成器,无需为每个任务改结构。

Evidence refs

Notes

公式(§2.5):Q=W_Q·φ_i(z_t),K=W_K·τ_θ(y),V=W_V·τ_θ(y);条件损失 L_simpleLCM=||ε−ε_θ(z_t,t,τ_θ(y))||² 中 τ_θ 与 ε_θ 联合优化。"flexible as τ_θ can be parameterized with domain-specific experts, e.g. (unmasked) transformers when y are text prompts"。layout-to-image 在 OpenImages 训、COCO 微调(补充 Sec. bboxtoimage)。

引用(2)

  • EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(3)

  • EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-017 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。