VER-017
Verification
条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。
| id | VER-017 |
|---|---|
| type | verification |
| claim | CLM-017 |
| result | supported |
| basis | §2.5 条件机制公式(Q/K/V 投影, τ_θ, Eq. cond_loss)+ Fig. conditioning 与命题一致;text/class/layout/i2i 在 §4.3-4.5 均有实例;与 DiT 的 adaLN(CPT-002)是不同注入机制、不冲突 |
| checked | 2026-09-03 |
Checks
- 内部一致性:命题对 cross-attention 机制的描述(Q 来自 UNet 中间 特征 φ_i(z_t),K/V 来自 τ_θ(y),Attention=softmax(QK^T/√d)V,密集 i2i 退化为拼接)与 EVI-017 Result / §2.5 公式逐项一致。
- 证据链完整性:EVI-017 observation 精确到 §2.5 + Eq. cond_loss + Fig. conditioning + §4.3–4.5;method 载明四种条件形态(text 用 BERT+transformer、class 用 AdaIN/CA、layout 用语义图、SR/inp 用拼接+ τ≡id)与联合优化(τ_θ 与 ε_θ)。
- scope 匹配:命题限定"注入机制的通用性"(同一注意力形式横跨 稀疏/稠密条件)——未把"跨模态无需任务架构"升级为"任意条件零成本"; τ_θ 需 per-domain 设计的边界在 EVI-017 Caveats 声明。
- 跨来源核对:DiT 用 adaLN-Zero(CPT-002,逐层仿射调制)做 class-conditional 注入,与 LDM 的 cross-attention 是不同注入机制—— 不构成冲突(DiT 替换 backbone 而非条件机制);CFG 规范源 (SRC-2207.12598)为源桩,无 claim 可比。
Notes
"通用"限于注意力机制层的通用(K/V 来源可换),非"一个 τ_θ 通吃所有 模态"。DiT 侧复用本源 latent 空间但换用 adaLN 做类条件——说明 cross-attention 是 LDM 的可选条件接口,不是 latent diffusion 的必要 条件,这与 CLM-017 的表述("给 U-Net 加装")一致,无过度声明。
引用(4)
- CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
- CPT-002 adaLN-Zero
- EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
- SRC-2207.12598 Classifier-Free Guidance 提出作(Ho, arXiv 2022);条件扩散的标准引导做法。