CPT-008
Concept
Perceptual autoencoder (first stage)
| id | CPT-008 |
|---|---|
| type | concept |
| name | Perceptual autoencoder (first stage) |
| aliases | perceptual compression model, first-stage autoencoder, f-autoencoder |
| defined-by | SRC-2112.10752 |
Definition
LDM 两阶段框架中的感知压缩段:一个 autoencoder (encoder E + decoder D),把 RGB 图像 x∈R^(H×W×3) 编码为 感知等价(去除高频、人眼不可辨细节)但算力显著更低的 低维表示 z=E(x),其中 encoder 以下采样因子 f 缩小空间维度 (z 形状 H/f × W/f × c)。训练目标为感知损失(LPIPS)+ patch-based 对抗目标(PatchGAN),确保重构落在图像流形上、 避免纯像素损失(L1/L2)导致的模糊。按潜空间正则分为两变体 (CPT-009 关联):KL-reg(类 VAE 轻 KL 罚)与 VQ-reg(量化层被 decoder 吸收,VQGAN 变体)。
Disambiguation
- 与 LDM(CPT-006)的关系:感知 autoencoder 是 LDM 的前半段; LDM 是包含"感知压缩 + 潜空间扩散"的完整框架,autoencoder 只负责压缩/重构,不直接负责生成。
- 与 VQGAN 的区别:本概念允许 KL(连续)或 VQ 两种正则;VQ-reg 变体"可解释为量化被 decoder 吸收的 VQGAN",但 LDM 的 2D-conv 使其可选更低 f、重建更保真(对比见 SRC-2112.10752 firststage 表:LDM f=8 R-FID 1.14 vs DALL·E f=8 32.01)。
- 与像素空间 DDPM(ADM)的对比:ADM 无显式 first-stage(f=1,直接在 像素上去噪),本概念正是 LDM 把 f 提离 1 的核心手段。
引用(3)
- CPT-006 Latent Diffusion Model
- CPT-009 Cross-attention conditioning
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
被引用(2)
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- VER-013 两段分解核验:感知压缩 AE + 潜空间 DM 与 §1/§2.3/§2.4(Eq.4-5)一致,DiT FRM-2212.09748 AX-2 同向互证,scope 未超。supported。