PPR-006
Paper
Learning Structured Output Representation using Deep Conditional Generative Models
| id | |
|---|---|
| updated | |
| type | paper |
| title | Learning Structured Output Representation using Deep Conditional Generative Models |
| authors | Kihyuk Sohn, Honglak Lee, Xinchen Yan |
| venue | Advances in Neural Information Processing Systems 28 (NIPS 2015) |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | NIPS 2015 (proceedings.neurips.cc); no arXiv version |
| source-hash | sha256:2fd4ebcd13c660db723e69681e6389c66170c05ae05afebd6d5b41112dc817e1 |
| admitted-under | U0-user-directive |
| admission-note | 用户指令性准入(2026-09-10,D18 U0):用户指定『c-VAE(条件 VAE)原论文』按 P2 入库;Tier-1 升级同为用户指令(D18/DA5 要求人工确认)。c-VAE 原论文即本卡(Sohn, Lee & Yan, NIPS 2015)。 |
| local-formalization | ./FRM-006.md |
定位
Sohn、Lee 与 Yan(NIPS 2015)提出 CVAE(条件变分自编码器,CPT-032) 的原始论文。问题设定:监督深度学习能把“多对一”函数逼近得很好,但难以建模结构化输出的复杂分布——需要做概率推断、给出多样预测(“一对多”映射);卷积网络尤其不擅长建模多峰分布。论文把高维输出空间的分布建成以输入观测为条件的生成模型,具体提出 CVAE:一个条件有向图模型,其输入观测调制高斯隐变量的先验,由该隐变量生成输出。模型在随机梯度变分贝叶斯(SGVB) 框架下以最大化条件对数似然的下界训练,推理时可用随机前馈快速预测。此外论文给出两个训练策略——输入噪声注入与多尺度预测目标——以提升结构化预测的鲁棒性,并在 MNIST 玩具实验、Caltech-UCSD Birds 200 与 Labeled Faces in the Wild 子集上验证像素级分割/标注的多样且真实的输出。
方法(机制要点)
- 三个变量与生成过程:输入观测 \(x\)、高斯隐变量 \(z\)、输出 \(y\);生成过程为给定 \(x\) 从条件先验 \(p_\theta(z|x)\) 抽 \(z\),再从 \(p_\theta(y|x,z)\) 生成 \(y\)。隐变量 \(z\) 使模型能建模输出的多模态,从而处理一对多映射。
- CVAE 与下界:条件对数似然 \(\log p_\theta(y|x)\) 不可解,用变分下界(ELBO)替代,在 SGVB 框架内用重参数化技巧与采样估计;CVAE 由多个 MLP 组成——识别网络 \(q_\phi(z|x,y)\)、条件先验网络 \(p_\theta(z|x)\)、生成网络 \(p_\theta(y|x,z)\),架构搭建在基线 CNN 之上,并把 CNN 的初始猜测 \(\hat{y}\) 经循环连接喂入先验网络。
- GSNN(高斯随机神经网络,CPT-033):把 CVAE 的识别网络与先验网络取相等即得 GSNN(其目标只含生成项);进一步给出混合目标 \(L_{\text{hybrid}}=\alpha L_{\text{CVAE}}+(1-\alpha)L_{\text{GSNN}}\),\(\alpha=1\) 退化为 CVAE、\(\alpha=0\) 退化为 GSNN。
- 训练策略:①多尺度预测目标——在 \(1/4\)、\(1/2\)、原尺度上同时预测,做全局到局部、粗到细的像素级预测;②结构化输入噪声——训练时按噪声过程把输入 \(x\) 腐蚀成 \(\tilde{x}\)(分割任务用随机块遮挡噪声)后优化,模拟块遮挡/缺失输入。
- 推理:测试时可做确定性推断(不采样 \(z\),取 \(z^*=\mathbb{E}[z|x]\)),或从先验多次抽 \(z\) 取后验平均。
实验结果(摘要)
- MNIST 玩具:把数字图分四象限,1–3 象限作输入、其余作输出;输出象限越多(一对多映射越强),随机模型(GSNN/CVAE)相对确定性基线 NN 的条件对数似然优势越大(如 3 象限任务 CVAE 相对 NN 的 per-pixel 性能差距显著)。
- CUB-200 / LFW:像素级对象分割与语义标注;基线 CNN 已超过此前的 max-margin Boltzmann machine(MMBM,pixel accuracy 90.42、IoU 75.92),deep CGM 进一步提升;GSNN 在本组模型中最好、加混合目标更好;噪声注入训练再进一步(如某设定下测试像素级误差降 21%,代价是 60% 更多时间)。推理耗时:CNN 2.32 ms/图、deep CGM 3.69 ms/图。
与本库的关系
按用户指令(U0)以 P2 入库(Tier-1)。本卡是 CVAE 的原始出处,与库内既有自动驾驶规划谱系(G2DP 及其引导谱系)无引用边;其隐变量条件生成范式与库内 LDM(PPR-2112.10752)的 VAE 第一阶段(CPT-008)属同一自编码器家族但用途不同(条件结构化输出 vs 潜空间压缩)。形式化骨架见 FRM-006(G1 待签)。
承重关系
- provenance:NIPS 2015 论文 PDF,sha256
2fd4ebcd…12dc817e1,缓存cache/sources/non-arxiv/cvae2015.pdf;无 arXiv 版本。 - 形式化:FRM-006(本文 P2 骨架,G1 待人工签发)。
关联(5)
- PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
- FRM-006 CVAE(Sohn, Lee & Yan, NIPS 2015)的五层重建骨架:作者把结构化输出建模为以输入为条件的隐变量生成模型,用变分下界在 SGVB 框架训练;产出 CVAE、GSNN 与混合目标,并给出多尺度预测与输入噪声注入两种训练策略。P3 投影待用户发起。
- CPT-008 Perceptual autoencoder (first stage)
- CPT-032 conditional variational auto-encoder
- CPT-033 Gaussian stochastic neural network