Research KB 登录

PPR-006 Paper

Learning Structured Output Representation using Deep Conditional Generative Models

id
updated
type paper
title Learning Structured Output Representation using Deep Conditional Generative Models
authors Kihyuk Sohn, Honglak Lee, Xinchen Yan
venue Advances in Neural Information Processing Systems 28 (NIPS 2015)
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version NIPS 2015 (proceedings.neurips.cc); no arXiv version
source-hash sha256:2fd4ebcd13c660db723e69681e6389c66170c05ae05afebd6d5b41112dc817e1
admitted-under U0-user-directive
admission-note 用户指令性准入(2026-09-10,D18 U0):用户指定『c-VAE(条件 VAE)原论文』按 P2 入库;Tier-1 升级同为用户指令(D18/DA5 要求人工确认)。c-VAE 原论文即本卡(Sohn, Lee & Yan, NIPS 2015)。
local-formalization ./FRM-006.md

定位

Sohn、Lee 与 Yan(NIPS 2015)提出 CVAE(条件变分自编码器,CPT-032 的原始论文。问题设定:监督深度学习能把“多对一”函数逼近得很好,但难以建模结构化输出的复杂分布——需要做概率推断、给出多样预测(“一对多”映射);卷积网络尤其不擅长建模多峰分布。论文把高维输出空间的分布建成以输入观测为条件的生成模型,具体提出 CVAE:一个条件有向图模型,其输入观测调制高斯隐变量的先验,由该隐变量生成输出。模型在随机梯度变分贝叶斯(SGVB) 框架下以最大化条件对数似然的下界训练,推理时可用随机前馈快速预测。此外论文给出两个训练策略——输入噪声注入多尺度预测目标——以提升结构化预测的鲁棒性,并在 MNIST 玩具实验、Caltech-UCSD Birds 200 与 Labeled Faces in the Wild 子集上验证像素级分割/标注的多样且真实的输出。

方法(机制要点)

  • 三个变量与生成过程:输入观测 \(x\)、高斯隐变量 \(z\)、输出 \(y\);生成过程为给定 \(x\)条件先验 \(p_\theta(z|x)\)\(z\),再从 \(p_\theta(y|x,z)\) 生成 \(y\)。隐变量 \(z\) 使模型能建模输出的多模态,从而处理一对多映射。
  • CVAE 与下界:条件对数似然 \(\log p_\theta(y|x)\) 不可解,用变分下界(ELBO)替代,在 SGVB 框架内用重参数化技巧与采样估计;CVAE 由多个 MLP 组成——识别网络 \(q_\phi(z|x,y)\)、条件先验网络 \(p_\theta(z|x)\)、生成网络 \(p_\theta(y|x,z)\),架构搭建在基线 CNN 之上,并把 CNN 的初始猜测 \(\hat{y}\)循环连接喂入先验网络。
  • GSNN(高斯随机神经网络,CPT-033:把 CVAE 的识别网络与先验网络取相等即得 GSNN(其目标只含生成项);进一步给出混合目标 \(L_{\text{hybrid}}=\alpha L_{\text{CVAE}}+(1-\alpha)L_{\text{GSNN}}\)\(\alpha=1\) 退化为 CVAE、\(\alpha=0\) 退化为 GSNN。
  • 训练策略:①多尺度预测目标——在 \(1/4\)\(1/2\)、原尺度上同时预测,做全局到局部、粗到细的像素级预测;②结构化输入噪声——训练时按噪声过程把输入 \(x\) 腐蚀成 \(\tilde{x}\)(分割任务用随机块遮挡噪声)后优化,模拟块遮挡/缺失输入。
  • 推理:测试时可做确定性推断(不采样 \(z\),取 \(z^*=\mathbb{E}[z|x]\)),或从先验多次抽 \(z\) 取后验平均。

实验结果(摘要)

  • MNIST 玩具:把数字图分四象限,1–3 象限作输入、其余作输出;输出象限越多(一对多映射越强),随机模型(GSNN/CVAE)相对确定性基线 NN 的条件对数似然优势越大(如 3 象限任务 CVAE 相对 NN 的 per-pixel 性能差距显著)。
  • CUB-200 / LFW:像素级对象分割与语义标注;基线 CNN 已超过此前的 max-margin Boltzmann machine(MMBM,pixel accuracy 90.42、IoU 75.92),deep CGM 进一步提升;GSNN 在本组模型中最好、加混合目标更好;噪声注入训练再进一步(如某设定下测试像素级误差降 21%,代价是 60% 更多时间)。推理耗时:CNN 2.32 ms/图、deep CGM 3.69 ms/图。

与本库的关系

按用户指令(U0)以 P2 入库(Tier-1)。本卡是 CVAE 的原始出处,与库内既有自动驾驶规划谱系(G2DP 及其引导谱系)无引用边;其隐变量条件生成范式与库内 LDM(PPR-2112.10752)的 VAE 第一阶段(CPT-008)属同一自编码器家族但用途不同(条件结构化输出 vs 潜空间压缩)。形式化骨架见 FRM-006(G1 待签)。

承重关系

  • provenance:NIPS 2015 论文 PDF,sha256 2fd4ebcd…12dc817e1,缓存 cache/sources/non-arxiv/cvae2015.pdf;无 arXiv 版本。
  • 形式化:FRM-006(本文 P2 骨架,G1 待人工签发)。

关联(5)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-006 CVAE(Sohn, Lee & Yan, NIPS 2015)的五层重建骨架:作者把结构化输出建模为以输入为条件的隐变量生成模型,用变分下界在 SGVB 框架训练;产出 CVAE、GSNN 与混合目标,并给出多尺度预测与输入噪声注入两种训练策略。P3 投影待用户发起。
  • CPT-008 Perceptual autoencoder (first stage)
  • CPT-032 conditional variational auto-encoder
  • CPT-033 Gaussian stochastic neural network