Research KB 登录

PPR-2510.11690 Paper

Diffusion Transformers with Representation Autoencoders

id
updated
type paper
title Diffusion Transformers with Representation Autoencoders
authors Boyang Zheng, Nanye Ma, Shengbang Tong, Saining Xie
venue ICLR 2026 (arXiv:2510.11690)
arxiv 2510.11690
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2510.11690v1
source-hash sha256:dbf91c6f67f8f23b6635c63fbc3dc104891b9516f83c98a61345ea2a2eeb5db2
admitted-under A2-direct-edge
admission-note PPR-2605.12964(AsymFlow)直接引用(zheng2025rae),用作其问题构造依据之一:高维表示下 u-prediction 需同时预测高维噪声与结构化数据;本卡为该论断提供库内锚点。

定位

Zheng、Ma、Tong 与 Xie(ICLR 2026)提出 Representation Autoencoders(RAE)。论文的出发点是:潜空间生成建模(用一个预训练自编码器把像素映射到潜空间、再在潜空间上跑扩散)已成为扩散 Transformer(DiT)的标准做法,但自编码器这一组件几乎没有演化——多数 DiT 仍沿用最初的 VAE 编码器,由此带来三重限制:骨干过时(损害架构简洁性)、潜空间维度低(限制信息容量)、表征弱(纯重建训练所得,最终限制生成质量)。作者挑战“预训练表征编码器不适合重建任务(语义强、低层细节弱)”这一常见假设,证明只要配一个训练得当的解码器,冻结的表征编码器可以充当强的扩散潜编码器:RAE 把一个冻结的预训练表征编码器与一个基于 ViT 的解码器配对,重建质量与 SD-VAE 相当甚至更好,同时潜空间语义更丰富、架构可伸缩。

关键难点是这些潜空间维度高,扩散 Transformer 在其中难以有效工作。论文分析了困难的来源并给出对应方案(见方法),并用一个配轻量宽 DDT 头的 DiT 变体验证:ImageNet \(256\times256\) 无引导 FID 1.51\(256\times256\)\(512\times512\) 有引导(AutoGuidance)FID 1.13;相比需要表征对齐辅助损失的路线(如 REPA),该方案不依赖此类辅助损失即可更快收敛。

方法(机制要点)

  • RAE 的构造与解码器训练:给定输入 \(\mathbf{x}\in\mathbb{R}^{3\times H\times W}\) 与冻结的表征编码器 \(E\)(patch 尺寸 \(p_e\)、隐层维度 \(d\)),得 \(N=HW/p_e^2\)\(d\) 维 token;ViT 解码器 \(D\)(patch 尺寸 \(p_d\),默认 \(p_d=p_e\))把它映回像素 \(\mathbf{z}=E(\mathbf{x})\)\(\hat{\mathbf{x}}=D(\mathbf{z})\)。解码器用 L1 重建、LPIPS 感知与对抗损失的组合训练(沿用 VAE 的常见做法)。\(256\times256\) 图像得 256 个 token,与多数 SD-VAE 潜空间的 DiT 序列长度一致;配合 patch size 1 时序列长度为 256,而 DiT 算力主要取决于序列长度,因此相对 VAE 版不增加额外开销。论文选三个不同预训练范式的编码器作代表:DINOv2-B(自监督自蒸馏)、SigLIP-B(语言监督)、MAE-B(掩码自编码器)。
  • 重建质量与编码器/解码器缩放:三个编码器的重建 rFID(在 ImageNet 验证集上算 FID,衡量重建质量)均优于 SD-VAE,其中 MAE-B 最低(0.16);但重建不等于生成质量,经验上 DINOv2 的生成最强,故默认取 DINOv2 为编码器。解码器容量增大持续改善 rFID(DINOv2-B 从 0.58 到 0.49),且小的解码器已优于 SD-VAE 而算力更省(GFLOPs 为 SD-VAE 的约 \(1/14\))。
  • 按 token 维度缩放宽度:高维潜空间需要更大的模型宽度,论文的理论分析给出宽度需与 token 维度匹配;实验中增大宽度降低损失、提升样本质量,而改变深度对过拟合结果影响很小。
  • 维度相关的噪声调度平移:既有工作观察到同一噪声水平下空间分辨率 \(H\times W\) 越大、信息损坏越少,因而需要按分辨率调整噪声调度;论文指出这些结论基于通道数很少(\(C\le 16\))的像素/VAE 输入,而高斯噪声同时施加在空间与通道维,通道数增大时每个 token 的“有效分辨率”也变大。因此把“分辨率相关”推广为维度相关,维度定义为 token 数乘其维度,并据此做噪声调度平移(消融:不加平移 gFID 变差,加平移后为 4.81)。
  • 噪声增强解码:VAE 的潜 token 被编码为连续分布 \(\mathcal{N}(\mu,\sigma^2)\),而 RAE 解码器是在训练集经编码器处理后的离散分布 \(p(\mathbf{z})=\sum_i\delta(\mathbf{x}-\mathbf{z}_i)\) 上训练的;推断时扩散模型生成的潜变量可能含噪或略偏离训练分布,形成分布外挑战。论文仿照归一化流的做法,用加性噪声 \(\mathbf{n}\sim\mathcal{N}(0,\sigma^2)\) 平滑解码器的训练分布(并把 \(\sigma\)\(|\mathcal{N}(0,\tau^2)|\) 采样以引入随机性),提升解码器对更稠密的扩散输出空间的泛化(消融:gFID 4.81→4.28,代价是 rFID 0.49→0.57)。
  • 宽 DDT 头:在标准 DiT 上要求处理高维 RAE 潜空间需要放大整个骨干的宽度,算力增长很快;论文借鉴 DDT,引入一个专用去噪的宽而浅的 transformer 头 \(H\),形式上 \(z_t=M(x_t\mid t,y)\)\(v_t=H(x_t\mid z_t,t)\)\(M\) 为基座、\(H\) 为宽头),在不让 FLOPs 二次增长的前提下等效增大宽度。

实验结果(摘要)

  • 重建(rFID,ImageNet 验证集):DINOv2-B 0.49、SigLIP-B 0.53、MAE-B 0.16,均优于 SD-VAE;解码器容量从 DINOv2-B 到 DINOv2-XL 持续改善,且小解码器已优于 SD-VAE 而算力约为其 \(1/14\)
  • 生成(ImageNet,80 epoch,50 步 Euler 采样):RAE 版 DDT 在 \(256\times256\) 无引导 FID 1.51\(256\times256\)\(512\times512\) 有引导 FID 1.13;DDT-XL(DINOv2-B) 在对比表中 FID 1.13、IS 259.6 等指标居前列。宽度缩放对生成质量影响显著、深度影响很小;噪声调度平移与噪声增强解码均带来可测增益。

与本库的关系

  • 准入身份:A2-direct-edge(被 PPR-2605.12964 直接引用)。
  • 与 DiT/LDM 谱系的衔接:直接改换 LDM 潜空间压缩范式(PPR-2112.10752 / CPT-006)的自编码器组件——用冻结预训练表征编码器 + 训练解码器取代纯重建训练的 VAE,同时消费 DiT 骨干(CPT-001 / PPR-2212.09748)并在其上增加 DDT 宽头。与 REPA(Yu 等 2024)的表征对齐辅助损失路线形成对照:RAE 不依赖此类辅助损失即达到更快收敛。
  • 下游引用:AsymFlow(PPR-2605.12964)引其作为问题构造依据之一——高维表示下 \(\mathbf{u}\)-prediction 需同时预测高维噪声与结构化数据,在骨干内部形成状态污染。

承重关系

  • provenance:v1 tarball sha256 dbf91c6f…a2eeb5db2,缓存 cache/sources/2510.11690/

关联(6)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2605.12964 Asymmetric Flow Models
  • FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-006 Latent Diffusion Model