Research KB 登录

PPR-2607.02375 Paper

Representation Distribution Matching for One-Step Visual Generation

id
updated
type paper
title Representation Distribution Matching for One-Step Visual Generation
authors Lan Feng, Wuyang Li, Éloi Zablocki, Matthieu Cord, Alexandre Alahi
venue arXiv preprint (ICLR 2026 submission format)
arxiv 2607.02375
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2607.02375v1
source-hash sha256:6da10e12dd48f29b36fc86e746ee504a13c69884a7a7094d51998b540d18c586
admitted-under U0-user-directive
admission-note 用户指令性准入(2026-09-10,D18 U0):用户指定按 P1 入库。主题为一步视觉生成的表征分布匹配(RDM/iRDM),与库内既有自动驾驶规划谱系(G2DP 及其引导谱系)无引用边;用作生成式建模方向的自持来源。

定位

Feng 等(arXiv 2026)为一条既有脉络命名,并对其做设计空间研究。论文把“用冻结预训练编码器匹配生成与真实特征分布来训练一步图像生成器”这一范式命名为 Representation Distribution Matching(RDM,CPT-031——论文原话是“We refer to this paradigm as RDM”,并明言“our contribution is to name it, chart its two design axes, and locate prior methods within them”。因此 RDM 是本文的命名而非本文发明的单篇方法:该范式已有先前实例,论文点名的是 drifting field(Deng 等 2026)与 Fréchet-distance loss(Yang 等 2026),另有同期一支 Sinkhorn flow;更早的谱系可追到 GAN 纲领下的 moment matching networks、adversarial kernels、sliced Wasserstein generators,变化在于特征空间换成了冻结的预训练编码器。RDM 对齐的是输出分布而非逐样本轨迹,因此生成器天然是一步的;同一目标也可用于把少步采样器 post-train 成一步(把其最终输出当作 \(g_\theta\))。论文把 RDM 的两条设计轴切开做受控研究:

  • 比较轴:用哪个 discrepancy 度量特征分布、用什么估计器从有限样本估计它、参考分布取什么、条件生成时匹配哪个联合律;
  • 表征轴:用哪些编码器定义特征空间、多个编码器如何加权。

沿两轴各得出一个机制性结论(见方法/实验)。把各轴的首选组合起来得到改良 RDM(iRDM):在 ImageNet 上把一步生成的 state of the art 推到 SWmetric 1.30,并用与训练目标无共享机制的人偏好代理 PickScore 佐证;同一配方把四步的 FLUX.2 [klein] post-train 成一步模型。

方法(机制要点)

  • 一步生成器 \(g_\theta\) 把先验 \(z\sim p_z\) 经一次求值映射成图像,输出律为 \(p_\theta\);目标为 \(\min_\theta D(\phi_* p_\theta, \phi_* p_{\text{data}})\)\(\phi\) 是冻结编码器、\(\phi_*\) 是 pushforward、\(D\) 是分布距离。
  • 比较轴的选择:平方 MMD + 高斯核(带宽按各编码器中位数启发式固定)。三项拆开估计:数据项与 \(\theta\) 无关丢弃;吸引项用 Nyström 核均值嵌入——在 \(1.28\)M 训练图像特征上以 \(m{=}4096\)\(k\)-means 地标预计算一次并冻结,得零方差参考;排斥项只在 batch 内跑,保留精确 \(B\times B\) 核和。论文论证 Fréchet 距离只压到两个矩、sliced-Wasserstein 只对重采样 batch 打分、drifting field 的小 batch 优势在大 batch 退化为普通 MMD——各自放弃一项优势。
  • batch 大小:数据侧冻结后,生成分布每步都在动、必须每步重采样(用 EMA 队列的陈旧 buffer 会把梯度带偏);\(N\) 因此成为有效变量,大 batch 降方差但同算力下换更少优化步。论文用梯度缓存解除显存限制,取 \(N{=}5120\)(ImageNet)、\(N{=}10240\)(FLUX)。
  • 条件生成:匹配联合图像-文本律——\(\Phi(x,c)=\phi(x)\oplus\tau(c)\)\(\tau\) 为冻结文本编码器),参考对为图像- caption,生成对为输出- 提示;避免只满足图像边际而在提示对齐上漂移。
  • 表征轴:任何单一编码器都可被 game(在图像明显假的情况下把距离压到真实验证分之下);故对一组编码器(14 个)匹配、用约束优化给自适应权重,并用 SWmetric(跨 14 编码器的 sliced-Wasserstein)做与训练损失无关的评估。

实验结果(摘要)

  • ImageNet 一步生成:iRDM 达 SWmetric 1.30(真实数据地板为 1),PickScore 在 71.2% 的配对样本上偏好它胜过此前最好的一步生成器。
  • FLUX.2 [klein] post-training:四步模型转一步后,GenEval 0.826(四步 0.794)、PickScore 22.76(四步 22.58),用时 90 H200 GPU-hours。
  • 单编码器实验:仅匹配 DINOv2 可把距离从 1.81 压到 1.01(接近真实地板 1.00),但图像仍明显假——说明限制在单编码器匹配本身,解法是多样编码器集成而非换更好编码器。

与本库的关系

按用户指令(U0)以 P1 入库;与库内既有自动驾驶规划谱系(G2DP PPR-2606.26017 及其引导谱系)无引用边,不构成其谱系邻居。本卡为 Tier-0(P1 止,不产 Claim/EVI/FRM)。

承重关系

  • provenance:v1 tarball sha256 6da10e12…d18c586,缓存 cache/sources/2607.02375/

关联(5)