Research KB

FRM-2112.10752 Formalization

LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。

id FRM-2112.10752
type formalization
source SRC-2112.10752
updated 2026-09-03

0. Overview

本文件是 SRC-2112.10752(Rombach 等,Latent Diffusion Models,CVPR 2022) 的作者逻辑五层重建。论文的核心行动:把高分辨率图像合成显式拆成 感知压缩(autoencoder)+ 语义生成(latent 空间扩散模型) 两段,用一次 AE 训练换取对像素空间 DM 的训练/采样成本的大幅 下降与质量的不降反升。 边界:256²/512²(卷积推广至 ~1024²/兆像素); ImageNet(class-cond) / CelebA-HQ / FFHQ / LSUN(uncond) / LAION-400M(text) / MS-COCO(text,layout) / Places(inpainting) / ImageNet(SR); 下采样因子 f=4..8 为主(消融 f=1..32); 模型规模 169M–1.45B。 核心问题:在预训练 AE 的 latent 空间(而非像素空间)训练 DM, 是否是复杂度降低与细节保留的近最优分解, 并能在该分解上统一挂接多种条件模态。 (本文件与 FRM-2212.09748 互为上下游:DiT 沿用本源 first-stage 的 f=8 VAE,仅替换 backbone。)

1. Definitions

  • LDM(Latent Diffusion Model)CPT-006(两阶段框架: 感知压缩 AE + latent 空间 DM;canonical 定义源已入库)
  • 感知 autoencoder(first stage)CPT-008(downsampling 因子 f;KL/VQ 两变体;LPIPS+PatchGAN 目标)
  • cross-attention 条件CPT-009(通用注入:Q 来自 latent φ_i(z_t),K/V 来自 τ_θ(y);SR/inp 退化为拼接)
  • classifier-free guidanceCPT-003(推理期外推;scale s)
  • f(downsampling 因子):AE 的空间下采样倍数;latent 形状 H/f × W/f × c(256² 下 f=8 → 32×32×4,即 DiT 所用 SD f8 VAE)
  • KL-reg / VQ-reg:first-stage 的两种潜空间正则 (KL=类 VAE 轻罚;VQ=量化层被 decoder 吸收的 VQGAN 变体)
  • ε-prediction / reweighted 目标:DM 以 L_simple(及其 latent 形式 L_LDM)为训练目标,t 均匀采样
  • τ_θ(domain encoder):把条件 y 映射为 token 序列的 专用网络(文本用 transformer;类用 AdaIN/CA;SR/inp 为恒等)
  • DDIM / DDPM 采样:推理期的(加速)采样策略与步数
  • FID / IS / Precision / Recall / PSNR / SSIM / LPIPS: 质量、覆盖、重建度量(口径见 AX-3)

2. Axioms

作者公理:论文接受而未证明、且所有后续命题依赖其成立的前提。

  • AX-1(Diffusion 形式化):DM 为重加权变分下界的 ε-prediction 形式,目标 L_simple=E[‖ε−ε_θ(x_t,t)‖²]、 t 从 {1..T} 均匀采样;forward 过程固定(长度为 T 的 Markov 链,等价于等权去噪 autoencoder 序列)。 latent 版把 x_t 替换为 z_t(L_LDM),条件版引入 τ_θ(y)(L_LCM)。
  • AX-2(表示空间):一个预训练的感知 autoencoder (CPT-008)提供与像素感知等价、但维度更低(H/f×W/f×c) 的 latent 空间;DM 只在 z 空间运行, encoder E 在 DM 训练期间冻结,采样后由 decoder D 单次解码回像素。该空间的选取(f、KL/VQ)是两阶段分解 的核心自由度。
  • AX-3(度量协议):质量用 FID(↓),覆盖用 Precision/Recall(↑),辅助用 IS(↑);重建/first-stage 用 R-FID/PSNR/SSIM/LPIPS;评测在固定数据集与分辨率上进行 (见 AX-4),DM 采样步数(如 250/100 DDIM 步)与 guidance 口径在各表中显式标注;与基线的对比遵循同表、 同评测套件的同口径原则。
  • AX-4(基准设定):评测设定为多任务、多数据集、 256²/512²(及卷积推广的 >256²): ImageNet class-conditional;CelebA-HQ/FFHQ/LSUN 无条件; LAION-400M 训练 + MS-COCO 评测的 text-to-image; OpenImages/COCO 的 layout;ImageNet 4× 的 SR; Places 的 inpainting。 first-stage 消融以固定算力(单 A100、等参数量 ~391–396M、 2M steps)扫 f∈{1,2,4,8,16,32}。
  • AX-5(训练配方):DM 采用时条件 U-Net backbone, first-stage 采用 conv autoencoder; 条件注入依任务而定(文本 τ_θ=transformer+BERT tokenizer; 类=AdaIN/CA;layout=语义图;SR/inp=输入通道拼接且 τ_θ≡id)。 具体优化器/学习率/批大小/EMA/增广在各实验的 implementation 细节中给定(见补充),跨任务保持 “同一 backbone 家族 + 仅切换 τ_θ/注入位置”的约定。
  • AX-6(CFG 可用性):classifier-free guidance (CPT-003)可在推理期施加, 通过对条件/无条件预测的外推(scale s)提升样张保真; s=1 退化为标准条件采样。该机制的“可用性”(可注入、 可调 scale)是后文所有带 -G 结果的口径前提。
  • AX-7(分析约定):算力口径 = 训练以 V100-days 计、 推理以 samples/s(单 A100 吞吐)计; “matched 参数量” 为名义对齐(~391–396M / ~215M / ~400M / 1.45B 各档), 不同 f/规模的实际通道与层深配置不同; 相对倍数(如 3.4×/3.3×)由对应表的行内数值之比导出, 随所选口径(步数/cfg/batch)变动而浮动,非普适常数。

3. Theorems

作者可推导命题(从定义 + 公理推出,非实证观察)。本层刻意保持 单薄——实证论文的可推导内容本就有限,不为结构完整而虚构定理 (元方法 failure mode 1/2)。

  • TH-1(两阶段分离 / 潜维–算力权衡)CLM-014(兼涉 CLM-013/015)。推导链:感知 autoencoder(CPT-008)在 downsampling 因子 f 下把像素 (H,W,3) 映为 latent (H/f, W/f, c),DM(时条件 U-Net,AX-1/AX-2)作用在 z_t 上,单次前向算力随 latent 空间维度 (H/f)²·c 增大而增大 ⇒ f 增大 ⇒ 潜空间空间维度下降 ⇒ 每步去噪的前向成本 单调下降(纯结构尺度律,不涉 FID);再结合 cross-attention 条件(CPT-009)只是往 U-Net 注入 K/V token,不改变 (H/f)²·c 的量纲 ⇒ 该分离对“任意可注入条件模态”都保持同样的 算力缩减结论。据此,把感知压缩从 DM(f=1 像素, 全部压在去噪上)剥离到一个专用 first stage(f>1, latent)在结构上必然降低每步成本; “质量不降/反升”与“可自由选 f”的经验含量分别归 Evidence(EVI-013/014/015)与 TH-2,本层只保结构推导。
  • TH-2(2D-conv 的温和扩展 / 相对 1D-AR 的归纳偏置)CLM-015 (兼涉 CLM-016)。推导链:first-stage 与 DM backbone 均为 2D 卷积(CPT-008;AX-2),卷积核在空间网格上平移共享 ⇒ 对空间结构数据具有天然的平变/局部归纳偏置 ⇒ 相比需要把 z 拉成 1D token 序列做自回归的方案, 2D-conv 不必承担“1D 展平丢失 2D 邻接”的代价, 因此在 latent 维度较高(f 较低)时仍能温和扩展而不过度损失 结构信息(这是设计层面的归纳偏置论证, 非闭式界);其在重建表上的经验佐证(同低 f 下 R-FID 明显更优)归 EVI-015,f 甜区的具体落点(f=4/8)的经验边界归 CLM-016/EVI-016。两定理共同支撑 Overview 的核心问题之 结构性半边(可降成本、可温和扩展),经验半边(降多少、 质量如何、f 甜区在哪)全部下沉至 Evidence 层。

4. Evidence

实证观察 → 卡片映射(只引用,不复述命题与数值;数字见各 EVI)。

  • EV-1 CLM-013 / EVI-013 — §1 + §2.3 + §2.4(Eq. dmloss/ldmloss): 两阶段分解(感知压缩 AE + 潜空间 DM)=核心机制
  • EV-2 CLM-014 / EVI-014 — Tab.13(compute_vs_fid)+ 主 ImageNet 256² 表:潜空间化压低训练/推理算力且质量不降 (3.4× 更少 V100-day、3.3× 更快采样、更低 FID)
  • EV-3 CLM-015 / EVI-015 — Tab.423(firststage 重建): 2D-conv 容忍更低压缩 f、重建更保真(对比 VQGAN/DALL·E)
  • EV-4 CLM-016 / EVI-016 — §4.1 + Fig. cin_traincourse/speedplot
    • Tab. cin_hyperparams:downsampling 甜区 f=4/8 (f=1/2 慢、f=16/32 损;LDM-1 vs LDM-8 的 FID gap 38 @2M)
  • EV-5 CLM-017 / EVI-017 — §2.5(Eq. cond_loss + Fig. conditioning)+ §4.3–4.5:通用 cross-attention 条件 (text/class/layout/image-to-image)
  • EV-6 CLM-018 / EVI-018 — T2I 表 + class-cond ImageNet 表 + Changelog:CFG 推理期大幅提质 (T2I FID 23.35→12.61;ImageNet 10.56→3.60)
  • EV-7 CLM-019 / EVI-019 — T2I 表(MS-COCO 250 步):1.45B text-to-image 与近期 AR/diffusion SOTA 同量级、参数远少 (12.61)
  • EV-8 CLM-020 / EVI-020 — 无条件表(256², FID+P/R): SOTA(CelebA-HQ 5.11)+ mode-covering 对 GAN 的 P/R 优势
  • EV-9 CLM-021 / EVI-021 — §4.3.2 + Fig. thicksample/ text2img_conv:密集条件 i2i 经卷积滑窗越过训练分辨率 生成 ~1024²/兆像素大图
  • EV-10 CLM-022 / EVI-022 — §4.4/§4.5 + Tab. srtable/inpaintingefficiency/inpaintingtable/ user_study:SR(FID 胜 SR3、用户 70.6%)+ Inpainting (2.7× 提速、1.6× FID、胜 LaMa、更大模型刷新 SOTA)
  • EV-11 CLM-023 / EVI-023 — §10 + Fig. firststagecomparison:局限(f=4 AE 非逐像素精确成为 pixel-precision 上限、SR 已受限;顺序采样慢于 GAN)

5. Argument

论证结构:推理关系(claim 之间、claim 与公理之间)。

  • AR-1CLM-013(两阶段分解)是整个框架的设计前提—— CLM-014(降算力)、CLM-015(温和扩展)、CLM-016(甜区)都以 “感知压缩/语义压缩可分离且分离有利”为前提成立; TH-1(结构上分离必降每步成本)进一步说明该前提不是经验 偶然而是结构必然,从而 CLM-013 获得超越单点消融的论证地位。
  • AR-2CLM-014CLM-015 构成算力两轴互补——前者论证 “移到 latent 空间降训练+推理成本”(绝对成本轴), 后者论证“2D-conv 允许选更低 f 仍保持高保真”(成本–质量 权衡轴);两者合取支撑 Overview 的总论题 “LDM 是复杂度降低与细节保留的近最优分解”, 且 TH-1/TH-2 分别是这两轴的结构性内核。
  • AR-3CLM-014 的“3.4×/3.3× 且 FID 更优”是三重口径条件命题—— 度量(FID/IS + samples/s,PSNR/SSIM 属另一轴见 CLM-022)、 算力(V100-days 与 samples/s 分别对应训练/推理, AX-7 强调倍数随行内口径浮动)、模型(LDM-4 400M vs ADM 554M、 250 步;注意 271 V100-day 行为 cfg=1.25/178K/batch1200,与主表 cfg=1.5 FID 3.60 不同配置不可混读)。故“更高效且更优” 只在同时固定这三口径时成立,否则结论弱化。
  • AR-4CLM-016(f 甜区)是 CLM-013/014/015 的经验有效域界定—— 分离论点(降成本、温和扩展)在甜 f 实现最优, 而 f=1(退化为像素 DM)、f=32(过度压缩信息损) 正是论点失效边界;FID gap 38(LDM-1 vs LDM-8) 则量化了“正确选 f”的回报。因此甜区把 “结构性可”(TH-1/2)落到“经验上何时最好”, 是论证从设计走向实证的关键枢纽。
  • AR-5CLM-017(cross-attn 条件)与 CLM-018(CFG) 是正交可叠加的条件控制双轴——前者决定“能注入何种 条件模态”(横向广度,CPT-009),后者决定“推理期多强地跟随 条件”(纵向力度,CPT-003);二者正交(一个改结构注入、 一个改采样外推)且可叠加, CLM-019 的 text-to-image SOTA 级结果正是 “cross-attn 注入文本条件 + CFG 放大”两轴合力的产物—— 单轴(仅注入无 guidance)只到 unguided 水平, 加上 CFG 才跃到同量级。
  • AR-6CLM-023(局限)是全论题的自我设限子句—— 承认 LDM 上限受 first-stage AE 钳制(f=4 非逐像素精确、 SR 已被其限制)且顺序采样仍慢于 GAN; 它给 CLM-013–022 的所有正面结论统一附加了 “在 AE 重建保真范围内 / 迭代采样范式下”的隐含条件, 防止把“相对像素 DM 的大幅改善”外推成“绝对最优/万能”。 故 CLM-023CLM-014(效率优势)构成一正一反的边界对: 前者说“省多少”,后者说“省到何种程度仍不牺牲质量”。

6. Commentary

作者评论(论文自身的判断与留白)

  • 自评两阶段分离是“complexity reduction 与 detail preservation 之间的 near-optimal 点”(abstract/贡献), 并强调相对 joint-learning(Roth 等)“无需在重构与生成间做 delicate weighting”(贡献 iii)。
  • 对 f 甜区的表述:LDM-4/8“offer the best conditions”, 过低的 f(1/2)“leave most perceptual compression to the diffusion model”,过高的 f(16/32)“too strong first stage compression … information loss”(§4.1)。
  • 坦承局限(§10):顺序采样“still slower than GANs”; f=4 AE 的重建“very small loss”但对“high precision”任务 “can become a bottleneck”,并明言“we assume that our superresolution models … are already somewhat limited” ——以 assume 措辞,属推断而非专设对照实验。
  • 社会影响段的留白:两阶段(对抗 + likelihood)组合 “misrepresent the data to what extent”(对人口/长尾的 扭曲、mode-covering 是否全覆盖)“remains an important research question”——作者自己亦未闭环。
  • 展望(结论/§1):LDM 可作 Stable Diffusion/DALL·E 2 的 drop-in、可扩到视频、可复用同一 first-stage 探索大量 image-to-image/text-to-image 任务、“democratizing high-resolution image synthesis”(降门槛/碳足迹)—— 均为前瞻性判断,未在本文验证。

本库评论(我们的 caveat,与作者评论分节)

  • “3.4×/3.3×”与两处 LDM-4-G 配置不可混读:算力表 271 V100-day 行是 cfg=1.25/178K/batch1200(对应 FID 3.95);主表 SOTA 行是 cfg=1.5 (对应 FID 3.60)。倍数 = 916/271、0.4/0.12,随步数/cfg/batch 口径浮动,不是普适常数;引用时须连同其口径一起带出。
  • “on par with GLIDE/Make-A-Scene”是同量级而非严格最低: LDM-KL-8-G 的 FID 12.61 高于 Make-A-Scene 11.84 与 GLIDE 12.24 (差 0.37–0.77)。论文措辞是 “on par”(相当)而非 “new SOTA”,且 MS-COCO 5K-prompt + FID 单一指标主导排序(IS 26.62 虽高,但 FID 不是最低);若改口径(更多 prompt/更长 训练)此“同量级”关系可能变动。
  • SOTA 措辞严格限 CelebA-HQ:5.11 低于全表所列 GAN 与 likelihood 基线,故仅在 CelebA-HQ 上是 SOTA。FFHQ(LDM 4.98 高于 ProjectedGAN 3.08)、LSUN-Bedrooms(LDM 2.95 高于 ADM 1.90/ProjectedGAN 1.52)上 LDM 均非 FID 最低; Bedrooms 的“close to ADM”是差 1.05 的相对表述。
  • “优于 GAN in Precision/Recall”是逐数据集且对 ADM 不占优: FFHQ(0.73/0.50)、LSUN-Bedrooms(0.66/0.48)的 P/R 确实 ≥ 对应 GAN;但 Bedrooms 的 Recall 0.48 低于 ADM 0.51。ADM 是 likelihood-based 而非 GAN,故“优于 GAN”的字面论断不被 ADM 推翻;但若把 ADM 一并计入“likelihood 对手集合”来衡量 “mode-covering 优势”,则 LDM 的 Recall 并不占优—— 该优势的实际强度弱于字面。
  • mode-covering 是指标层倾向而非量化证明:论文把 “LDM 对 GAN 的 P/R 系统性更优”解读为 likelihood 目标 mode-covering 的证据;但“是否真正覆盖长尾/罕见样本” 并无专门的量化检验(如 rare-class recall、 coverage@k 等),作者在社会影响段也自认这是 open question。故“mode-covering 优势”应理解为在 Precision/Recall 这两个指标上的相对表现,而非对 分布覆盖完备性的证明。
  • 消融/对比无方差、单种子:各对比表未报告方差/置信区间, FID 单次值、IS 虽有 ±std 但仍属单种子评测(论文未报告 seed 数);FID 对样本数与实现敏感,跨表/跨论文的 FID 直接 比较需谨慎。
  • inpainting“LPIPS 略劣而 FID 更优”是不同维度:LaMa 赢在 单张 LPIPS(更贴近原图均值),LDM 赢在分布级 FID 与多样 性;两者排序不一致是度量维度差异(单样本感知距离 vs 分布匹配),不应据此一方压倒另一方。
  • “2.7×/1.6×”“70.6%/30.4%/21.0%”是中位读数:inpainting 的 提速/FID 倍数与 SR/inpainting 的用户偏好百分比是 215M/387M 对齐、6 epochs(或相应预算)下的读数, 随分辨率(256²/512²)、KL/VQ 配置、样本量/评测人而异; SR 的 PSNR/SSIM 由回归基线占先亦是指标特性(偏好“模糊 但对齐”)。
  • 结论“AE-相对”而非绝对上限:因 LDM 的质量上限被 first-stage AE 钳制(CLM-023),Sweet-spot(CLM-016)与 各类 SOTA(CLM-019/020/022)都是在当前 AE 配置下的相对 最优;若换用更强的 AE(更高保真、不同 f), 甜区落点与 SOTA 边界都可能平移。故引用这些结论 时应带上“在所述 AE/first-stage 设定下”的前提, 避免外推为绝对性能上限。
  • 与 DiT(FRM-2212.09748)的跨来源关系(本库观察):DiT 直接沿用本源的 f=8 VAE(32×32×4)作 first-stage、仅替换 U-Net→ViT,故本 FRM 的 AX-2(表示空间)/CPT-008(first stage)是 FRM-2212.09748 之 AX-2(“冻结 SD f8 VAE”)的上游出处; 两源可互证“latent 空间来源”“f=8 编码器”这类 claim。 此为库内溯源观察,非本源论文的自述。

7. Traceability

source 陈述 → 各层元素映射:

论文位置 层元素
Abstract(near-optimal 自评) CLM-013/014/015、EV-1/2/3、Commentary-作者
§1(perceptual/semantic 两段、democratize) CLM-013、EV-1、CPT-006/008、Commentary-作者
§1(贡献 i–vi) CLM-014/015/016/017/019、EV-2/3/4/5/7、Commentary-作者
§2.1(DM 形式化,Eq. dmloss) AX-1、CPT-006
§2.3(Perceptual Image Compression,f、KL/VQ) CPT-008、AX-2、CLM-013/015、EV-1/3
§2.4(LDM,Eq. ldmloss、U-Net) AX-1/2、CPT-006、TH-1、CLM-013/014、EV-1/2
§2.5(Conditioning,Eq. cond_loss、Fig. conditioning) CPT-009、AX-1/5、CLM-017、EV-5、TH-1
§4.1(Perceptual Compression Tradeoffs,Fig. cin_traincourse/speedplot,Tab. cin_hyperparams) CLM-016、EV-4、AX-4/7、TH-1
§4.2(无条件,Tab. fids/fidsnew) CLM-020、EV-8、AX-3/4
§4.3(Conditional:text/layout/class,Tab. txt2img,Fig. text2img) CLM-018/019、EV-6/7、AX-3/4/5、CPT-003/009
§4.3.2(Conv Beyond 256²,Fig. thicksample/text2img_conv) CLM-021、EV-9、CPT-009、TH-1
§4.4(SR,Tab. srtable,Fig. srimagenet,user study) CLM-022、EV-10/11、AX-3/4、CPT-008/009、Commentary
§4.5(Inpainting,Tab. inpaintingefficiency/inpaintingtable,user study) CLM-022、EV-10、AX-3/4、Commentary
§10(Limitations & Societal Impact,Fig. firststagecomparison) CLM-023、EV-11、CPT-008、Commentary-作者+本库
Tab.13(compute_vs_fid) EV-2、AX-7、CLM-014
Tab.423(firststage 重建) EV-3、CPT-008CLM-015、AX-3
Tab. cin_hyperparams EV-4、AX-4/7、CLM-016
Tab. fids/fidsnew EV-8、CLM-020、AX-3
Tab. txt2img EV-6/7、CLM-018/019、AX-3/4、CPT-003/009
Tab. srtable / inpaintingefficiency / inpaintingtable / user_study EV-10/11、CLM-022/023、AX-3、Commentary
Fig. conditioning CPT-009、EV-5
Fig. cin_traincourse / speedplot EV-4、CLM-016、TH-1
Fig. thicksample / text2img_conv EV-9、CLM-021
Fig. firststagecomparison EV-11、CPT-008CLM-015/023、Commentary

引用(27)

  • CLM-013 LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。
  • CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。
  • CLM-015 LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。
  • CLM-016 f 消融中 f=4/8 平衡训练进度与渐近质量;f=1/2 太慢、f=16/32 过早停滞(LDM-1 与 LDM-8 差距 38 FID)。
  • CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
  • CLM-018 推理期 CFG 大幅抬升 LDM 质量且几乎不加训练成本:LDM-KL-8 在 MS-COCO FID 23.35→12.61(s=1.5)。
  • CLM-019 1.45B KL-LDM + cross-attn 文本条件在 MS-COCO 达与 Make-A-Scene/GLIDE 相当量级且参数量显著更少。
  • CLM-020 无条件合成 SOTA:LDM 在 CelebA-HQ 256² FID 5.11,并在 FFHQ/LSUN 上与最强 GAN/扩散竞争。
  • CLM-021 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
  • CLM-022 image-to-image 高质高效:LDM-SR 在 ImageNet 4× 超分 256² FID 优于 SR3;inpainting 亦优于现有方法。
  • CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。
  • CPT-003 classifier-free guidance
  • CPT-006 Latent Diffusion Model
  • CPT-008 Perceptual autoencoder (first stage)
  • CPT-009 Cross-attention conditioning
  • EVI-013 §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-019)。
  • EVI-020 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。