| CLM-001 | DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。 · [proposition] 在 class-conditional imagenet 256×256 生成基准上,dit-xl/2 配合 classifier-free guida [body] | Claim reconciled supported src-2212.09748 |
| CLM-002 | 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。 · [proposition] 在 dit-xl/2 配置与 400k 步训练预算下(imagenet 256×256),adaln-zero block 的 fid-50k 为四种 [body] | Claim reconciled supported src-2212.09748 |
| CLM-003 | 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。 · [proposition] 模型前向 gflops(而非参数量)是 dit 生成质量的主要决定因素: gflops 相近的不同配置取得相近的 fid(如 dit-s/2 ≈ dit [body] | Claim reconciled supported src-2212.09748 |
| CLM-004 | DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。 · [proposition] 在 class-conditional imagenet 512×512 生成基准上,dit-xl/2 配合 classifier-free guida [body] | Claim reconciled supported src-2212.09748 |
| CLM-005 | 采样算力不能补偿模型算力:DiT-L/2 多步(1000 步、80.7 Tflops、FID-10K 25.9)仍劣于 XL/2 低步(128 步、15.2 Tflops、23.7)。 · [proposition] 在 dit 模型族内(400k 训练步),扩大采样算力不能补偿模型算力的 不足:小模型即使以更多采样步、乃至更高的单图采样算力生成, fid-10k 仍 [body] | Claim reconciled supported src-2212.09748 |
| CLM-006 | 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。 · [proposition] 在等量总训练算力约束下,更大的 dit 模型更 compute-efficient:小 模型即使训练更久,最终相对"更少步数的大模型"仍是算力低效的;且 [body] | Claim reconciled supported src-2212.09748 |
| CLM-007 | VAE decoder(original/ft-MSE/ft-EMA)可免重训互换,FID 2.46/2.30/2.27,差异有限且均优于此前 diffusion。 · [proposition] vae decoder 可以在不重训 diffusion 模型的前提下互换(三者 encoder 相同):ldm original / ft-mse / [body] | Claim reconciled supported src-2212.09748 |
| CLM-008 | 3 通道子集 guidance(DiT 实际做法)经 scale 换算后与全 4 通道效果近似:3ch (1+x) ≈ 4ch (1+¾x)。 · [proposition] 对 4 通道 latent 仅施加前 3 通道的 guidance(dit 论文全部 guidance 实验的实际做法)与全 4 通道 guidance [body] | Claim reconciled supported src-2212.09748 |
| CLM-009 | U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone 并取得更优质量。 · [proposition] u-net 的归纳偏置对 diffusion 模型的性能不是关键:标准 vit 架构 (沿用 vit 惯例、不含卷积 u-net 组件)可在 laten [body] | Claim reconciled partially-supported src-2212.09748 |
| CLM-010 | DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。 · [proposition] dit 在未调参的 adm 配方下即可稳定训练到高性能:恒定学习率 1e-4、 无 weight decay、无 warmup、无正则化,所有模型配置( [body] | Claim reconciled supported src-2212.09748 |
| CLM-011 | patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。 · [proposition] patchify 的结构性标度:patch size p 减半使 token 数 t=(i/p)² 增至 四倍、transformer gflops 至 [body] | Claim reconciled supported src-2212.09748 |
| CLM-012 | CFG 大幅改善 DiT-XL/2:256 上 FID 9.62→3.22→2.27(无/1.25/1.50),512 上 12.03→4.64→3.04。 · [proposition] classifier-free guidance 大幅改善 dit-xl/2 的 fid-50k: 256 上无 guidance 9.62 → cfg [body] | Claim reconciled supported src-2212.09748 |
| CLM-013 | LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。 · [proposition] ldm 把高分辨率图像合成分解为两段:(1) **感知压缩**段——用一个 autoencoder (lpips 感知损失 + patch-based [body] | Claim reconciled supported src-2112.10752 |
| CLM-014 | latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。 · [proposition] 在预训练 autoencoder 的 latent 空间训 dm,相对像素空间 dm 显著同时压低**训练算力**与**采样/推理成本**,且质量不降反 [body] | Claim reconciled supported src-2112.10752 |
| CLM-015 | LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。 · [proposition] ldm 的 first-stage 由 **2d 卷积 u-net** 构建(而非需要把 latent 做 1d 展平/tokenize 的自回归 tr [body] | Claim reconciled supported src-2112.10752 |
| CLM-016 | f 消融中 f=4/8 平衡训练进度与渐近质量;f=1/2 太慢、f=16/32 过早停滞(LDM-1 与 LDM-8 差距 38 FID)。 · [proposition] 在下采样因子 f∈{1,2,4,8,16,32} 的消融中(参数量对齐、class-cond imagenet、2m steps、单 a100),**f [body] | Claim reconciled supported src-2112.10752 |
| CLM-017 | LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。 · [proposition] ldm 给 u-net backbone 加装一个**通用 cross-attention 条件机制**:一个 domain-specific enco [body] | Claim reconciled supported src-2112.10752 |
| CLM-018 | 推理期 CFG 大幅抬升 LDM 质量且几乎不加训练成本:LDM-KL-8 在 MS-COCO FID 23.35→12.61(s=1.5)。 · [proposition] 在**推理期**施加 classifier-free guidance(cfg)能大幅抬升 ldm 样张质量(降 fid、升 is)而几乎不加训练成本: [body] | Claim reconciled supported src-2112.10752 |
| CLM-019 | 1.45B KL-LDM + cross-attn 文本条件在 MS-COCO 达与 Make-A-Scene/GLIDE 相当量级且参数量显著更少。 · [proposition] 以 cross-attention 文本条件(bert tokenizer + τ 为 transformer)在 laion-400m 上训一个 ** [body] | Claim reconciled supported src-2112.10752 |
| CLM-020 | 无条件合成 SOTA:LDM 在 CelebA-HQ 256² FID 5.11,并在 FFHQ/LSUN 上与最强 GAN/扩散竞争。 · [proposition] ldm 在**无条件**图像合成上达到新的 sota(celeba-hq 256²:500 ddim 步 fid **5.11**,优于此前 likel [body] | Claim reconciled supported src-2112.10752 |
| CLM-021 | 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。 · [proposition] 对**密集条件**的 image-to-image 任务(超分、修复、语义合成),ldm 把空间对齐的条件信息**直接拼接到输入**即可当作通用的图像→ [body] | Claim reconciled supported src-2112.10752 |
| CLM-022 | image-to-image 高质高效:LDM-SR 在 ImageNet 4× 超分 256² FID 优于 SR3;inpainting 亦优于现有方法。 · [proposition] ldm 在 image-to-image 翻译上给出**高质且高效**的结果: **(sr)** 在 imagenet 上以 4× bicubic 退化 [body] | Claim reconciled supported src-2112.10752 |
| CLM-023 | LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。 · [proposition] ldm 的**上限部分由 first-stage autoencoder 决定**:即便 f=4 ae 的重建在视觉上近乎无损,它并非逐像素精确,故对* [body] | Claim reconciled supported src-2112.10752 |
| EVI-001 | Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-001)。 · [result] dit-xl/2-g(三通道 cfg=1.50):fid-50k **2.27**,sfid 4.60,is 278.24, precision 0.83,rec [body] | Evidence src-2212.09748 |
| EVI-002 | Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。 · [result] fid-50k(400k steps,无 guidance,ft-mse decoder): adaln-zero **19.47** < adaln 25.21 [body] | Evidence src-2212.09748 |
| EVI-003 | Figure 8/6 + Table 4:12 变体 Gflops-FID 强负相关;异构同 Gflops 的 S/2 68.40 vs B/4 68.38 相近、缩小 p 单调改善(支撑 CLM-003)。 · [result] gflops 与 fid-50k 呈强负相关(figure 8);gflops 相近的异构配置 fid 相近(论文举例 dit-s/2 与 dit-b/4:6.0 [body] | Evidence src-2212.09748 |
| EVI-004 | Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。 · [result] dit-xl/2-g(cfg=1.50):fid-50k **3.04**,sfid 5.02,is 240.82, precision 0.84,recall [body] | Evidence src-2212.09748 |
| EVI-005 | Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。 · [result] figure 10:小模型随步数增加的 fid 改善趋缓,无法追平大模型。 论文锚点对照(§5.2):dit-l/2 @1000 步 80.7 tflops/图 [body] | Evidence src-2212.09748 |
| EVI-006 | Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。 · [result] figure 9:等训练算力下大模型始终更低 fid;小模型延长训练的曲线 渐趋平缓。xl/4 与 xl/2 的交叉:约 10^10 训练 gflops 后 xl [body] | Evidence src-2212.09748 |
| EVI-007 | Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。 · [result] fid-50k:original **2.46**、ft-mse **2.30**、ft-ema **2.27**; sfid:5.18 / 4.73 / 4.6 [body] | Evidence src-2212.09748 |
| EVI-008 | App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-008)。 · [result] 3ch guidance(scale 1.5):fid-50k **2.27**;4ch guidance (scale 1.375):fid-50k **2.2 [body] | Evidence src-2212.09748 |
| EVI-009 | §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。 · [result] 256(table 2):dit-xl/2-g 2.27 vs 最佳 u-net diffusion ldm-4-g 3.60、adm-g+u 3.94;512( [body] | Evidence src-2212.09748 |
| EVI-010 | §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。 · [result] §4.1 原文:"training was highly stable across all model configs and we did not obser [body] | Evidence src-2212.09748 |
| EVI-011 | §3.2 + Table 1/4:p 减半时参数量近似不变(S 33M 等)、Gflops ≥4×(S 0.36→1.41→6.06),验证 patchify 标度(支撑 CLM-011/TH-1)。 · [result] 参数量(table 4):s 33/33/33m、b 131/130/130m、l 459/458/458m、 xl 676/675/675m(p=8/4/2)— [body] | Evidence src-2212.09748 |
| EVI-012 | Table 2/3 行内梯度:256 FID 9.62→3.22→2.27、512 12.03→4.64→3.04,档位间改善递减——CFG 效应与饱和(支撑 CLM-012)。 · [result] 256(table 2):9.62 → 3.22(cfg1.25)→ 2.27(cfg1.50)。 512(table 3):12.03 → 4.64(cfg1. [body] | Evidence src-2212.09748 |
| EVI-013 | §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。 · [result] 像素空间 dm 的学习可拆为**感知压缩**(去掉高频细节、语义变化很小)与**语义压缩**(学数据的语义/概念组合)两阶段。ldm 用显式分离替代隐式混合:fi [body] | Evidence src-2112.10752 |
| EVI-014 | Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。 · [result] 训练算力(v100-days):ldm-4-g **271** vs adm 916 → **≈3.4× 更少**。推理吞吐(samples/s, a100):l [body] | Evidence src-2112.10752 |
| EVI-015 | Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。 · [result] matched 压缩下 ldm 的重建质量: - **f=8, ldm (|z|=16384, 4ch)**:r-fid **1.14**, is 201.92, [body] | Evidence src-2112.10752 |
| EVI-016 | §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。 · [result] 训练进度(fig. cin_traincourse,2m steps): - **ldm-{1,2}**(低压缩):进度慢——因把大部分感知压缩任务交给了扩散模型 [body] | Evidence src-2112.10752 |
| EVI-017 | §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。 · [result] 同一个 cross-attention 注意力算子 attention(q,k,v)=softmax(qk^t/√d)v,通过改变 k/v 的来源(τ_θ(y)) [body] | Evidence src-2112.10752 |
| CPT-001 | Diffusion Transformer (DiT) · [definition] 以标准 vision transformer 为 backbone 的(潜空间)去噪扩散模型: vae 潜表示经 patchify 化为 token 序列 [body] | Concept |
| CPT-002 | adaLN-Zero · [definition] dit block 的条件注入机制(src-2212.09748 §3.2、app. a.5):在 vanilla adaln(cpt-007)基础上,除 [body] | Concept |
| CPT-003 | classifier-free guidance · [definition] 条件采样技术:训练时随机丢弃条件 c(替换为可学习的 null embedding ∅),采样时以 ε̂_θ(x_t, c) = ε_θ(x_t, ∅) [body] | Concept |
| CPT-004 | patchify · [definition] dit 的第一层:将空间表示(noised latent,i×i×c)线性嵌入为长度 t = (i/p)² 的 token 序列,每 token 维度 d [body] | Concept |
| CPT-005 | VAE decoder variants (ft-MSE / ft-EMA) · [definition] dit 实验所用 vae 解码器权重三选一:ldm 原 f8 模型的 original decoder,及其仅微调 decoder 权重的两个变体 ft- [body] | Concept |
| CPT-006 | Latent Diffusion Model · [definition] 在 vae 隐空间(而非像素空间)训练 diffusion 模型的两阶段框架 (canonical 定义源:rombach et al., src-211 [body] | Concept |
| CPT-007 | adaptive layer norm (adaLN) · [definition] dit 四种 conditioning 设计之一(src-2212.09748 §3.2、app. a.5):把标准 transformer block [body] | Concept |
| CPT-008 | Perceptual autoencoder (first stage) · [definition] ldm 两阶段框架中的**感知压缩段**:一个 autoencoder (encoder e + decoder d),把 rgb 图像 x∈r^(h×w [body] | Concept |
| CPT-009 | Cross-attention conditioning · [definition] ldm 把任意条件模态注入扩散 backbone 的**通用 cross-attention 机制**:一个 domain-specific encode [body] | Concept |
| CFL-001 | 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。 · [incompatibility] clm-009(dit, src-2212.09748)断言 "u-net 归纳偏置对 diffusion 的**生成质量非关键**—— 标准 [body] | Conflict |
第 1 / 3 页
下一页