Research KB
清除
类型 Source Formalization Claim Evidence Concept Conflict Verification Lifecycle extracted formalized reconciled Epistemic n/a partially-supported supported 23 命中
CLM-001 DiT-XL/2(cfg=1.50,3 通道 guidance)在 ImageNet 256×256 达 FID-50K 2.27,为包括 StyleGAN-XL 在内的最低 FID。 · [proposition] 在 class-conditional imagenet 256×256 生成基准上,dit-xl/2 配合 classifier-free guida [body] Claim reconciled supported src-2212.09748
CLM-002 同 XL/2 与 400K 步预算下,adaLN-Zero 的 FID 19.47 为四种 conditioning 设计最低,且算力最省之一。 · [proposition] 在 dit-xl/2 配置与 400k 步训练预算下(imagenet 256×256),adaln-zero block 的 fid-50k 为四种 [body] Claim reconciled supported src-2212.09748
CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。 · [proposition] 模型前向 gflops(而非参数量)是 dit 生成质量的主要决定因素: gflops 相近的不同配置取得相近的 fid(如 dit-s/2 ≈ dit [body] Claim reconciled supported src-2212.09748
CLM-004 DiT-XL/2(cfg=1.50)在 ImageNet 512×512 达 FID-50K 3.04,优于全部 diffusion 基线但未超 StyleGAN-XL(2.41)。 · [proposition] 在 class-conditional imagenet 512×512 生成基准上,dit-xl/2 配合 classifier-free guida [body] Claim reconciled supported src-2212.09748
CLM-005 采样算力不能补偿模型算力:DiT-L/2 多步(1000 步、80.7 Tflops、FID-10K 25.9)仍劣于 XL/2 低步(128 步、15.2 Tflops、23.7)。 · [proposition] 在 dit 模型族内(400k 训练步),扩大采样算力不能补偿模型算力的 不足:小模型即使以更多采样步、乃至更高的单图采样算力生成, fid-10k 仍 [body] Claim reconciled supported src-2212.09748
CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。 · [proposition] 在等量总训练算力约束下,更大的 dit 模型更 compute-efficient:小 模型即使训练更久,最终相对"更少步数的大模型"仍是算力低效的;且 [body] Claim reconciled supported src-2212.09748
CLM-007 VAE decoder(original/ft-MSE/ft-EMA)可免重训互换,FID 2.46/2.30/2.27,差异有限且均优于此前 diffusion。 · [proposition] vae decoder 可以在不重训 diffusion 模型的前提下互换(三者 encoder 相同):ldm original / ft-mse / [body] Claim reconciled supported src-2212.09748
CLM-008 3 通道子集 guidance(DiT 实际做法)经 scale 换算后与全 4 通道效果近似:3ch (1+x) ≈ 4ch (1+¾x)。 · [proposition] 对 4 通道 latent 仅施加前 3 通道的 guidance(dit 论文全部 guidance 实验的实际做法)与全 4 通道 guidance [body] Claim reconciled supported src-2212.09748
CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone 并取得更优质量。 · [proposition] u-net 的归纳偏置对 diffusion 模型的性能不是关键:标准 vit 架构 (沿用 vit 惯例、不含卷积 u-net 组件)可在 laten [body] Claim reconciled partially-supported src-2212.09748
CLM-010 DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。 · [proposition] dit 在未调参的 adm 配方下即可稳定训练到高性能:恒定学习率 1e-4、 无 weight decay、无 warmup、无正则化,所有模型配置( [body] Claim reconciled supported src-2212.09748
CLM-011 patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。 · [proposition] patchify 的结构性标度:patch size p 减半使 token 数 t=(i/p)² 增至 四倍、transformer gflops 至 [body] Claim reconciled supported src-2212.09748
CLM-012 CFG 大幅改善 DiT-XL/2:256 上 FID 9.62→3.22→2.27(无/1.25/1.50),512 上 12.03→4.64→3.04。 · [proposition] classifier-free guidance 大幅改善 dit-xl/2 的 fid-50k: 256 上无 guidance 9.62 → cfg [body] Claim reconciled supported src-2212.09748
CLM-013 LDM 把图像合成拆为感知压缩(autoencoder)与语义压缩(latent 上训 DM)两段,分离感知无关细节与语义生成。 · [proposition] ldm 把高分辨率图像合成分解为两段:(1) **感知压缩**段——用一个 autoencoder (lpips 感知损失 + patch-based [body] Claim reconciled supported src-2112.10752
CLM-014 latent 空间训 DM 同时压低训练与采样算力且质量反升:LDM-4-G 271 vs ADM 916 V100-days,采样快约 3.3×。 · [proposition] 在预训练 autoencoder 的 latent 空间训 dm,相对像素空间 dm 显著同时压低**训练算力**与**采样/推理成本**,且质量不降反 [body] Claim reconciled supported src-2112.10752
CLM-015 LDM 首段用 2D 卷积 U-Net(非 AR tokenize),可容忍更低压缩因子;f=8 重建 R-FID 1.14 优于 VQGAN/DALL·E。 · [proposition] ldm 的 first-stage 由 **2d 卷积 u-net** 构建(而非需要把 latent 做 1d 展平/tokenize 的自回归 tr [body] Claim reconciled supported src-2112.10752
CLM-016 f 消融中 f=4/8 平衡训练进度与渐近质量;f=1/2 太慢、f=16/32 过早停滞(LDM-1 与 LDM-8 差距 38 FID)。 · [proposition] 在下采样因子 f∈{1,2,4,8,16,32} 的消融中(参数量对齐、class-cond imagenet、2m steps、单 a100),**f [body] Claim reconciled supported src-2112.10752
CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。 · [proposition] ldm 给 u-net backbone 加装一个**通用 cross-attention 条件机制**:一个 domain-specific enco [body] Claim reconciled supported src-2112.10752
CLM-018 推理期 CFG 大幅抬升 LDM 质量且几乎不加训练成本:LDM-KL-8 在 MS-COCO FID 23.35→12.61(s=1.5)。 · [proposition] 在**推理期**施加 classifier-free guidance(cfg)能大幅抬升 ldm 样张质量(降 fid、升 is)而几乎不加训练成本: [body] Claim reconciled supported src-2112.10752
CLM-019 1.45B KL-LDM + cross-attn 文本条件在 MS-COCO 达与 Make-A-Scene/GLIDE 相当量级且参数量显著更少。 · [proposition] 以 cross-attention 文本条件(bert tokenizer + τ 为 transformer)在 laion-400m 上训一个 ** [body] Claim reconciled supported src-2112.10752
CLM-020 无条件合成 SOTA:LDM 在 CelebA-HQ 256² FID 5.11,并在 FFHQ/LSUN 上与最强 GAN/扩散竞争。 · [proposition] ldm 在**无条件**图像合成上达到新的 sota(celeba-hq 256²:500 ddim 步 fid **5.11**,优于此前 likel [body] Claim reconciled supported src-2112.10752
CLM-021 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。 · [proposition] 对**密集条件**的 image-to-image 任务(超分、修复、语义合成),ldm 把空间对齐的条件信息**直接拼接到输入**即可当作通用的图像→ [body] Claim reconciled supported src-2112.10752
CLM-022 image-to-image 高质高效:LDM-SR 在 ImageNet 4× 超分 256² FID 优于 SR3;inpainting 亦优于现有方法。 · [proposition] ldm 在 image-to-image 翻译上给出**高质且高效**的结果: **(sr)** 在 imagenet 上以 4× bicubic 退化 [body] Claim reconciled supported src-2112.10752
CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。 · [proposition] ldm 的**上限部分由 first-stage autoencoder 决定**:即便 f=4 ae 的重建在视觉上近乎无损,它并非逐像素精确,故对* [body] Claim reconciled supported src-2112.10752