Research KB
清除
类型 Source Formalization Claim Evidence Concept Conflict Verification Lifecycle extracted formalized reconciled Epistemic n/a partially-supported supported 23 命中
EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-001)。 · [result] dit-xl/2-g(三通道 cfg=1.50):fid-50k **2.27**,sfid 4.60,is 278.24, precision 0.83,rec [body] Evidence src-2212.09748
EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。 · [result] fid-50k(400k steps,无 guidance,ft-mse decoder): adaln-zero **19.47** < adaln 25.21 [body] Evidence src-2212.09748
EVI-003 Figure 8/6 + Table 4:12 变体 Gflops-FID 强负相关;异构同 Gflops 的 S/2 68.40 vs B/4 68.38 相近、缩小 p 单调改善(支撑 CLM-003)。 · [result] gflops 与 fid-50k 呈强负相关(figure 8);gflops 相近的异构配置 fid 相近(论文举例 dit-s/2 与 dit-b/4:6.0 [body] Evidence src-2212.09748
EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-004)。 · [result] dit-xl/2-g(cfg=1.50):fid-50k **3.04**,sfid 5.02,is 240.82, precision 0.84,recall [body] Evidence src-2212.09748
EVI-005 Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。 · [result] figure 10:小模型随步数增加的 fid 改善趋缓,无法追平大模型。 论文锚点对照(§5.2):dit-l/2 @1000 步 80.7 tflops/图 [body] Evidence src-2212.09748
EVI-006 Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。 · [result] figure 9:等训练算力下大模型始终更低 fid;小模型延长训练的曲线 渐趋平缓。xl/4 与 xl/2 的交叉:约 10^10 训练 gflops 后 xl [body] Evidence src-2212.09748
EVI-007 Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。 · [result] fid-50k:original **2.46**、ft-mse **2.30**、ft-ema **2.27**; sfid:5.18 / 4.73 / 4.6 [body] Evidence src-2212.09748
EVI-008 App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-008)。 · [result] 3ch guidance(scale 1.5):fid-50k **2.27**;4ch guidance (scale 1.375):fid-50k **2.2 [body] Evidence src-2212.09748
EVI-009 §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。 · [result] 256(table 2):dit-xl/2-g 2.27 vs 最佳 u-net diffusion ldm-4-g 3.60、adm-g+u 3.94;512( [body] Evidence src-2212.09748
EVI-010 §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。 · [result] §4.1 原文:"training was highly stable across all model configs and we did not obser [body] Evidence src-2212.09748
EVI-011 §3.2 + Table 1/4:p 减半时参数量近似不变(S 33M 等)、Gflops ≥4×(S 0.36→1.41→6.06),验证 patchify 标度(支撑 CLM-011/TH-1)。 · [result] 参数量(table 4):s 33/33/33m、b 131/130/130m、l 459/458/458m、 xl 676/675/675m(p=8/4/2)— [body] Evidence src-2212.09748
EVI-012 Table 2/3 行内梯度:256 FID 9.62→3.22→2.27、512 12.03→4.64→3.04,档位间改善递减——CFG 效应与饱和(支撑 CLM-012)。 · [result] 256(table 2):9.62 → 3.22(cfg1.25)→ 2.27(cfg1.50)。 512(table 3):12.03 → 4.64(cfg1. [body] Evidence src-2212.09748
EVI-013 §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。 · [result] 像素空间 dm 的学习可拆为**感知压缩**(去掉高频细节、语义变化很小)与**语义压缩**(学数据的语义/概念组合)两阶段。ldm 用显式分离替代隐式混合:fi [body] Evidence src-2112.10752
EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。 · [result] 训练算力(v100-days):ldm-4-g **271** vs adm 916 → **≈3.4× 更少**。推理吞吐(samples/s, a100):l [body] Evidence src-2112.10752
EVI-015 Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。 · [result] matched 压缩下 ldm 的重建质量: - **f=8, ldm (|z|=16384, 4ch)**:r-fid **1.14**, is 201.92, [body] Evidence src-2112.10752
EVI-016 §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。 · [result] 训练进度(fig. cin_traincourse,2m steps): - **ldm-{1,2}**(低压缩):进度慢——因把大部分感知压缩任务交给了扩散模型 [body] Evidence src-2112.10752
EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。 · [result] 同一个 cross-attention 注意力算子 attention(q,k,v)=softmax(qk^t/√d)v,通过改变 k/v 的来源(τ_θ(y)) [body] Evidence src-2112.10752
EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。 · [result] 开启 cfg(s=1.5)前后: - **text-to-image(ms-coco, 250 步)**:ldm-kl-8 fid **23.35** → ldm [body] Evidence src-2112.10752
EVI-019 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-019)。 · [result] ms-coco 250 步 text-to-image(fid↓ / is↑): - cogview:**27.10** / 18.20(ar) - lafite [body] Evidence src-2112.10752
EVI-020 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。 · [result] fid↓ + precision↑ + recall↑(256²): - **celeba-hq**:vqgan+t 10.2;pggan 8.0;lsgm 7. [body] Evidence src-2112.10752
EVI-021 §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。 · [result] ldm 以卷积滑窗方式越过训练分辨率: - semantic synthesis:256²(384² crops)训练,卷积评估可生成到 **~1024² / 兆 [body] Evidence src-2112.10752
EVI-022 §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。 · [result] **sr(imagenet 4×, 256²,fid↓/is↑/psnr/ssim/lpips)**: - ldm-sr(169m, 100 步):fid **2 [body] Evidence src-2112.10752
EVI-023 §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。 · [result] 论文自述两条硬局限: 1. **顺序采样仍慢于 gan**:ldm 虽比像素 dm 快(2.7× inpainting / 3.3× 采样),但本质是迭代去噪(d [body] Evidence src-2112.10752