Research KB

CLM-022 Claim

image-to-image 高质高效:LDM-SR 在 ImageNet 4× 超分 256² FID 优于 SR3;inpainting 亦优于现有方法。

id CLM-022
type claim
source SRC-2112.10752
scope SR: ImageNet 4× bicubic upscaling, 256^2, f=4 VQ (OpenImages 预训练), identity conditioner, LR concat, 遵循 SR3 数据处理; Inpainting: Places 256^2/512^2 (30k), f=4 KL/VQ, 参数量对齐 ~215M (更大模型 387M, 3-level attention); DDIM; 对比 SR3 / LaMa / pixel-DM
epistemic supported
lifecycle RECONCILED
created 2026-09-03
updated 2026-09-03

Proposition

LDM 在 image-to-image 翻译上给出高质且高效的结果: (SR) 在 ImageNet 上以 4× bicubic 退化(遵循 SR3)、f=4 VQ 预训练 AE、LR 与 UNet 输入拼接(identity conditioner)训练后,LDM-SR 在 256² 上 FID 优于 SR3(IS 略逊),并胜过一个简单图像回归基线在感知指标上的表现;用户偏好研究中 LDM-SR 胜过 pixel 基线——"preference vs GT" 30.4%(pixel-DM 16.0%)、"二选一" 70.6%(pixel-DM 29.4%)。 (Inpainting) 在 Places 256²/512² 上,带 attention 的 LDM-4 相对像素基线 DM(LDM-1)取得至少 2.7× 的速度提升与至少 1.6× 的 FID 改善(六个 epoch 后);且 LDM-4 的 FID 超过专用 SOTA 修复器 LaMa(虽然 LPIPS 略高于 LaMa——因为 LaMa 只产出单张均值化图像,而 LDM 给出多样化结果);用户研究中人类偏好 LDM(preference vs GT 21.0% vs LaMa 13.6%,二选一 68.1% vs 31.9%)。一个更大的模型(387M 参数、3-level attention、无 first-stage attention)在 512² 上微调半 epoch 后刷新了图像修复的 SOTA FID

Evidence refs

Notes

SR 部分(§4.4):LDM-SR(f=4 VQ, 169M UNet, 100 步)FID 2.8(val-split feat)/4.8(train-split);LDM-SR-big(552M)2.4/4.3;LDM-SR-50s-guiding(184M)4.4/6.4。PSNR/SSIM 最高的仍是简单回归基线(论文承认这些指标"favor blurriness over imperfectly aligned high frequency details");LDM 以 post-hoc perceptual-loss guider 可再推高 PSNR/SSIM。LDM-BSR(泛化退化版本,补充 srsupptable)用于非 bicubic 退化。Inpainting 部分(§4.5):Tab. inpaintingefficiency 给出 LDM-1 vs LDM-4(KL/VQ)、215M 参数量对齐下 256²/512² 的训练+采样吞吐与六 epoch FID;Tab. inpaintingtable 给出 LDM-4-attn / big / big-w/o-attn-ft 对 LaMa 的 FID/LPIPS/PSNR/SSIM 对比;user_study 表给出 SR 与 Inpainting 两个任务两组偏好数字。"2.7× speed-up / 1.6× FID" 是直接引用 §4.5 正文表述。

引用(2)

  • EVI-022 §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(4)

  • CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。
  • EVI-022 §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-022 i2i 核验:SR FID 2.8/2.4/4.4 胜 SR3、inpainting 2.7×提速/1.6×FID、胜 LaMa(用户 30.4/70.6、21.0/68.1)与表/正文逐项一致。supported。