EVI-007
Evidence
Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。
| id | EVI-007 |
|---|---|
| type | evidence |
| claims | CLM-007 |
| source | SRC-2212.09748 |
| observation | Table 5 (Decoder ablation) + §A.4 正文 |
| method | 同一 DiT-XL/2-G(cfg=1.5)权重,仅替换 VAE decoder 权重(encoders 相同),重算 256x256 指标 |
| scope | Table 5 三行:LDM original / ft-MSE / ft-EMA |
Result
FID-50K:original 2.46、ft-MSE 2.30、ft-EMA 2.27; sFID:5.18 / 4.73 / 4.60;IS:271.56 / 276.09 / 278.24; Precision:0.82 / 0.83 / 0.83;Recall:三者均 0.57。decoder 权重 来源 huggingface.co/stabilityai/sd-vae-ft-mse(Table 5 caption)。
Caveats
单一 cfg(1.5)单模型。差异幅度 0.19(2.46→2.27)与 StyleGAN-XL 对比的 0.03 同量级——decoder 选择对"是否 SOTA"的 边界判定有实质影响:original decoder 下 2.46 > 2.30 (劣于 StyleGAN-XL),ft-MSE/ft-EMA 下均 < 2.30。 "outperform all prior diffusion models" 在三种 decoder 下均成立 (2.46 < 3.60 = LDM-4-G)。
引用(2)
- CLM-007 VAE decoder(original/ft-MSE/ft-EMA)可免重训互换,FID 2.46/2.30/2.27,差异有限且均优于此前 diffusion。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(3)
- CLM-007 VAE decoder(original/ft-MSE/ft-EMA)可免重训互换,FID 2.46/2.30/2.27,差异有限且均优于此前 diffusion。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-007 核验 CLM-007 decoder 消融:Table 5(2.46/2.30/2.27)与 §A.4(encoder 相同、免重训互换、LDM decoder 下仍最优)一致。supported。