EVI-019
Evidence
主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-019)。
| id | EVI-019 |
|---|---|
| type | evidence |
| claims | CLM-019 |
| source | SRC-2112.10752 |
| observation | 主文 Text-Conditional Image Synthesis 表(MS-COCO val,250 DDIM steps:CogView/LAFITE/GLIDE/Make-A-Scene vs LDM-KL-8 / LDM-KL-8-G)+ §4.3.1 Transformer Encoders for LDMs(LAION-400M, 1.45B, BERT tokenizer, τ=transformer) |
| method | LAION-400M 训练;1.45B KL-LDM;BERT tokenizer;τ_θ=transformer 编码文本,cross-attention 注入 U-Net;MS-COCO validation 集评测 FID/IS;250 DDIM steps;best 配置 CFG s=1.5。 |
| scope | LAION-400M→MS-COCO val;1.45B;250 步;cfg 1.5(best) |
Result
MS-COCO 250 步 text-to-image(FID↓ / IS↑):
- CogView:27.10 / 18.20(AR)
- LAFITE:26.94 / 26.02(GAN)
- GLIDE:12.24 / –(diffusion)
- Make-A-Scene:11.84 / –(AR, 同期最新)
- LDM-KL-8(ours):23.35 / 19.93±0.35
- LDM-KL-8-G(ours, CFG s=1.5):FID 12.61 / IS 26.62±0.38
→ LDM-KL-8-G(1.45B)的 FID 12.61 与 GLIDE 12.24、Make-A-Scene 11.84 处于同一量级(差 ≤0.8),并大幅领先早期的 CogView 27.10 与 LAFITE 26.94(差 ≈14.3/14.3)。
Caveats
"on par with" 是相对量级判断(12.61 vs 12.24/11.84,差 0.37–0.77),严格说 LDM-KL-8-G 的 FID(12.61)略高于 Make-A-Scene(11.84)与 GLIDE(12.24),并非绝对最低——论文措辞是 "on par"(相当)而非 "new SOTA"。"substantially reducing parameter count" 指 1.45B 小于部分 AR 系统,但表中未逐一列出 CogView/Make-A-Scene/GLIDE 的精确参数量,故参数量优势的量化幅度取决于外部信息,本表只保证 1.45B 这一自身数值。IS 的 ±0.38 为多次评测标准差;FID 单次值未附误差棒(FID 对样本数敏感,5K 提示集是标准口径)。
引用(2)
- CLM-019 1.45B KL-LDM + cross-attn 文本条件在 MS-COCO 达与 Make-A-Scene/GLIDE 相当量级且参数量显著更少。
- SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。
被引用(3)
- CLM-019 1.45B KL-LDM + cross-attn 文本条件在 MS-COCO 达与 Make-A-Scene/GLIDE 相当量级且参数量显著更少。
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- VER-019 T2I 核验:1.45B LDM-KL-8-G 在 MS-COCO 250 步 FID 12.61/IS 26.62,与 GLIDE 12.24/Make-A-Scene 11.84 同量级(非最低),措辞如实。supported。