Research KB

EVI-005 Evidence

Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。

id EVI-005
type evidence
claims CLM-005
source SRC-2212.09748
observation Figure 10 (sample complexity: FID-10K vs sampling steps/Gflops) + §5.2 正文
method 12 个 400K 步模型各以 [16,32,64,128,256,1000] 采样步生成,FID-10K 对采样步数与单图采样 Gflops 作图
scope 12 变体 × 6 档步数网格;FID-10K(非 FID-50K)

Result

Figure 10:小模型随步数增加的 FID 改善趋缓,无法追平大模型。 论文锚点对照(§5.2):DiT-L/2 @1000 步 80.7 Tflops/图 FID-10K 25.9 vs DiT-XL/2 @128 步 15.2 Tflops/图 FID-10K 23.7 (采样算力约 5 倍差)。

Caveats

FID-10K 与主表 FID-50K 口径不同(样本数 10K vs 50K),不可跨表 比较绝对值。结论限于 400K 步的模型族;未涉及训练更久的模型 (XL/2 延长训练的结果不在此网格内)。

引用(2)

  • CLM-005 采样算力不能补偿模型算力:DiT-L/2 多步(1000 步、80.7 Tflops、FID-10K 25.9)仍劣于 XL/2 低步(128 步、15.2 Tflops、23.7)。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(3)

  • CLM-005 采样算力不能补偿模型算力:DiT-L/2 多步(1000 步、80.7 Tflops、FID-10K 25.9)仍劣于 XL/2 低步(128 步、15.2 Tflops、23.7)。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-005 核验 CLM-005 采样算力:§5.2 锚点(23.7 vs 25.9、15.2 vs 80.7 Tflops)与 Figure 10 一致,FID-10K 口径已声明。supported。