Research KB

EVI-006 Evidence

Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。

id EVI-006
type evidence
claims CLM-006
source SRC-2212.09748
observation Figure 9 (FID vs total training compute) + §4.2 'Larger DiT models are more compute-efficient' + Appendix Figure 12/13
method 以 Gflops x batch x steps x 3 估算总训练算力,对 12 变体(含 XL/2 延长训练)画 FID-训练算力曲线
scope 256x256、无 guidance、ft-MSE decoder;网格覆盖 0.36G-118.6G 模型 x 400K-7M 步

Result

Figure 9:等训练算力下大模型始终更低 FID;小模型延长训练的曲线 渐趋平缓。XL/4 与 XL/2 的交叉:约 10^10 训练 Gflops 后 XL/2 反超 (§4.2 原文 "XL/4 is outperformed by XL/2 after roughly 10^10 Gflops")。附录扩展:趋势对 sFID/IS/Precision/Recall 一致 (Figure 12);训练损失随模型 Gflops 更快下降且饱和值更低 (Figure 13)。

Caveats

"compute-efficient" 判读基于 FID 单指标;训练算力估算式忽略数据 加载与硬件利用率细节。网格内无 FID 饱和(XL/2 "trained as long as possible",Table 4 caption)。

引用(2)

  • CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(3)

  • CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-006 核验 CLM-006 训练算力效率:Fig.9 XL-4→XL-2 交叉声明(~10^10 Gflops)与 §4.2 一致,x3 估算因子属 AX-7 约定。supported。