Research KB

CLM-006 Claim

等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。

id CLM-006
type claim
source SRC-2212.09748
scope 12 DiT variants (400K-7M steps), ImageNet 256x256; training compute := Gflops x batch x steps x 3; FID-50K no guidance (ft-MSE decoder)
epistemic supported
lifecycle RECONCILED
created 2026-09-03
updated 2026-09-03

Proposition

在等量总训练算力约束下,更大的 DiT 模型更 compute-efficient:小 模型即使训练更久,最终相对"更少步数的大模型"仍是算力低效的;且 仅 patch size 不同的模型对在控制训练 Gflops 后性能曲线不同—— XL/4 在约 10^10 训练 Gflops 之后被 XL/2 反超。

Evidence refs

Notes

训练算力估算式(Gflops·batch·steps·3,因子 3 近似反向传播为前向 两倍开销)是论文的分析约定。"同 Gflops 预算下不同 patch size 曲线不同"意味着 token 数本身(不只是总 Gflops)影响 compute efficiency——论文以此区分 "模型 Gflops" 与 "训练 Gflops" 两个 命题(§4.2)。附录显示该趋势对 sFID/IS/Precision/Recall 与训练 损失(更大模型饱和值更低)同样成立(App. A.3、Figure 12/13)。

引用(2)

  • EVI-006 Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(3)

  • EVI-006 Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-006 核验 CLM-006 训练算力效率:Fig.9 XL-4→XL-2 交叉声明(~10^10 Gflops)与 §4.2 一致,x3 估算因子属 AX-7 约定。supported。