EVI-006
Evidence
Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。
| id | EVI-006 |
|---|---|
| type | evidence |
| claims | CLM-006 |
| source | SRC-2212.09748 |
| observation | Figure 9 (FID vs total training compute) + §4.2 'Larger DiT models are more compute-efficient' + Appendix Figure 12/13 |
| method | 以 Gflops x batch x steps x 3 估算总训练算力,对 12 变体(含 XL/2 延长训练)画 FID-训练算力曲线 |
| scope | 256x256、无 guidance、ft-MSE decoder;网格覆盖 0.36G-118.6G 模型 x 400K-7M 步 |
Result
Figure 9:等训练算力下大模型始终更低 FID;小模型延长训练的曲线 渐趋平缓。XL/4 与 XL/2 的交叉:约 10^10 训练 Gflops 后 XL/2 反超 (§4.2 原文 "XL/4 is outperformed by XL/2 after roughly 10^10 Gflops")。附录扩展:趋势对 sFID/IS/Precision/Recall 一致 (Figure 12);训练损失随模型 Gflops 更快下降且饱和值更低 (Figure 13)。
Caveats
"compute-efficient" 判读基于 FID 单指标;训练算力估算式忽略数据 加载与硬件利用率细节。网格内无 FID 饱和(XL/2 "trained as long as possible",Table 4 caption)。
引用(2)
- CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
- SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。
被引用(3)
- CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- VER-006 核验 CLM-006 训练算力效率:Fig.9 XL-4→XL-2 交叉声明(~10^10 Gflops)与 §4.2 一致,x3 估算因子属 AX-7 约定。supported。