Research KB

EVI-010 Evidence

§4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。

id EVI-010
type evidence
claims CLM-010
source SRC-2212.09748
observation §4.1 Training 段 + Appendix Figure 13 (training loss curves) + Table 4(各配置超参列一致)
method 12+ 变体统一超参训练;报告训练稳定性(loss spike 有无)与 loss 曲线
scope 全部配置的聚合经验陈述,非逐配置逐 seed 统计

Result

§4.1 原文:"training was highly stable across all model configs and we did not observe any loss spikes";"We did not tune learning rates, decay/warm-up schedules, Adam β1/β2 or weight decays"。 Table 4 各行 lr 均为 1e-4、batch 256。Figure 13 显示全部模型 loss 平滑下降,规模越大饱和值越低。

Caveats

"无 loss spike" 为作者的定性观察,未附异常计数或 seed 级统计; 训练在 TPU-v3/JAX 栈上完成,硬件/框架迁移的稳定性未验证。

引用(2)

  • CLM-010 DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(3)

  • CLM-010 DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-010 核验 CLM-010 配方稳定:§4.1 两引语(no loss spikes/did not tune)与 Table 4 超参列(lr 1e-4、batch 256)及 Fig.13 曲线一致。supported。