Research KB

CLM-010 Claim

DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。

id CLM-010
type claim
source SRC-2212.09748
scope all DiT configs (S/B/L/XL x p x 4 conditioning designs, 256/512), JAX on TPU-v3; AdamW, constant lr 1e-4, no weight decay/warmup/regularization, batch 256, EMA 0.9999, horizontal-flip-only augmentation
epistemic supported
lifecycle RECONCILED
created 2026-09-03
updated 2026-09-03

Proposition

DiT 在未调参的 ADM 配方下即可稳定训练到高性能:恒定学习率 1e-4、 无 weight decay、无 warmup、无正则化,所有模型配置(含 XL)训练 全程无 loss spike;超参几乎全部沿用 ADM 且未做调参(lr / 调度 / Adam β / weight decay 均为默认沿用)。

Evidence refs

Notes

与 ViT 分类文献的常见做法(warmup + 强正则化)形成对照(§4.1 引 steiner2021train / Xiao2021)。可复现要点:所有报告结果用 EMA 权重 (decay 0.9999);数据增广仅水平翻转;DiT-XL/2 在 TPU v3-256 上 约 5.7 iter/s(batch 256)。

引用(2)

  • EVI-010 §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。
  • SRC-2212.09748 DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。

被引用(3)

  • EVI-010 §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • VER-010 核验 CLM-010 配方稳定:§4.1 两引语(no loss spikes/did not tune)与 Table 4 超参列(lr 1e-4、batch 256)及 Fig.13 曲线一致。supported。