Research KB

EVI-021 Evidence

§4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。

id EVI-021
type evidence
claims CLM-021
source SRC-2112.10752
observation §4.3.2 Convolutional Sampling Beyond 256²(semantic synthesis 256² 训练→~1024²/兆像素;SR/inpainting 512²–1024²;text-cond LDM-KL-8-G rescale + CFG 直接 >256², Fig. thicksample/text2img_conv)+ §4.4/§4.5 大图生成
method dense 条件以空间对齐拼接注入(SR/inpainting,τ=id);semantic:下采样语义图与 f=4 VQ latent 拼接,256² 训(384² crops)、滑窗卷积评估至 ~1024²/MP;text-cond:f=4 KL latent 经 component-wise std rescale,配 CFG 直接合成 >256²。
scope SR/inpainting 512²–1024²;semantic 256²→~1MP;f=4(VQ: SR/inp; KL: text>256² rescale+CFG); 滑窗卷积

Result

LDM 以卷积滑窗方式越过训练分辨率:

  • semantic synthesis:256²(384² crops)训练,卷积评估可生成到 ~1024² / 兆像素 级(Fig. thicksample)。
  • SR、inpainting 模型同样借此产出 512²–1024² 大图。
  • text 条件 LDM-KL-8-G:latent(f=4 KL)按 component-wise 标准差 rescale 后,配合 CFG,可直接合成 >256² 图像(Fig. text2img_conv)。

机制:把空间对齐的条件信息(低清图/mask/语义图)与 z_t 通道拼接,使 ε_θ 充当通用 image→image 翻译器;卷积套用(sliding window)保证跨窗口空间一致,从而放大到大图。

Caveats

"~1024²/兆像素"是卷积推广的上限,非单一训练分辨率——大图由分块滑窗拼接,跨窗口的接缝/一致性依赖 latent 的局部平滑性,并非端到端一次生成。latent 尺度(SNR,由 latent 空间幅度决定)对大图结果显著影响:f=4 KL 的原 latent 与 component-wise std rescaled 版本给出的 LDM 行为不同,rescaled + CFG 才能稳定直接合成 >256²(否则 text-cond 也会漂移)。故"能生成大图"是有条件的(正确 rescale/CFG + 卷积套用),不是无条件外推。

引用(2)

  • CLM-021 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
  • SRC-2112.10752 Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。

被引用(3)

  • CLM-021 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • VER-021 大图核验:§4.3.2 卷积滑窗 + Fig. thicksample/text2img_conv 支持越训练分辨率至 ~1024²/兆像素,rescale+CFG 条件已声明。supported。