Research KB 登录

SYN-002 Synthesis

三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。

id
updated
type synthesis
inputs CLM-009, CLM-002, CLM-003, CLM-005, CLM-006, CLM-007, CLM-010, CLM-011, CLM-012, CLM-013, CLM-014, CLM-015, CLM-016, CLM-017, CLM-018, CLM-020, CLM-021, CLM-022, CLM-023, CLM-025, CLM-026, CLM-027, CLM-031, CLM-032

Structure

跨来源系统整合(D7 典型情形):三个 Source 的论题层按改造对象所在的管线层级组织,而非按论文时间或任务组织。输入为三源全部 24 条存留 Claim(0001 重构后的论题承载卡,见 inputs);本整合产生的结构——“三段可分解改造”——不属于任何单条 Claim。

层 1:表示层(PPR-2112.10752,LDM)

改造对象 = 像素空间本身。核心判断:感知压缩与语义生成的显式分离(CLM-013),latent 空间训练同时压低训练/采样成本且质量不降(CLM-014);first-stage 压缩设计空间(conv 流程容忍低压缩保重建 CLM-015、f 甜区 CLM-016)。边界与代价:AE 重建上限(CLM-023)。

层 2:骨干层(PPR-2212.09748,DiT)

改造对象 = 去噪网络架构。核心判断:U-Net 归纳偏置对生成质量非关键、ViT 可直接替换且更优(CLM-009);质量的主要决定因素是 Gflops 而非参数量(CLM-003,结构前提 CLM-011);等训练算力下大模型更 compute- efficient、采样算力不能补偿模型算力(CLM-005/006);条件注入机制决定质量(调制式最优 CLM-002,CFG 收益模式 CLM-012);未调参配方即可稳定训练(CLM-010);decoder 选择影响优势稳健性边界(CLM-007)。

层 3:采样层(PPR-2606.26017,G2DP)

改造对象 = 采样/引导过程本身。核心判断:稠密 cost 网格引导是纯推理期插件、与骨干正交(CLM-032);引导信息形态(稠密概率网格 vs 实例稀疏)决定避障行为质量(CLM-025);零样本迁移增益集中于安全轴(CLM-026/027);边界:历史输入的优势仅限 reactive/interactive 设定(CLM-031)。

派生观察(KB 外推,unverified——不回写为论文断言)

  • 三论文是时间上的实际组合链,不只是概念分层:DiT 直接采用 off-the-shelf VAE(即 LDM 式 first-stage,未改造表示层,其 §2 明言“off-the-shelf convolutional VAEs”);G2DP 的生成骨干即 DiT 架构。即:每篇后续工作只改造上一层产物之上的一个层级——这条链是来源中的可观察事实。
  • 层独立性判断解释组合可行性CLM-013(感知压缩可显式剥离)+ CLM-009(骨干可替换)+ CLM-032(引导可推理期插拔)三个“可分解性”判断分别授权了三个层级的独立改造。组合链的成功是这三个判断的事后印证;反向推断(“凡满足可分解性的层级改造都会成功”)不被本整合支持。
  • 条件机制与引导的分属:DiT 的 conditioning(层 2,训练期架构选择)与 G2DP 的 guidance(层 3,推理期能量注入)不构成竞争方案——前者改变条件信息进入骨干的方式,后者在采样更新中注入梯度;两者在 G2DP 中同时存在(DiT 骨干 + cost 网格引导)。DiT CLM-012 的“收益递减 + 保真-多样性权衡”与 G2DP 的调度敏感性(CLM-032 Notes)疑似同构现象(推理期注入强度都存在非平凡最优点),但证据来自不同管线不同指标,只作并置不做合并。
  • 质量的层级归因不可交换:层 1 判断的指标是重建保真(R-FID 系),层 2 是生成质量(FID 系),层 3 是规划安全/推进指标——三层各自内部自洽,跨层无统一标度。任何“三层对总质量的贡献占比”问题在本子图内不可回答(无受控分解实验),属开放问题。

Consensus / Disagreement / Gaps

  • 共识(跨源):①定性设计判断层三源高度同构——每篇都以“归纳偏置/信息形态/粒度选择优于蛮力”为核心(latent vs 像素、transformer vs 卷积偏置、稠密网格 vs 实例锚点);②scaling 判断都指向“算力投向结构比堆量更重要”(CLM-003/005/006 ↔ CLM-014)。
  • 争议:无 open CFL。CFL-001 已裁决(terminology-difference,human-resolved)——该案例本身是本整合的方法论注脚:跨源术语对撞需逐网络定位,不能按字面合并。
  • 空白(D14 显式化):①coverage gap:三源均为图像/规划生成,无文本、音频、视频层的三段分解证据,层级图景外推到其他模态未验证;②source gap:G2DP 全批 claim 无 VER 卡(含 CLM-032),DiT/LDM 19 张 VER 的投影忠实度段待补审(0001 遗留)——层 3 判断的文献级可信度当前弱于层 1/2;③concept gap:层 2 与层 3 的“推理期注入”同构现象(见派生观察三)无独立消融支撑,升格为 claim 需新证据;④relation gap:层间接口的形式刻画(层 2 依赖层 1 输出的哪些性质?CLM-023 的 AE 上限如何传导到层 2 质量?)无来源直接论证。
  • RQ 种子(不入本卡,P8 通道):组合链的下一层是什么(奖励/目标层改造?);三段分解在 latent 不保持二维结构的模态是否仍成立。

关联(31)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
  • CLM-002 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。
  • CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
  • CLM-005 采样算力不能补偿模型算力:DiT 族内小模型即使以数倍单图采样算力生成,FID 仍劣于大模型的低步数采样(锚点数字见 EVI-005)。
  • CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
  • CLM-007 DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
  • CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
  • CLM-010 DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。
  • CLM-011 patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。
  • CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
  • CLM-013 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。
  • CLM-014 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
  • CLM-015 LDM 全 2D-conv 流程(conv AE + conv DM)可容忍比 1D-AR tokenize 更温和的压缩且重建更保真;优势集中在低压缩区间(f=8 显著优于 DALL·E,f=16 与 VQGAN 相当)。
  • CLM-016 下采样因子 f 的选取存在数据集相关的甜区:f 过小训练进度结构性缓慢,f 过大因 first-stage 信息损失保真度早期停滞;复杂数据集甜区在 f=4/8,较简单数据可用更高 f 换采样速度。
  • CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
  • CLM-018 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
  • CLM-020 likelihood-based 目标的 mode-covering 行为在 Precision/Recall 上系统性地优于 GAN(逐数据集、针对对抗基线),支持其分布覆盖优势的指标层证据;同口径下 LDM 于 CelebA-HQ 取得新 SOTA FID,其余数据集与最强 GAN/扩散竞争。
  • CLM-021 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
  • CLM-022 对密集条件 i2i 任务,latent 扩散配方同时给出感知质量与效率收益:(SR) LDM-SR 在感知指标上胜过专用像素扩散 SR3 与回归基线,但 PSNR/SSIM 由回归基线占先;(Inpainting) latent 化显著提吞吐并改善 FID,分布级质量超专用 SOTA 修复器 LaMa 而 LPIPS 略高。
  • CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。
  • CLM-025 同一 diffusion 骨干下,稠密概率性 cost 网格引导促成平滑、预见性的避障;稀疏实例级引导即使供给 oracle 邻车轨迹仍诱发末期突变机动并损害舒适度——避障行为质量由引导信息形态决定。
  • CLM-026 nuPlan 训练的模型零样本迁移 interPlan:相对共享生成管线的 Diffusion Planner 大幅领先,增益集中于安全维度(碰撞避免、TTC),progress/speed-limit 类项持平或微降;优势依场景类型非全域均匀。
  • CLM-027 零样本迁移真实无人机记录的密集城市交通(DeepScenario,NR):安全与路线推进增益保持,碰撞避免与推进维度大幅超过 Diffusion Planner、推进维度反超规则基线 PDM-Closed;drivable area 与 driving direction 非最优。
  • CLM-031 去掉邻车历史输入的 history-free 变体在 reactive/interactive 闭环下反而更优,且加事后规则精修后的增益依赖远小于稀疏引导对照(作者推断);该优势严格限于 reactive/interactive 设定,NR 下不成立。
  • CLM-032 稠密网格引导是纯推理期模块:占据预测器与生成骨干分开训练、仅在推理耦合,不重训不改骨干即可注入解析梯度,且部分替代事后规则精修(作者推断)。
  • CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
  • SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。
  • SYN-001 co-inputs DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
  • SYN-003 co-inputs G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。