| SRC-002 | 拥堵交通态的实证观测与微观仿真(Treiber et al., PRE 2000);G2DP 引用的交通流学科根源。 · [body] 对拥堵交通状态的实证观测与微观仿真(treiber, hennecke & helbing, phys. rev. e 2000):系统刻画不同交通相并建立微观动力学 [body] | Source extracted n/a |
| SRC-1503.03585 | 以非平衡热力学解释深度无监督学习(Sohl-Dickstein et al., ICML 2015);扩散的概率奠基。 · [body] 以非平衡热力学解释深度无监督学习(sohl-dickstein et al., icml 2015):把训练刻画为自由能下降的渐进去噪,沟通统计物理与学习动力学。 * [body] | Source extracted n/a |
| SRC-1505.04597 | U-Net 语义分割网络(Ronneberger et al., MICCAI 2015);G2DP 占据预测网络的 backbone。 · [body] 经典语义分割网络(ronneberger et al., miccai 2015):对称编解码 + 跳跃连接的全卷积结构,以极少参数在医学影像上达到高分辨率分割精度。 [body] | Source extracted n/a |
| SRC-1807.00412 | 一天内学会驾驶的端到端学习(Kendall et al., ICRA 2019);真实城市道路少样本驾驶策略。 · [body] day-long 端到端驾驶学习(kendall, hawke, janz et al., icra 2019):在真实城市道路上采集少量驾驶视频,数小时内训练出可泛 [body] | Source extracted n/a |
| SRC-1807.08048 | 百度 Apollo EM Motion Planner(工业量产运动规划模块);G2DP 的工业规划参照。 · [body] 百度 apollo 的运动规划器(em motion planner):工业界量产自动驾驶系统中采用的规划模块。 **与 g2dp 的关系(src-2606.2601 [body] | Source extracted n/a |
| SRC-1812.03079 | 以模仿学习训练驾驶策略(Bansal et al., RSS 2019):学最佳示范、合成最坏失败。 · [body] 以模仿学习训练驾驶策略(bansal, krizhevsky & ogale, rss 2019):只模仿表现最好的人类示范,并合成最差失败情形扩充训练数据。 **与 [body] | Source extracted n/a |
| SRC-2006.11239 | 去噪扩散概率模型(DDPM)奠基作(Ho et al., NeurIPS 2020);扩散生成的马尔可夫链框架。 · [body] 去噪扩散概率模型的奠基之作(ho, jain & abbeel, neurips 2020):把图像合成刻画为逐步加噪/去噪的扩散过程,奠定其后各类扩散应用的概率基础 [body] | Source extracted n/a |
| SRC-2105.05233 | 扩散超越 GAN 的系统改进(Dhariwal & Nichol, NeurIPS 2021);改进采样器与架构。 · [body] 对扩散采样与生成质量的系统改进(dhariwal & nichol, neurips 2021):引入改进采样器与架构调整,使扩散在图像合成上超越 gan。 **与 [body] | Source extracted n/a |
| SRC-2106.11810 | 自动驾驶闭环机器学习规划基准 nuPlan(Caesar et al.);G2DP 的主评测基准。 · [body] 面向自动驾驶的闭环机器学习规划基准(caesar et al.):提供大规模真实城市数据集与标准化的非反应/反应两档评测协议。 **与 g2dp 的关系(src-26 [body] | Source extracted n/a |
| SRC-2112.10752 | Latent Diffusion Model 原始论文(Rombach et al.);Stable Diffusion 学术源头,DiT 所引『latent diffusion』。 · [body] rombach 等人的 latent diffusion model(ldm)——即 src-2212.09748(dit)所引用的 “latent diffusio [body] | Source formalized n/a |
| SRC-2205.09991 | 扩散规划方法(Janner et al., ICML 2022);G2DP 的『扩散+引导』谱系近亲。 · [body] 以扩散模型做灵活行为合成的规划方法(janner, du, tenenbaum & levine, icml 2022):把轨迹规划表述为扩散采样过程,并通过条件引导 [body] | Source extracted n/a |
| SRC-2206.00927 | DPM-Solver(Lu et al., NeurIPS 2022):约 10 步内求解扩散 ODE 加速采样;G2DP 的 ODE 采样器。 · [body] 面向扩散采样的高效 ode 求解器(lu et al., neurips 2022):dpm-solver 把所需采样步数压到约 10 步以内,显著加速推理。 **与 [body] | Source extracted n/a |
| SRC-2207.12598 | Classifier-Free Guidance 提出作(Ho, arXiv 2022);条件扩散的标准引导做法。 · [body] 提出 classifier-free guidance(ho, arxiv 2022):统一并简化各类条件生成场景下的引导公式,使之成为扩散条件控制的标准做法。 ** [body] | Source extracted n/a |
| SRC-2212.09748 | DiT 原始论文(Peebles & Xie, ICCV 2023):ViT 替换 LDM U-Net backbone,Gflops 视角的 scaling 研究。 · [body] dit 原始论文:以标准 vit 架构替换 latent diffusion 的 u-net backbone, 并以 gflops 为复杂度透镜系统研究其 scal [body] | Source formalized n/a |
| SRC-2306.07962 | 对基于学习的车辆运动规划的批判性分析(Dauner et al., CoRL 2023);澄清方法学误区。 · [body] 对基于学习的车辆运动规划进行批判性分析(dauner et al., corl 2023):梳理并澄清该领域中若干常见误解与评估偏倚。 **与 g2dp 的关系(sr [body] | Source extracted n/a |
| SRC-2601.04453 | 自动驾驶统一理解-规划-生成世界模型 UniDrive-WM(Xiong et al.);引用 G2DP 为相关工作。 · [body] 面向自动驾驶的统一理解—规划—生成世界模型(xiong et al.):在同一框架内同时处理场景理解、运动规划与视频生成。 **与 g2dp 的关系(src-2606 [body] | Source extracted n/a |
| SRC-2603.08199 | 基于时空融合的多面体 3D 多目标跟踪(Wu et al.);引用 G2DP 作参照。 · [body] 基于时空融合的多面体框架用于 3d 多目标跟踪(wu et al.):以凸多面体表达位置不确定性。 **与 g2dp 的关系(src-2606.26017)**:本工 [body] | Source extracted n/a |
| SRC-2604.04198 | 视频动作模型作零样本驱动器(Liu et al.);引用 G2DP 为扩散+稠密引导的规划思路。 · [body] 把视频动作模型当作零样本驱动器(liu et al.):以视频动作表征直接驱动规划,无需额外适配即可跨任务部署。 **与 g2dp 的关系(src-2606.2601 [body] | Source extracted n/a |
| SRC-2606.26017 | G2DP:时空占据栅格+路线进度融合为可微 cost volume,去噪末段注入引导,nuPlan 纯模仿 SOTA;本引用簇中心。 · [body] g2dp(grid-guided diffusion planning)——奔驰 / kit / tum / 图宾根联合提出:将 bev 未来占据概率栅格与导航路线进 [body] | Source extracted n/a |
| SRC-2607.13028 | 程序化驾驶仿真支撑大规模零演示自播放(Wu et al.);引用 G2DP 作对照。 · [body] 程序化驾驶仿真支撑的大规模零演示自播放(wu et al.):用过程式场景生成扩充自播放数据,降低对真实示教的依赖。 **与 g2dp 的关系(src-2606.26 [body] | Source extracted n/a |
| FRM-2112.10752 | LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。 · [overview] 本文件是 src-2112.10752(rombach 等,latent diffusion models,cvpr 2022) 的作者逻辑五层重建。论文的核 [body] | Formalization src-2112.10752 |
| FRM-2212.09748 | DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。 · [overview] 本文件是 src-2212.09748(peebles & xie, dit, iccv 2023)的作者逻辑 五层重建。论文的核心行动:以标准 vit 架构 [body] | Formalization src-2212.09748 |
| EVI-018 | 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。 · [result] 开启 cfg(s=1.5)前后: - **text-to-image(ms-coco, 250 步)**:ldm-kl-8 fid **23.35** → ldm [body] | Evidence src-2112.10752 |
| EVI-019 | 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-019)。 · [result] ms-coco 250 步 text-to-image(fid↓ / is↑): - cogview:**27.10** / 18.20(ar) - lafite [body] | Evidence src-2112.10752 |
| EVI-020 | 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。 · [result] fid↓ + precision↑ + recall↑(256²): - **celeba-hq**:vqgan+t 10.2;pggan 8.0;lsgm 7. [body] | Evidence src-2112.10752 |
| EVI-021 | §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。 · [result] ldm 以卷积滑窗方式越过训练分辨率: - semantic synthesis:256²(384² crops)训练,卷积评估可生成到 **~1024² / 兆 [body] | Evidence src-2112.10752 |
| EVI-022 | §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。 · [result] **sr(imagenet 4×, 256²,fid↓/is↑/psnr/ssim/lpips)**: - ldm-sr(169m, 100 步):fid **2 [body] | Evidence src-2112.10752 |
| EVI-023 | §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。 · [result] 论文自述两条硬局限: 1. **顺序采样仍慢于 gan**:ldm 虽比像素 dm 快(2.7× inpainting / 3.3× 采样),但本质是迭代去噪(d [body] | Evidence src-2112.10752 |
| VER-001 | 核验 CLM-001 DiT SOTA:Table 2/§5.1/App.A.1 数字(2.27、LDM-4-G 3.60、StyleGAN-XL 2.30)与 v2 源逐项一致,含审计修正史;scope 未超。supported。 · [checks] 1. **内部一致性**:命题三组数字(2.27、ldm-4-g 3.60、stylegan-xl 2.30) 与 evi-001 result 一一对应;"含 [body] | Verification |
| VER-002 | 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。 · [checks] 1. **内部一致性**:命题数字(19.47 / 25.21 / 26.14 / 35.24)与 evi-002 result 一致;"计算开销最低之一(118 [body] | Verification |
| VER-003 | 核验 CLM-003 Gflops-FID 标度:Fig.8/6 引用与 Table 4 十二变体数字(S/2 6.06G、B/4 5.56G 等)逐项核对一致,以'经验规律'限定未泛化。supported。 · [checks] 1. **内部一致性**:命题的两个断言(gflops 相近 → fid 相近;强负 相关)与 evi-003 result 一致,例子数字(6.06g/68.4 [body] | Verification |
| VER-004 | 核验 CLM-004 512 SOTA:Table 3(3.04/3.85/2.41)与 §5.1 512 段(3M 步、1024 tokens、524.6G)逐项一致。supported。 · [checks] 1. **内部一致性**:命题数字(3.04、adm-g+u 3.85、stylegan-xl 2.41) 与 evi-004 result 一致;"未超过 ga [body] | Verification |
| VER-005 | 核验 CLM-005 采样算力:§5.2 锚点(23.7 vs 25.9、15.2 vs 80.7 Tflops)与 Figure 10 一致,FID-10K 口径已声明。supported。 · [checks] 1. **内部一致性**:命题的锚点对照(xl/2@128 步 15.2 tflops fid-10k 23.7 优于 l/2@1000 步 80.7 tflop [body] | Verification |
| VER-006 | 核验 CLM-006 训练算力效率:Fig.9 XL-4→XL-2 交叉声明(~10^10 Gflops)与 §4.2 一致,x3 估算因子属 AX-7 约定。supported。 · [checks] 1. **内部一致性**:命题两个断言(等训练算力下大模型更 efficient; 同 gflops 预算下不同 patch size 曲线不同)与 evi-00 [body] | Verification |
| VER-007 | 核验 CLM-007 decoder 消融:Table 5(2.46/2.30/2.27)与 §A.4(encoder 相同、免重训互换、LDM decoder 下仍最优)一致。supported。 · [checks] 1. **内部一致性**:命题数字与 evi-007 result 一致;"差异存在但幅度 有限"与 table 5(fid 差 0.19)一致;"仍优于此前全部 [body] | Verification |
| VER-008 | 核验 CLM-008 subset-channel guidance:App.A.1(3ch@1.5→2.27、4ch@1.375→2.20、近似式)逐字核对一致,'近似'不确定性保留。supported。 · [checks] 1. **内部一致性**:命题的数字对(2.27 / 2.20)与近似关系式均与 evi-008 result 及 app. a.1 原文一致;"效果近似"的限定 [body] | Verification |
| VER-009 | 核验 CLM-009 架构论题:可检验部分(ViT 替换 U-Net 质量反升)与 Table 2/3/6 一致;'归纳偏置非关键'属作者诠释(非受控对比),按 A4 保留。partially-supported。 · [checks] 1. **内部一致性**:命题的可检验部分(标准 vit 可直接替换、同等 协议下质量更优)与 evi-009(table 2/3 + table 6 gflop [body] | Verification |
| VER-010 | 核验 CLM-010 配方稳定:§4.1 两引语(no loss spikes/did not tune)与 Table 4 超参列(lr 1e-4、batch 256)及 Fig.13 曲线一致。supported。 · [checks] 1. **内部一致性**:命题的配方清单(adamw、恒定 lr 1e-4、无 weight decay、无 warmup、无正则化、batch 256、ema [body] | Verification |
| VER-011 | 核验 CLM-011 patchify 标度:推导链(patchify→T×4→Gflops≥×4、参数不变)与 §3.2 一致,Table 4 实测 3.9–4.3× 逐行核对。supported。 · [checks] 1. **内部一致性**:命题的标度断言与 §3.2 原文("halving p will quadruple t, and thus at least quad [body] | Verification |
| VER-012 | 核验 CLM-012 CFG 梯度:Table 2/3 行内(256: 9.62/3.22/2.27;512: 12.03/4.64/3.04)逐格一致,scale 边界与质量-多样性权衡已记。supported。 · [checks] 1. **内部一致性**:命题的六个数字与 table 2/3 的 dit-xl/2 行 (无 g / -g cfg1.25 / -g cfg1.50)逐一对应; [body] | Verification |
| VER-013 | 两段分解核验:感知压缩 AE + 潜空间 DM 与 §1/§2.3/§2.4(Eq.4-5)一致,DiT FRM-2212.09748 AX-2 同向互证,scope 未超。supported。 · [checks] 1. **内部一致性**:命题"感知压缩(ae)+ 语义压缩(latent 上训 dm)"与 evi-013 result 的两段描述一一对应;kl/vq 两种正 [body] | Verification |
| VER-014 | 算力主张核验:271 vs 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94 与 compute_vs_fid 表逐项吻合,两 cfg 口径已分离。supported。 · [checks] 1. **内部一致性**:命题的"271 vs 916 v100-days(≈3.4×)""0.4 vs 0.12 samples/s(≈3.3×)""400m [body] | Verification |
| VER-015 | 重建核验:LDM f=8 R-FID 1.14 vs DALL·E 32.01 / VQGAN 4.98、f=2 0.16 与 Tab.423 一致,f=16 打平边界已声明。supported。 · [checks] 1. **内部一致性**:命题"2d-conv 容忍更低 f、重建更保真"与其三个数字 (ldm f=8 1.14、dall·e f=8 32.01、vqgan [body] | Verification |
| VER-016 | f 甜区核验:f=4/8 最优与 §4.1 消融、FID gap 38(LDM-1 vs LDM-8 @2M)正文引语一致,scope 限 ImageNet/2M/单 A100。supported。 · [checks] 1. **内部一致性**:命题的"f=1/2 慢、f=16/32 损、f=4/8 为甜区、fid gap 38" 与 evi-016 result 一致;gap [body] | Verification |
| VER-017 | 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。 · [checks] 1. **内部一致性**:命题对 cross-attention 机制的描述(q 来自 unet 中间 特征 φ_i(z_t),k/v 来自 τ_θ(y),att [body] | Verification |
| VER-018 | CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。 · [checks] 1. **内部一致性**:命题的"cfg 使 t2i fid 23.35→12.61、is 19.93→26.62、 imagenet 10.56→3.60(cf [body] | Verification |
| VER-019 | T2I 核验:1.45B LDM-KL-8-G 在 MS-COCO 250 步 FID 12.61/IS 26.62,与 GLIDE 12.24/Make-A-Scene 11.84 同量级(非最低),措辞如实。supported。 · [checks] 1. **内部一致性**:命题的"1.45b、ms-coco 250 步、fid 12.61、is 26.62、 与 glide 12.24 / make-a-s [body] | Verification |
| VER-020 | 无条件合成核验:CelebA-HQ 5.11 SOTA、FFHQ 4.98、LSUN-Bedrooms 2.95 vs ADM 1.90 与无条件表一致,SOTA 限 CelebA-HQ、P/R 逐数据集。supported。 · [checks] 1. **内部一致性**:命题的"celeba-hq 5.11 新 sota""ffhq/lsun 竞争""p/r 优于 gan"与 evi-020 result [body] | Verification |
| VER-021 | 大图核验:§4.3.2 卷积滑窗 + Fig. thicksample/text2img_conv 支持越训练分辨率至 ~1024²/兆像素,rescale+CFG 条件已声明。supported。 · [checks] 1. **内部一致性**:命题"密集条件 i2i 拼接注入 + 卷积滑窗越过训练分辨率 生成 ~1024²/兆像素"与 evi-021 result 一致——se [body] | Verification |
| VER-022 | i2i 核验:SR FID 2.8/2.4/4.4 胜 SR3、inpainting 2.7×提速/1.6×FID、胜 LaMa(用户 30.4/70.6、21.0/68.1)与表/正文逐项一致。supported。 · [checks] 1. **内部一致性**:命题的 sr(fid 2.8/2.4/4.4、胜 sr3)、inpainting (2.7×/1.6× vs 像素基线、fid 胜 la [body] | Verification |