Research KB 登录

PPR-2501.15564 Paper

Diffusion-Based Planning for Autonomous Driving with Flexible Guidance

id
updated
type paper
title Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
alias Diffusion Planner, DP
authors Yinan Zheng, Ruiming Liang, Kexin Zheng, Jinliang Zheng, Liyuan Mao, Jianxiong Li, Weihao Gu, Rui Ai, Shengbo Eben Li, Xianyuan Zhan, Jingjing Liu
venue ICLR 2025
arxiv 2501.15564
version arXiv:2501.15564v2
source-hash sha256:8111ca0ed550fde0497e850237985f7abdfa3dfe04b4238ff021db9498464564
tier 1
lifecycle FORMALIZED
epistemic n/a
ingested 2026-09-07
local-formalization ./FRM-2501.15564.md

定位

G2DP(PPR-2606.26017)的直接基线与共享生成管线来源(FRM-2606.26017 AX-6 点名的基线配方):G2DP 的稀疏引导臂按本方案实现(EVI-025),nuPlan/interPlan/DeepScenario 三基准主表均以其为对照(EVI-024/026/027)。同时它自身是“flexible guidance”扩散规划器——引导经 diffusion posterior sampling(Eq. 8,免训练、用 \(\mu_\theta\) 近似能量)注入可微能量函数(collision / drivable area / target speed / comfort),——这使它成为 CLM-032(推理期正交性)、CLM-025(稠密 vs 稀疏模态)与 DiT(CPT-001)的 CLM-012(推理期注入强度非平凡)的文献级验证第二来源。

架构:DiT 骨干(diffusion transformer,CPT-001),联合生成 ego + M 邻车未来轨迹(task redefinition,Eq. 5),MLP-Mixer 编码历史/车道向量,导航信息经 adaLN(DIS-002 路由至 CPT-007)注入;DPM-Solver++(CPT-030,族基座 CPT-029)采样 + low-temperature sampling,~20 Hz 推理。nuPlan(Val14/Test14/Test14-hard)闭环 SOTA(learning-based 内;+refine 后超 rule-based),另发布 200h 配送车数据集验证迁移性。

引用数 4(Semantic Scholar,查询日期 2026-09-07,G2DP 引用图内)。引用侧翼价值:其 references 含 dhariwal2021diffusion、chung2022diffusion(DPS)等引导谱系锚点。

与本库对象的边

关联(43)

  • PPR-2105.05233 Diffusion Models Beat GANs on Image Synthesis
  • PPR-2205.09991 Planning with Diffusion for Flexible Behavior Synthesis
  • PPR-2206.00927 DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
  • PPR-2209.14687 Diffusion Posterior Sampling for General Noisy Inverse Problems
  • PPR-2211.01095 DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
  • PPR-2306.03083 MotionDiffuser: Controllable Multi-Agent Motion Prediction using Diffusion
  • PPR-2306.07962 Parting with Misconceptions about Learning-based Vehicle Motion Planning
  • PPR-2309.10443 Rethinking Imitation-based Planner for Autonomous Driving(PlanTF)
  • PPR-2510.11083 Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
  • PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
  • BMK-003 “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”
  • COD-003 Diffusion-Planner — Diffusion Planner 官方实现(ZhengYinan-AIR)
  • FRM-2309.10443 PlanTF(Cheng 等, CoRL 2023)五层重建:核心是 hidden imitation gap——完美模仿的 log replay 经 LQR 执行后在 Test14-hard 上掉 5.65(TH-1),说明执行链偏差是学习系闭环失败的构成性成分;Test14-random/hard 与 1M 帧训练 split 的定义亦出自本文。
  • FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
  • FRM-2606.26017 G2DP 五层重建:核心对象是 CPT-013 时空代价体(占据概率栅格 × 路线进度图融合)在推理期的可微引导;公理层为能量重加权目标分布、Top-K 车体聚合与末段注入等六个作者前提;论证主干是 Table 4 在同一 DiT 骨干下隔离『稠密网格 vs 稀疏实例』的引导模态消融(稀疏臂按 PPR-2501.15564 附录 C 实现、以 oracle 邻车供给)。
  • CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
  • CLM-025 同一 diffusion 骨干下,稠密概率性 cost 网格引导促成平滑、预见性的避障;稀疏实例级引导即使供给 oracle 邻车轨迹仍诱发末期突变机动并损害舒适度——避障行为质量由引导信息形态决定。
  • CLM-026 nuPlan 训练的模型零样本迁移 interPlan:相对共享生成管线的 Diffusion Planner 大幅领先,增益集中于安全维度(碰撞避免、TTC),progress/speed-limit 类项持平或微降;优势依场景类型非全域均匀。
  • CLM-031 去掉邻车历史输入的 history-free 变体在 reactive/interactive 闭环下反而更优,且加事后规则精修后的增益依赖远小于稀疏引导对照(作者推断);该优势严格限于 reactive/interactive 设定,NR 下不成立。
  • CLM-032 稠密网格引导是纯推理期模块:占据预测器与生成骨干分开训练、仅在推理耦合,不重训不改骨干即可注入解析梯度,且部分替代事后规则精修(作者推断)。
  • CLM-033 闭环 diffusion 规划的质量瓶颈在结构设计(联合生成/起点约束/导航 adaLN 专门架构)而非 diffusion 范式本身:专门设计免精修达学习型类内最好成绩,且大幅优于套壳 diffusion 方法;对规则/混合类整体优势仅经 w/ refine. 变体成立(作者主张)。
  • CLM-034 把规划与预测统一重定义为 future trajectory generation(ego 与 M 辆邻车同一扩散损失联合生成)后,协同行为由联合分布建模自然涌现,无需额外损失函数或专用子模块——从架构推导+定性案例+M 消融旁证,非严格归因(作者推断)。
  • CLM-035 训练后行为对齐可经 DPS 免训练实现:能量重加权目标 p0 ∝ q0·e^{−E} 下,用 μ_θ 近似后验期望直接过可微能量函数取梯度修正分数,免 classifier 训练;多种能量函数(目标速度/舒适/碰撞/可行驶区)推理期自由组合(案例级证据,无量化消融)。
  • CLM-037 数据管线各件是独立承重件:数据增强、未来轨迹插值、z-score 归一化各自剔除均显著降分;ego 当前状态含速度/加速度会诱发 shortcut 而损害规划,直接剔除优于 state-dropout 缓解——shortcut 机制解释是作者叙述,非消融隔离的结论。
  • CLM-038 无基准特化组件的规划器跨驾驶风格迁移保持:配送车(保守风格、非机动车道、密集交互)数据集上重训后取得最高闭环分,而含 nuPlan 特化设计(参考线、crosswalk 适配)的基线(PDM/GameFormer/PLUTO)掉分——迁移优势归因依赖作者解释,未经消融隔离。
  • EVI-024 Table 1:G2DP 系居纯 IL planner 首位,Test14-hard R 77.61(+7.2 over Flow Planner,+8.4 over Diffusion Planner)。
  • EVI-025 Table 4:Grid +3.35 score/+3.59 collision/+4.94 TTC;Sparse(Oracle) −1.96 score/−10.13 comfort/+0.64 collision。稀疏臂按 PPR-2501.15564 附录 C 式 10 的实例级有向距离能量实现,与稠密臂在信号形态与信息内容两轴同时不同(评注已补)。
  • EVI-026 Tables 2–3:interPlan 零样本 G2DP† 62.55(+9.65),collision +10.15、TTC +10.75;progress/speed limit 略降。
  • EVI-027 Table 5:G2DP 较 DP collision +11.0、progress +10.5、TTC +6.7;progress/along-route 超 PDM-Closed。
  • EVI-031 Table 1/2 + 正文:G2DP† reactive +3.7、interPlan +0.81、精修依赖 +4.1 vs DP +12.8。
  • EVI-032 Table 1:免精修在学习型类内 6 列中 5 列最高(Test14 NR 除外);w/ refine. 在 Val14/Test14 双模式超规则/混合类并部分超 Log-replay,唯 Test14-hard NR 78.87 低于 PLUTO 80.08。
  • EVI-033 Table 8:套壳 diffusion 方法脱精修即大跌(Diffusion-es w/o LLM ~50 vs w/ LLM 92;STR2 w/o refine. 65.16 且推理 >11s),Diffusion Planner 89.87/75.99/89.19、推理 0.04s。
  • EVI-034 Fig. 4:邻车预测准确 + ego 平滑让速,对比基线轨迹不平滑/候选多数低质量;Fig. 5:联合预测邻车过多引入噪声降分,但多数 M 取值仍优于 PlanTF。
  • EVI-035 引导案例:遮蔽车道限速后仅靠 target-speed 引导即可贴合 10–14 m/s 目标区间且速度过渡平滑;comfort 叠加 collision 可并用;collision-only 驶离路面避让、叠加 drivable 后保路面且保安全。
  • EVI-036 Fig. 7:低温度采样增强轨迹稳定性、步数在 DPM-Solver++(CPT-030)下稳健;w/ refine. 用更低温度(0.1 vs 0.5)以利精修判断——方法使用边界面,非引导窗口消融。
  • EVI-037 Table 7:base 89.19;w/o augmentation 76.53(−12.66)、w/o interpolation 83.78(−5.41)、w/o z-score 85.02(−4.17);ego 状态 w/ ego state 78.65、w/ SDE 82.90、w/o current state 81.11。
  • EVI-038 Table 2:配送车数据集上 Diffusion Planner 92.08 全场最高(PlanTF 90.89、PLUTO 83.49、PDM-Closed 80.95、GameFormer w/o refine. 22.41);nuPlan-tailored 基线掉分、本方案保持。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-029 DPM-Solver
  • CPT-030 DPM-Solver++
  • SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。
  • DIS-002 术语 adaLN 的两种读法路由:vanilla adaLN(CPT-007)与其零初始化特化 adaLN-Zero(CPT-002)。