PPR-2501.15564
Paper
Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
| id | |
|---|---|
| updated | |
| type | paper |
| title | Diffusion-Based Planning for Autonomous Driving with Flexible Guidance |
| alias | Diffusion Planner, DP |
| authors | Yinan Zheng, Ruiming Liang, Kexin Zheng, Jinliang Zheng, Liyuan Mao, Jianxiong Li, Weihao Gu, Rui Ai, Shengbo Eben Li, Xianyuan Zhan, Jingjing Liu |
| venue | ICLR 2025 |
| arxiv | 2501.15564 |
| version | arXiv:2501.15564v2 |
| source-hash | sha256:8111ca0ed550fde0497e850237985f7abdfa3dfe04b4238ff021db9498464564 |
| tier | 1 |
| lifecycle | FORMALIZED |
| epistemic | n/a |
| ingested | 2026-09-07 |
| local-formalization | ./FRM-2501.15564.md |
定位
G2DP(PPR-2606.26017)的直接基线与共享生成管线来源(FRM-2606.26017 AX-6 点名的基线配方):G2DP 的稀疏引导臂按本方案实现(EVI-025),nuPlan/interPlan/DeepScenario 三基准主表均以其为对照(EVI-024/026/027)。同时它自身是“flexible guidance”扩散规划器——引导经 diffusion posterior sampling(Eq. 8,免训练、用 \(\mu_\theta\) 近似能量)注入可微能量函数(collision / drivable area / target speed / comfort),——这使它成为 CLM-032(推理期正交性)、CLM-025(稠密 vs 稀疏模态)与 DiT(CPT-001)的 CLM-012(推理期注入强度非平凡)的文献级验证第二来源。
架构:DiT 骨干(diffusion transformer,CPT-001),联合生成 ego + M 邻车未来轨迹(task redefinition,Eq. 5),MLP-Mixer 编码历史/车道向量,导航信息经 adaLN(DIS-002 路由至 CPT-007)注入;DPM-Solver++(CPT-030,族基座 CPT-029)采样 + low-temperature sampling,~20 Hz 推理。nuPlan(Val14/Test14/Test14-hard)闭环 SOTA(learning-based 内;+refine 后超 rule-based),另发布 200h 配送车数据集验证迁移性。
引用数 4(Semantic Scholar,查询日期 2026-09-07,G2DP 引用图内)。引用侧翼价值:其 references 含 dhariwal2021diffusion、chung2022diffusion(DPS)等引导谱系锚点。
与本库对象的边
关联(43)
- PPR-2105.05233 Diffusion Models Beat GANs on Image Synthesis
- PPR-2205.09991 Planning with Diffusion for Flexible Behavior Synthesis
- PPR-2206.00927 DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
- PPR-2209.14687 Diffusion Posterior Sampling for General Noisy Inverse Problems
- PPR-2211.01095 DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
- PPR-2306.03083 MotionDiffuser: Controllable Multi-Agent Motion Prediction using Diffusion
- PPR-2306.07962 Parting with Misconceptions about Learning-based Vehicle Motion Planning
- PPR-2309.10443 Rethinking Imitation-based Planner for Autonomous Driving(PlanTF)
- PPR-2510.11083 Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- BMK-003 “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”
- COD-003 Diffusion-Planner — Diffusion Planner 官方实现(ZhengYinan-AIR)
- FRM-2309.10443 PlanTF(Cheng 等, CoRL 2023)五层重建:核心是 hidden imitation gap——完美模仿的 log replay 经 LQR 执行后在 Test14-hard 上掉 5.65(TH-1),说明执行链偏差是学习系闭环失败的构成性成分;Test14-random/hard 与 1M 帧训练 split 的定义亦出自本文。
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- FRM-2606.26017 G2DP 五层重建:核心对象是 CPT-013 时空代价体(占据概率栅格 × 路线进度图融合)在推理期的可微引导;公理层为能量重加权目标分布、Top-K 车体聚合与末段注入等六个作者前提;论证主干是 Table 4 在同一 DiT 骨干下隔离『稠密网格 vs 稀疏实例』的引导模态消融(稀疏臂按 PPR-2501.15564 附录 C 实现、以 oracle 邻车供给)。
- CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
- CLM-025 同一 diffusion 骨干下,稠密概率性 cost 网格引导促成平滑、预见性的避障;稀疏实例级引导即使供给 oracle 邻车轨迹仍诱发末期突变机动并损害舒适度——避障行为质量由引导信息形态决定。
- CLM-026 nuPlan 训练的模型零样本迁移 interPlan:相对共享生成管线的 Diffusion Planner 大幅领先,增益集中于安全维度(碰撞避免、TTC),progress/speed-limit 类项持平或微降;优势依场景类型非全域均匀。
- CLM-031 去掉邻车历史输入的 history-free 变体在 reactive/interactive 闭环下反而更优,且加事后规则精修后的增益依赖远小于稀疏引导对照(作者推断);该优势严格限于 reactive/interactive 设定,NR 下不成立。
- CLM-032 稠密网格引导是纯推理期模块:占据预测器与生成骨干分开训练、仅在推理耦合,不重训不改骨干即可注入解析梯度,且部分替代事后规则精修(作者推断)。
- CLM-033 闭环 diffusion 规划的质量瓶颈在结构设计(联合生成/起点约束/导航 adaLN 专门架构)而非 diffusion 范式本身:专门设计免精修达学习型类内最好成绩,且大幅优于套壳 diffusion 方法;对规则/混合类整体优势仅经 w/ refine. 变体成立(作者主张)。
- CLM-034 把规划与预测统一重定义为 future trajectory generation(ego 与 M 辆邻车同一扩散损失联合生成)后,协同行为由联合分布建模自然涌现,无需额外损失函数或专用子模块——从架构推导+定性案例+M 消融旁证,非严格归因(作者推断)。
- CLM-035 训练后行为对齐可经 DPS 免训练实现:能量重加权目标 p0 ∝ q0·e^{−E} 下,用 μ_θ 近似后验期望直接过可微能量函数取梯度修正分数,免 classifier 训练;多种能量函数(目标速度/舒适/碰撞/可行驶区)推理期自由组合(案例级证据,无量化消融)。
- CLM-037 数据管线各件是独立承重件:数据增强、未来轨迹插值、z-score 归一化各自剔除均显著降分;ego 当前状态含速度/加速度会诱发 shortcut 而损害规划,直接剔除优于 state-dropout 缓解——shortcut 机制解释是作者叙述,非消融隔离的结论。
- CLM-038 无基准特化组件的规划器跨驾驶风格迁移保持:配送车(保守风格、非机动车道、密集交互)数据集上重训后取得最高闭环分,而含 nuPlan 特化设计(参考线、crosswalk 适配)的基线(PDM/GameFormer/PLUTO)掉分——迁移优势归因依赖作者解释,未经消融隔离。
- EVI-024 Table 1:G2DP 系居纯 IL planner 首位,Test14-hard R 77.61(+7.2 over Flow Planner,+8.4 over Diffusion Planner)。
- EVI-025 Table 4:Grid +3.35 score/+3.59 collision/+4.94 TTC;Sparse(Oracle) −1.96 score/−10.13 comfort/+0.64 collision。稀疏臂按 PPR-2501.15564 附录 C 式 10 的实例级有向距离能量实现,与稠密臂在信号形态与信息内容两轴同时不同(评注已补)。
- EVI-026 Tables 2–3:interPlan 零样本 G2DP† 62.55(+9.65),collision +10.15、TTC +10.75;progress/speed limit 略降。
- EVI-027 Table 5:G2DP 较 DP collision +11.0、progress +10.5、TTC +6.7;progress/along-route 超 PDM-Closed。
- EVI-031 Table 1/2 + 正文:G2DP† reactive +3.7、interPlan +0.81、精修依赖 +4.1 vs DP +12.8。
- EVI-032 Table 1:免精修在学习型类内 6 列中 5 列最高(Test14 NR 除外);w/ refine. 在 Val14/Test14 双模式超规则/混合类并部分超 Log-replay,唯 Test14-hard NR 78.87 低于 PLUTO 80.08。
- EVI-033 Table 8:套壳 diffusion 方法脱精修即大跌(Diffusion-es w/o LLM ~50 vs w/ LLM 92;STR2 w/o refine. 65.16 且推理 >11s),Diffusion Planner 89.87/75.99/89.19、推理 0.04s。
- EVI-034 Fig. 4:邻车预测准确 + ego 平滑让速,对比基线轨迹不平滑/候选多数低质量;Fig. 5:联合预测邻车过多引入噪声降分,但多数 M 取值仍优于 PlanTF。
- EVI-035 引导案例:遮蔽车道限速后仅靠 target-speed 引导即可贴合 10–14 m/s 目标区间且速度过渡平滑;comfort 叠加 collision 可并用;collision-only 驶离路面避让、叠加 drivable 后保路面且保安全。
- EVI-036 Fig. 7:低温度采样增强轨迹稳定性、步数在 DPM-Solver++(CPT-030)下稳健;w/ refine. 用更低温度(0.1 vs 0.5)以利精修判断——方法使用边界面,非引导窗口消融。
- EVI-037 Table 7:base 89.19;w/o augmentation 76.53(−12.66)、w/o interpolation 83.78(−5.41)、w/o z-score 85.02(−4.17);ego 状态 w/ ego state 78.65、w/ SDE 82.90、w/o current state 81.11。
- EVI-038 Table 2:配送车数据集上 Diffusion Planner 92.08 全场最高(PlanTF 90.89、PLUTO 83.49、PDM-Closed 80.95、GameFormer w/o refine. 22.41);nuPlan-tailored 基线掉分、本方案保持。
- CPT-001 Diffusion Transformer (DiT)
- CPT-007 adaptive layer norm (adaLN)
- CPT-029 DPM-Solver
- CPT-030 DPM-Solver++
- SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。
- DIS-002 术语 adaLN 的两种读法路由:vanilla adaLN(CPT-007)与其零初始化特化 adaLN-Zero(CPT-002)。