PPR-2512.07745
Paper
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving |
| authors | Jialv Zou, Shaoyu Chen, Bencheng Liao, Zhiyu Zheng, Yuehao Song, Lefei Zhang, Qian Zhang, Wenyu Liu, Xinggang Wang |
| venue | arXiv:2512.07745(CVPR 2026 投稿格式) |
| arxiv | 2512.07745 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2512.07745v1 |
| source-hash | sha256:2eba27ea54681f14ce093cb81621ac4e805a019511465eea7d9ecebf700403bd |
| admitted-under | U0-user-directive |
| admission-note | 用户 2026-09-10 指令性准入(D18 U0):Diffusion Drive 分支的续作,与 v1 构成同一设计的演化对,是库内 RL×扩散规划线的锚点。 |
定位
Zou 等(2026,华中科技大学 / Horizon Robotics / 武汉大学)提出 DiffusionDriveV2。问题承接 DiffusionDrive(PPR-2411.15139):其 GMM 先验用多条代表不同驾驶意图的锚轨迹划分动作空间以保证多模,但训练目标(在整个混合模型上最大化专家轨迹似然)在实践中被简化为只优化最接近专家的那一个正模式,负模式缺乏显式约束。结果是模型同时产出高质量轨迹与大量无约束、低质量、甚至碰撞的轨迹,即“多样性 vs 一致高质量”的两难。
论文把该困境归因于模仿学习(IL)范式:IL 只约束单一正模式。强化学习(RL)提供探索-约束范式——对所有模式施加目标对齐约束(奖励期望行为、惩罚负模式中的不安全动作)以抬高下界,同时推动探索更广动作空间以抬高上界。但把 GRPO 直接迁移到锚定截断扩散模型有特殊问题:每个预定义锚代表一种驾驶意图,若在不同意图的轨迹之间做优势估计(左转 vs 直行),会破坏多模、加剧模式坍缩。论文据此设计锚内(intra-anchor)GRPO 与锚间截断(inter-anchor truncated)GRPO,分别阻止跨意图比较、提供稳定的全局视角;并以尺度自适应乘性噪声替代加性噪声做探索,保持轨迹平滑与连贯。
方法(机制要点)
- 探索噪声:尺度自适应乘性噪声用于扩展探索,避免加性噪声破坏轨迹平滑性;探索所得轨迹仍须满足物理可执行性。
- 锚内 GRPO:组优势估计只在同一个锚产生的一组样本内进行,阻断不同驾驶意图之间的优劣比较(左转与直行本应共存)。
- 锚间截断 GRPO:跨锚提供全局视角,并对跨意图比较做截断,稳定训练。
- 与 GRPO 迁移的关系:论文称是首个成功把 GRPO 迁移到截断扩散模型的工作,面向 GMM 框架内无法直接做跨模式组优势估计的问题。
实验结果(摘要)
- NAVSIM v1
navtest:91.2 PDMS(口径见 CPT-017;对齐 ResNet-34,21.8M 参数),比 DiffusionDrive 高 3.1 PDMS、EP 高 5.3,比同为 RL 的 DIVER 高 2.9;论文称其小骨干优于使用更大 V2-99 骨干的 GoalFlow 与 Hydra-MDP。 - NAVSIM v2
navtest:85.5 EPDMS(论文自报表格口径)。 - 论文报告在轨迹多样性与一致高质量之间取得最佳权衡。
- 库内数值分歧留档:DA-WAM(PPR-2608.19085)对照表把 DiffusionDriveV2 的 EPDMS 列为 87.5,与本论文自报 85.5 不一致(评测设置/版本口径待 reconciliation 核)。
与本库的关系
- 准入身份:U0-user-directive(用户 2026-09-10 指令性准入)。
- 谱系定位:DiffusionDrive(PPR-2411.15139)的直接续作,把 IL 训练的截断扩散换成 RL 约束/探索版本。RL 侧上游接 GRPO(DeepSeek-R1)、DPPO(PPR-2409.00588);同向工作有 DIVER(PPR-2507.04049,TPAMI'26)、ResAD(PPR-2510.08562)、ReCogDrive(PPR-2506.08052)。评测口径锚定 BMK-006。
承重关系
- provenance:v1 tarball sha256
2eba27ea…0403bd,缓存cache/sources/2512.07745/。
关联(14)
- PPR-2409.00588 Diffusion Policy Policy Optimization
- PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
- PPR-2502.13144 RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
- PPR-2503.05689 GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
- PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
- PPR-2510.08562 ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
- PPR-2605.15120 CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
- PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2503.12820 Hydra-MDP++ 五层重建(骨架):核心对象是在固定离散规划词表上的多教师蒸馏——700K 轨迹 K-means 得词表,分类式解码器先模仿日志轨迹,再以离线仿真的 PDM 指标系统为教师做多头蒸馏,教师指标在传统 NAVSIM 项外扩入红绿灯合规(TL)、车道保持(LK)与扩展舒适(EC);公理层含『模仿不足需与环境关联』与『固定动作空间可离线生成度量真值』。
- FRM-2512.07745 DiffusionDriveV2 五层重建(骨架):核心对象是把去噪链视为 MDP 后用 RL 约束/探索的截断扩散生成器——锚内 GRPO 做组内优势、锚间截断 GRPO 负优势归零且碰撞罚一、尺度自适应乘性探索噪声;公理层含『IL 只监督单一正模式致负模式无约束』与『不同意图的锚不应直接比较优劣』;论证主干是多样性-质量权衡的对照与消融。
- CPT-017 PDM Score (PDMS)
- IDX-001 NAVSIM 规划线