PPR-2507.04049
Paper
DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving |
| authors | Ziying Song, Lin Liu, Hongyu Pan, Bencheng Liao, M. Guo, Lei Yang |
| venue | IEEE TPAMI (arXiv:2507.04049) |
| arxiv | 2507.04049 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2507.04049v5 |
| source-hash | sha256:af89ab8e7a0c32195d6f91b1dceef4581e59c234012b9f2bec4a032bbb29556f |
| admitted-under | A2-direct-edge |
| admission-note | 被 DiffusionDriveV2(PPR-2512.07745)直接对照(其 91.2 PDMS 比 DIVER 高 2.9)并被 DA-WAM 列入 NAVSIM v1 对照。 |
定位
Song 等(TPAMI 2025)提出 DIVER。论文的出发点是:端到端驾驶方法多依赖单条专家示范的模仿学习,倾向保守、同质的驾驶行为,在复杂真实场景中泛化困难。DIVER 把基于扩散的多模轨迹生成与强化学习结合以产生多样、安全且朝向目标的轨迹:先以地图元素与周围智能体为条件,从每条真值参考轨迹生成多条参考轨迹,突破单模模仿的固有限制;再把扩散过程视为随机策略,用组相对策略优化(GRPO)目标优化轨迹级奖励(涵盖多样性与安全),直接缓解模式坍缩、增强避撞,并鼓励超越专家示范的探索与物理可行规划。
与本库的关系
- 准入身份:A2-direct-edge(被 DiffusionDriveV2、DA-WAM 直接引用)。
- 谱系定位:扩散 × RL 线。与 DiffusionDriveV2(PPR-2512.07745)同向(后者针对锚定截断扩散设计锚内/锚间 GRPO),与 ReCogDrive(PPR-2506.08052)的 RL 微调、CLOVER(PPR-2605.15120)的评估器子分数蒸馏构成“模仿之外如何纠正规划器”的三种机制。评测锚定 BMK-006。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(14)
- PPR-2409.00588 Diffusion Policy Policy Optimization
- PPR-2502.13144 RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
- PPR-2503.05689 GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
- PPR-2503.11650 Centaur: Robust End-to-End Autonomous Driving with Test-Time Training
- PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
- PPR-2605.15120 CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
- PPR-2605.19771 Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2409.00588 DPPO 五层重建(骨架):核心对象是“用策略梯度微调扩散策略”的算法框架与最佳实践——把去噪过程视为多步 MDP 并嵌入环境 MDP,构成一个更大的“扩散策略 MDP”,使每步策略似然成为可解析求值的 Gaussian 似然,从而可直接套用任意策略梯度方法(并以 PPO 实例化);论文报告 RL 微调与扩散参数化之间存在协同,带来结构化、on-manifold 的探索、稳定训练与策略鲁棒性。
- FRM-2502.13144 RAD 五层重建(骨架):核心对象是以 3DGS 构建光真实数字副本、在其上做闭环强化学习的端到端驾驶框架——策略通过大规模试错探索状态空间、学习分布外场景;奖励由动态碰撞、静态碰撞、位置偏离与朝向偏离四项构成(任一触发即终止 episode,因事后 3DGS 渲染的传感数据含噪);训练分感知预训练、规划预训练(IL 初始化以防 RL 冷启动不稳)与强化后训练(RL 引导安全、IL 作正则贴合人类)三阶段。
- FRM-2507.04049 DIVER 五层重建(骨架):核心对象是以强化学习引导扩散生成多模轨迹的框架——策略感知扩散生成器(PADG)以地图元素与周围智能体为条件、由单一真值轨迹与轨迹锚引导生成“多个参考真值”以覆盖不同驾驶风格,再把扩散过程当作随机策略用 GRPO 目标的轨迹级多样性/安全奖励去引导,以破解模仿学习固有的模式坍缩;并针对 L2 类开环指标无法刻画多样性提出多样性度量。
- FRM-2601.05083 Driving on Registers 五层重建(骨架):核心对象是极简纯 transformer 的端到端驾驶架构——以“相机感知的 register token”(每相机 R 个 register、得 N×R 个场景 token)把多相机特征压成紧凑场景表示、仅用 LoRA 微调预训练 ViT,再由两个轻量 transformer 解码器先生成候选轨迹、再模仿 oracle 打可解释子分数(安全/舒适/效率),从而支持推理期的行为条件驾驶。
- IDX-001 NAVSIM 规划线