PPR-2406.06978
Paper
Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
| id | |
|---|---|
| updated | |
| type | paper |
| title | Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation |
| authors | Zhenxin Li, Kailin Li, Shihao Wang, Shiyi Lan, Zhiding Yu, Yishen Ji |
| venue | arXiv:2406.06978 |
| arxiv | 2406.06978 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2406.06978v4 |
| source-hash | sha256:91bb1d06002af44c8b6f5b953c6a61c360c85e09e87eff1345c7ac60309763cb |
| admitted-under | A2-direct-edge |
| admission-note | 被 DiffusionDrive(PPR-2411.15139)作为挑战赛冠军对照、被 CLOVER(PPR-2605.15120)/DriveSuprim/GTRS/SparseDriveV2 大量引用与对照;NAVSIM 候选打分线的共同底座。 |
定位
Li 等(2024,NVIDIA)提出 Hydra-MDP。问题设定是:端到端规划若只模仿人类演示,无法直接学到规则式评估器(NAVSIM 的 PDMS(CPT-017))所衡量的安全与合规;而把规则式评估器直接接到推理端做非可微后处理,又会让“环境如何影响规划”这一知识停留在系统外部。Hydra-MDP 的做法是多教师蒸馏:以人类演示与规则式教师共同作为教师信号,训练一个带多头解码器的学生模型,让不同头分别对齐不同评估指标,从而在端到端网络中学会规则教师的偏好。论文称该方法在 NAVSIM 挑战赛中取得第一名。
方法(机制要点)
- 多教师:人类教师(演示轨迹)与规则式教师(规则评估器的分项偏好)共同提供监督。
- Hydra 多头解码器:一个学生骨干挂多个预测头,每个头面向一种评估指标(如进度、安全、舒适)学习候选轨迹,推理时按综合打分选择。
- 内化非可微后处理:把规则评估器中本应在推理端执行的非可微后处理转化为可训练目标,使规划器在端到端方式下学到环境影响。
实验结果(摘要)
- NAVSIM 挑战赛第一名(论文自报)。
- 论文报告在多样驾驶环境与条件下的泛化改善。
与本库的关系
- 准入身份:A2-direct-edge(被 DiffusionDrive(PPR-2411.15139)、CLOVER(PPR-2605.15120)等锚点直接引用)。
- 谱系定位:NAVSIM 候选生成 + 打分线的共同底座。下游 Hydra-MDP++(PPR-2503.12820)扩展教师指标(TL/LK/EC);SparseDriveV2(PPR-2603.29163)以 Hydra-MDP 作稠密词表缩放研究对象;DriveSuprim(PPR-2506.06659)与 GTRS(PPR-2506.06664)改打分/选择机制。
- 评测口径锚定 BMK-006。
Provenance
- 本卡为引用展开的 Tier-0 轻量 ingest(S2 元数据):
version/source-hash为占位(待补),未拉取 arXiv 源。
关联(12)
- PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
- PPR-2503.12820 Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
- PPR-2504.19580 ARTEMIS: Autoregressive End-to-End Trajectory Planning With Mixture of Experts for Autonomous Driving
- PPR-2506.06659 DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
- PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
- PPR-2603.29163 SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
- PPR-2605.15120 CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2406.06978 Hydra-MDP 五层重建(骨架):核心对象是三范式对比下的多教师蒸馏——把『多模规划 + 单目标学习 + 不可微后处理』改为『多模规划 + 多目标学习』,在 VADv2 式固定词表上以模仿损失对齐人类、以离线仿真分数经 BCE 蒸馏规则教师,推理期按网格搜索权重组装子分数选轨迹;公理层含『仅模仿不足以关联环境』『不可微后处理基于不完美感知』『固定词表使离线批量仿真可行』。
- FRM-2503.12820 Hydra-MDP++ 五层重建(骨架):核心对象是在固定离散规划词表上的多教师蒸馏——700K 轨迹 K-means 得词表,分类式解码器先模仿日志轨迹,再以离线仿真的 PDM 指标系统为教师做多头蒸馏,教师指标在传统 NAVSIM 项外扩入红绿灯合规(TL)、车道保持(LK)与扩展舒适(EC);公理层含『模仿不足需与环境关联』与『固定动作空间可离线生成度量真值』。
- CPT-017 PDM Score (PDMS)
- IDX-001 NAVSIM 规划线