PPR-2605.15120
Paper
CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
| id | |
|---|---|
| updated | |
| type | paper |
| title | CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning |
| authors | Sining Ang, Yuguang Yang, Can Chen, Yan Wang |
| venue | arXiv:2605.15120(NeurIPS 2026 投稿格式) |
| arxiv | 2605.15120 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2605.15120v2 |
| source-hash | sha256:4e5928126635328be7f135b3e9e79443aa68cccd926dd5611c99bb74a0b46f0d |
| admitted-under | U0-user-directive |
| admission-note | 用户 2026-09-10 指令性准入(D18 U0):NAVSIM 线候选评分/价值估计分支基点。 |
定位
Ang 等(2026)提出 CLOVER。出发点是端到端规划的训练-评估错配:规划器通常只模仿单条日志人类轨迹,却用规则式规划指标(NAVSIM 的 PDMS(CPT-017)与 EPDMS,衡量安全、可行、进度、舒适)评估。贴近日志轨迹的轨迹仍可能碰撞、越出可行驶区或造成不安全交互;而离演示更远、但合法且高分的替代轨迹却被模仿损失压低。该错配对候选选择式规划器尤其致命,因为其最终表现由两个耦合因素决定:生成器是否覆盖高质量替代轨迹,以及打分器能否把它们识别出来——单轨迹监督会令候选坍缩在一种已实现行为周围,而候选集再好也会被次优打分器选错。
CLOVER 采用轻量生成器-打分器结构:生成器产出多模候选轨迹,轨迹级打分器预测规划指标子分数在推理时排序。为把候选支撑扩到单轨迹模仿之外,CLOVER 构造评估器过滤的伪专家轨迹并用集合级覆盖监督训练生成器;随后做保守式闭环自蒸馏:打分器在生成候选上拟合真实评估器子分数,生成器则朝教师挑选的 top-\(k\) 与向量 Pareto 候选目标精化并加稳定性正则。论文还给出理论分析:当打分器所选目标在真实评估器下统计上富集、且更新保持保守时,“用不完美打分器改进生成器”才可靠。
方法(机制要点)
- 两阶段:Stage 1 评估器过滤的候选覆盖(伪专家轨迹 + 集合级覆盖监督);Stage 2 保守闭环自蒸馏(打分器拟合真实子分数;生成器朝教师 top-\(k\) 与向量 Pareto 目标精化,附稳定性正则)。
- 打分器:轨迹级,输出规划指标子分数(对应 PDMS/EPDMS 各子项),推理时按预测子分数排序选优。
- 理论分析:给出选中集合富集(selected-set enrichment)的条件与近似单调性、单步打分器外推、近似 Pareto 一致性等辅助结果,界定闭环自蒸馏可靠的边界。
- 推理:可选的锚辅助软重排序(anchor-assisted soft reranking)。
实验结果(摘要)
- NAVSIM:94.5 PDMS、90.4 EPDMS,论文自报新 SOTA。
- NavHard:48.3 EPDMS,论文称与最强已报结果持平。
- nuScenes 开环补充评测:报告在对比方法中取得最低 L2 误差与碰撞率。
与本库的关系
- 准入身份:U0-user-directive(用户 2026-09-10 指令性准入)。
- 谱系定位:候选评分/价值估计分支。与 GTRS(PPR-2506.06664)、DriveSuprim(PPR-2506.06659)、SparseDriveV2(PPR-2603.29163)同属“生成候选 + 学习打分”路线,但把监督信号从模仿轨迹改为真实规划指标子分数并闭合生成器-打分器回路;RL 侧与 DIVER(PPR-2507.04049)、DiffusionDriveV2(PPR-2512.07745)形成互补(后者的约束来自 RL 奖励,前者来自评估器子分数蒸馏)。上游引用 Hydra-MDP(PPR-2406.06978)、VADv2(PPR-2402.13243)、UniAD(PPR-2212.10156)、DiffusionDrive、iPad 等;评测口径锚定 BMK-006,困难集用 navhard_two_stage。
承重关系
- provenance:v2 tarball sha256
4e592812…0b46f0d,缓存cache/sources/2605.15120/。
关联(15)
- PPR-2212.10156 Planning-oriented Autonomous Driving
- PPR-2402.13243 VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
- PPR-2406.06978 Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
- PPR-2503.05689 GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
- PPR-2503.11650 Centaur: Robust End-to-End Autonomous Driving with Test-Time Training
- PPR-2506.06659 DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
- PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
- PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
- PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
- PPR-2601.05083 Driving on Registers
- PPR-2603.29163 SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2605.15120 CLOVER 五层重建(骨架):核心对象是生成器-打分器框架下的两阶段训练——Stage 1 用评估器过滤的伪专家做集合级覆盖监督,Stage 2 用评估器子分数做保守闭环自蒸馏(打分器拟合真实子分数、生成器向教师 top-k 与向量 Pareto 集合蒸馏加稳定性正则);含一条作者命题(选中集合富集 → 高质量支撑提升);公理层含训练-评估错配与『直接最大化学习标量分会利用打分器错误』。
- CPT-017 PDM Score (PDMS)
- IDX-001 NAVSIM 规划线