Research KB 登录

PPR-2605.15120 Paper

CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning

id
updated
type paper
title CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
authors Sining Ang, Yuguang Yang, Can Chen, Yan Wang
venue arXiv:2605.15120(NeurIPS 2026 投稿格式)
arxiv 2605.15120
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2605.15120v2
source-hash sha256:4e5928126635328be7f135b3e9e79443aa68cccd926dd5611c99bb74a0b46f0d
admitted-under U0-user-directive
admission-note 用户 2026-09-10 指令性准入(D18 U0):NAVSIM 线候选评分/价值估计分支基点。

定位

Ang 等(2026)提出 CLOVER。出发点是端到端规划的训练-评估错配:规划器通常只模仿单条日志人类轨迹,却用规则式规划指标(NAVSIM 的 PDMS(CPT-017)与 EPDMS,衡量安全、可行、进度、舒适)评估。贴近日志轨迹的轨迹仍可能碰撞、越出可行驶区或造成不安全交互;而离演示更远、但合法且高分的替代轨迹却被模仿损失压低。该错配对候选选择式规划器尤其致命,因为其最终表现由两个耦合因素决定:生成器是否覆盖高质量替代轨迹,以及打分器能否把它们识别出来——单轨迹监督会令候选坍缩在一种已实现行为周围,而候选集再好也会被次优打分器选错。

CLOVER 采用轻量生成器-打分器结构:生成器产出多模候选轨迹,轨迹级打分器预测规划指标子分数在推理时排序。为把候选支撑扩到单轨迹模仿之外,CLOVER 构造评估器过滤的伪专家轨迹并用集合级覆盖监督训练生成器;随后做保守式闭环自蒸馏:打分器在生成候选上拟合真实评估器子分数,生成器则朝教师挑选的 top-\(k\) 与向量 Pareto 候选目标精化并加稳定性正则。论文还给出理论分析:当打分器所选目标在真实评估器下统计上富集、且更新保持保守时,“用不完美打分器改进生成器”才可靠。

方法(机制要点)

  • 两阶段:Stage 1 评估器过滤的候选覆盖(伪专家轨迹 + 集合级覆盖监督);Stage 2 保守闭环自蒸馏(打分器拟合真实子分数;生成器朝教师 top-\(k\) 与向量 Pareto 目标精化,附稳定性正则)。
  • 打分器:轨迹级,输出规划指标子分数(对应 PDMS/EPDMS 各子项),推理时按预测子分数排序选优。
  • 理论分析:给出选中集合富集(selected-set enrichment)的条件与近似单调性、单步打分器外推、近似 Pareto 一致性等辅助结果,界定闭环自蒸馏可靠的边界。
  • 推理:可选的锚辅助软重排序(anchor-assisted soft reranking)。

实验结果(摘要)

  • NAVSIM:94.5 PDMS90.4 EPDMS,论文自报新 SOTA。
  • NavHard:48.3 EPDMS,论文称与最强已报结果持平。
  • nuScenes 开环补充评测:报告在对比方法中取得最低 L2 误差与碰撞率。

与本库的关系

  • 准入身份:U0-user-directive(用户 2026-09-10 指令性准入)。
  • 谱系定位:候选评分/价值估计分支。与 GTRS(PPR-2506.06664)、DriveSuprim(PPR-2506.06659)、SparseDriveV2(PPR-2603.29163)同属“生成候选 + 学习打分”路线,但把监督信号从模仿轨迹改为真实规划指标子分数并闭合生成器-打分器回路;RL 侧与 DIVER(PPR-2507.04049)、DiffusionDriveV2(PPR-2512.07745)形成互补(后者的约束来自 RL 奖励,前者来自评估器子分数蒸馏)。上游引用 Hydra-MDP(PPR-2406.06978)、VADv2(PPR-2402.13243)、UniAD(PPR-2212.10156)、DiffusionDrive、iPad 等;评测口径锚定 BMK-006,困难集用 navhard_two_stage。

承重关系

  • provenance:v2 tarball sha256 4e592812…0b46f0d,缓存 cache/sources/2605.15120/

关联(15)

  • PPR-2212.10156 Planning-oriented Autonomous Driving
  • PPR-2402.13243 VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
  • PPR-2406.06978 Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
  • PPR-2503.05689 GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
  • PPR-2503.11650 Centaur: Robust End-to-End Autonomous Driving with Test-Time Training
  • PPR-2506.06659 DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
  • PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
  • PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
  • PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
  • PPR-2601.05083 Driving on Registers
  • PPR-2603.29163 SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2605.15120 CLOVER 五层重建(骨架):核心对象是生成器-打分器框架下的两阶段训练——Stage 1 用评估器过滤的伪专家做集合级覆盖监督,Stage 2 用评估器子分数做保守闭环自蒸馏(打分器拟合真实子分数、生成器向教师 top-k 与向量 Pareto 集合蒸馏加稳定性正则);含一条作者命题(选中集合富集 → 高质量支撑提升);公理层含训练-评估错配与『直接最大化学习标量分会利用打分器错误』。
  • CPT-017 PDM Score (PDMS)
  • IDX-001 NAVSIM 规划线