FRM-2605.15120
Formalization
CLOVER 五层重建(骨架):核心对象是生成器-打分器框架下的两阶段训练——Stage 1 用评估器过滤的伪专家做集合级覆盖监督,Stage 2 用评估器子分数做保守闭环自蒸馏(打分器拟合真实子分数、生成器向教师 top-k 与向量 Pareto 集合蒸馏加稳定性正则);含一条作者命题(选中集合富集 → 高质量支撑提升);公理层含训练-评估错配与『直接最大化学习标量分会利用打分器错误』。
| id | |
|---|---|
| type | formalization |
| formalizes | PPR-2605.15120 |
| updated |
0. Overview
CLOVER(PPR-2605.15120,Ang 等 2026)处理端到端规划的训练-评估错配及其对提案选择式规划器的放大效应。论文的出发点:规划器通常只模仿单条日志人类轨迹,却用规则式规划指标(PDMS(CPT-017)/EPDMS)评估;贴近日志的轨迹仍可能碰撞或越界,而偏离演示但合法高分的轨迹被模仿损失压低。对提案选择式规划器,最终表现由两个耦合因素决定:生成器是否覆盖高质量替代轨迹、打分器能否识别它们。CLOVER 采用轻量生成器-打分器结构,分两阶段训练:Stage 1 用评估器过滤的伪专家(来自可解释候选族与训练期特权信息)做集合级覆盖监督并预训练打分器;Stage 2 做保守闭环自蒸馏——交替进行打分器拟合(在生成候选上拟合真实评估器子分数)与生成器精化(向教师挑选的 top-\(k\) 与向量 Pareto 目标蒸馏,配稳定性正则)。论文另给出一条理论判据:当打分器所选目标在真实评估器下统计富集、且更新保守时,用不完美打分器精化生成器是可靠的。
本重建覆盖 Abstract、§1(Introduction)、§3(Method)、§4(Theoretical Analysis)、§5(Experiments)与 §6(Limitations/Conclusion),版本锚定 arXiv:2605.15120v2。阅读顺序与其它 FRM 同构。
1. Definitions
入库概念(→ CPT):
- PDMS / 组合规则 \(\Gamma_{\mathrm{PDMS}}\) → CPT-017:论文把打分器预测的子分数按官方 PDMS 规则组合后排序(式 3)。
论文内定义(未入库概念,标 CANDIDATE,不新建 CPT):
- 提案选择式表述(proposal-selection formulation):生成器 \(G_\theta(o)\) 产出 \(K\) 条候选 \(\mathcal T_\theta(o)=\{\tau_i\}\),打分器 \(S_\phi(o,\tau_i)\) 预测规划指标子分数 \(\hat{\mathbf r}_i\),推理选 \(\tau^\ast=\arg\max_i\Gamma_{\mathrm{PDMS}}(S_\phi(o,\tau_i))\)。轨迹以 ego 位姿序列 \(\tau=\{(x_t,y_t,\theta_t)\}_{t=1}^{T}\) 表示(实现 \(T=8\)、4 秒 horizon、0.5 秒间隔)。
- 规则式评估器(evaluator)\(E\):由地图查询、未来障碍状态、几何检查与离散规则构成,对生成器不可微;训练期给真值 \(\mathbf r_i^{\mathrm{true}}=E(o,\tau_i)\)。
- 伪专家集合(pseudo-expert set)\(\mathcal E(o)\):训练期由可解释候选族(横向偏移、加/减速剖面、停走、接近刹车、边界与过冲等)经训练期特权信息(路线中心线、可行驶区图、未来障碍占用)生成、轻量预筛、评估器打分,并按分数模式与分箱做覆盖感知选择、再用轨迹空间贪婪最远点采样得到的至多 \(M\) 个高质量候选;只在训练期使用。
- 集合级覆盖监督(set-level coverage supervision):\(\mathcal L_\text{stage1}=\lambda_\text{gt}\mathcal L_\text{gt}+ \lambda_\text{pe}\mathcal L_\text{pe}+\lambda_\text{score} \mathcal L_\text{score}\),其中 \(\mathcal L_\text{gt}=\min_i\|\tau_i- \tau^\text{gt}\|_1\) 保留日志驾驶先验,\(\mathcal L_\text{pe}\) 鼓励候选集覆盖多个伪专家模式,\(\mathcal L_\text{score}\) 预训练打分器。
- 保守闭环自蒸馏(conservative closed-loop self-distillation):Stage 2 的交替过程——打分器相在生成候选上拟合 \(\mathcal L_\text{critic}=\frac1K\sum_i\ell(S_\phi(o,\tau_i), \mathbf r_i^\text{true})\);生成器相向教师目标蒸馏。
- 教师目标集合:top-\(k\) 集合 \(\mathcal K^\text{tea}\)(按组合预测分选取)与向量 Pareto 集合 \(\mathcal P^\text{tea}\)(预测子分数空间中的非支配候选;\(\tau_a\) 支配 \(\tau_b\) 当且仅当所有分量 \(r_a^m\ge r_b^m\) 且至少一个严格大于)。
- 集合蒸馏损失:\(\mathcal L_\text{set}(\mathcal T^\text{stu}, \mathcal A)=\frac1{|\mathcal A|}\sum_{\tau\in\mathcal A}\min_i \|\tau_i^\text{stu}-\tau\|_1\);生成器目标 \(\mathcal L_\text{gen}=\lambda_\text{traj}\mathcal L_\text{gt}+ \lambda_\text{topk}\mathcal L_\text{set}(\cdot,\mathcal K^\text{tea})+ \lambda_\text{pareto}\mathcal L_\text{set}(\cdot,\mathcal P^\text{tea})+ \lambda_\text{stab}\frac1K\sum_i\|\tau_i^\text{stu}- \operatorname{sg}(\tau_i^\text{tea})\|_1\)。
- 选中集合富集(selected-set enrichment):理论部分的对象——当前候选经验分布 \(\mu_t^o\)、打分器所选目标分布 \(\nu_t^o\)、高分区 \(\mathcal H_o=\{\tau:R^\ast(o,\tau)\ge r_\text{high}\}\),以及 \(p_t(o)=\mu_t^o(\mathcal H_o)\)、\(q_t(o)=\nu_t^o(\mathcal H_o)\) 的富集差 \(\xi_t(o)>0\)。
- 锚辅助软重排序(anchor-assisted soft reranking):对 EPDMS 可选使用——由同架构但关闭多样性设置的单模规划器给出参考轨迹,以位置与航向偏离的连续罚项与打分器分数组合重排近分候选,不设硬阈值淘汰。
2. Axioms(作者公理:论文接受而未证明的前提)
- AX-1(训练-评估错配):模仿单条日志轨迹的目标与规则式规划指标之间存在系统性错配,贴近日志不蕴含指标高分。核心前提。
- AX-2(提案选择的两因素):提案选择式规划器的性能由候选集覆盖与打分器排序质量共同决定,任一不足都会限制最终表现。
- AX-3(评估器不可微):规则式评估器含地图查询、未来障碍状态、几何检查与离散规则,对生成器不可微,只能作为监督/蒸馏目标。
- AX-4(直接最大化学习标量的风险):直接最大化一个学习到的标量分数会利用打分器误差或使候选多样性坍塌,故生成器精化必须是保守、集合级、带稳定性正则的。
- AX-5(场景级打分不足以表达跨帧一致性):PDMS 类场景级子树分数无法直接建模时序聚合的 EPDMS 项(如扩展舒适依赖跨帧决策一致性),只能靠参考轨迹的软重排序缓解(作者自陈的限制前提)。
3. Theorems(作者可推导命题)
- TH-1(选中集合富集 → 高质量支撑提升)→(P3 投影为 CLM):论文 Theorem 1。其命题内容(在 \(q_t(o)\ge p_t(o)+\xi_t(o)\) 等条件下,保守集合蒸馏提升生成器在高质量区的支撑)与证明由论文给出;本骨架只记其存在与在 Argument 中的角色(界定打分器介导精化可靠的边界),不复述证明。P3 投影为 CLM 后在此回填 ID。
4. Evidence(实证 → CLM/EVI 映射)
骨架阶段占位(待 P3)。可用观察锚点:NAVSIM v1/v2 主表、NavHard 表、nuScenes 开环补充表、候选质量与多样性分析(proposal quality/diversity)、消融(Stage 1/2 各损失项与 anchor reranking)、理论附录的经验支持。均为论文自报,无库内 EVI/VER。
5. Argument(论证结构)
- AR-1(由 AX-1 + AX-2 提出两阶段设计):单轨迹模仿不足以训练高覆盖生成器 → Stage 1 引入评估器过滤的伪专家与集合级覆盖监督;同时预训练打分器。
- AR-2(由 AX-3 推出打分器中介):评估器不可微 → 用它监督一个可微的轨迹级价值估计器(打分器),把规则评估蒸到生成器可用的信号上;推理不需要评估器。
- AR-3(由 AX-2 推出交替精化):生成器与打分器需联合改进 → Stage 2 交替进行打分器拟合与生成器精化。
- AR-4(由 AX-4 推出保守目标集):精化目标取教师 top-\(k\)(集中于高分)与向量 Pareto(保留安全-进度-舒适权衡),并加向教师分布靠拢的稳定性正则,避免漂移与多样性坍塌。
- AR-5(理论边界):TH-1 给出“不完美打分器何时能改进生成器”的条件(所选目标在真实评估器下统计富集 + 更新保守)。
- AR-6(由 AX-5 推出软重排序):EPDMS 含跨帧一致性项 → 可选锚辅助软重排序降低近分候选的抖动,且不使用未来信息或评估器分数。
- AR-7(经验支撑):NAVSIM v1/v2、NavHard 与 nuScenes 分数,以及候选质量分析显示 top-1 之外的候选分布同时改善——支撑 AR-1..AR-6(属 Evidence,非证明)。
6. Commentary
作者评论
- 限制:目前主要在场景级轨迹打分,时序聚合的 EPDMS 项(扩展舒适)依赖跨帧一致性,只由可选锚辅助重排序缓解;未来工作是把历史感知或序列级打分器直接纳入排序与精化。
- 结论:理论分析表明,当打分器所选目标在真实评估器下统计富集时,保守精化可提升高质量候选支撑;实验显示 CLOVER 改进的不只是 top-1 选择,也改进了底层候选分布。
本库评论
- 数值口径:94.5 PDMS、90.4 EPDMS、NavHard 48.3 EPDMS 均为论文自报;NavHard 的措辞是“matching the strongest reported result”,引用时不应写成超越。
- 训练期特权信息:伪专家生成依赖 metric-cache(路线中心线、可行驶区、未来障碍占用),属训练期特权;部署不需要,但方法效果受伪专家生成规则与候选池设计影响,这些规则在附录、本骨架未核。
- 额外组件:EPDMS 上的软重排序引入一个同架构单模规划器作参考锚,仍属方法内组件(推理期使用),不是纯后处理。
- 基座:实例化为 DrivoR 风格生成器-打分器(\(K=64\)),与 PPR-2601.05083 的架构亲缘关系需在 P3 明确为“复用”而非独立提出。
- 评测域:NAVSIM v1/v2(非反应式)与 nuScenes 开环;NavHard 为 navhard_two_stage 口径;未做反应式闭环(闭环读法见 DIS-003)。
7. Traceability
| 原文位置 | 层元素 |
|---|---|
| Abstract | AX-1、AR-1、AR-3、AR-4、AR-5 |
| §1 Introduction | AX-1、AX-2、AR-1 |
| §3.1 Proposal Selection and Scoring | Definitions(表述、评估器、式 1–3)、AX-3 |
| §3.2 Stage 1 | Definition(伪专家、覆盖监督)、AR-1、式 4 |
| §3.3 Stage 2 | Definitions(critic、top-\(k\)、Pareto、\(\mathcal L_\text{gen}\))、AR-3、AR-4、式 5–7 |
| §3.4 Inference and Anchor Reranking | AX-5、Definition(软重排序)、AR-6 |
| §4 Theoretical Analysis | TH-1、AR-5 |
| §5 实验(主表、NavHard、nuScenes、候选分析、消融) | AR-7 的经验支撑 |
| §6 Limitations / Conclusion | 作者评论 |
Review Log
- 2026-09-14 骨架起草(Tier-1 升级批次,NAVSIM 线第 4 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。
关联(4)
- PPR-2601.05083 Driving on Registers
- PPR-2605.15120 CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
- CPT-017 PDM Score (PDMS)
- DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。