Research KB 登录

FRM-2506.06659 Formalization

DriveSuprim 五层重建(骨架):核心对象是把选择式规划的“精确选优”拆成粗到精两段——粗筛在整词表上按 Hydra-MDP 式打分取 top-k,精化解码器再对含大量 hard negative 的候选逐层输出细粒度分数;为缓解困难场景的数据不平衡引入 ego 旋转等价的视图增广(伪全景裁剪 + 真值同步反向旋转),并用 EMA 教师裁剪软标签做自蒸馏稳定训练。

id
type formalization
formalizes PPR-2506.06659
updated

0. Overview

DriveSuprim(PPR-2506.06659,Yao 等 2025)处理选择式范式在数千候选中精确选优的困难。论文的诊断:回归式方法只模仿单条专家轨迹、不显式评估安全性;选择式方法虽能对多候选打分,但要在数千候选中精确挑出最优、并区分细微却安全关键的差异,仍受优化挑战——尤其在稀有困难场景中。DriveSuprim 用三项设计应对:粗到精选择(粗筛在整词表上按 Hydra-MDP 式打分取 top-\(k\),精化 Transformer 解码器的每一层再对筛后候选输出细粒度分数),基于旋转的数据增广(对传感器输入施加 2D 水平视图变换以模拟 ego 三维旋转,用前视 + 左右扩展视图拼“伪全景”再按角度窗口裁剪,真值轨迹同步反向旋转以保持世界坐标不变),以及带软标签的自蒸馏(EMA 教师只吃原始数据、产生经阈值 \(\delta_m\) 裁剪的软标签,学生吃原始 + 增广数据)。以 ViT-L 为骨干,NAVSIM v1 93.5 PDMS、v2 87.1 EPDMS,Bench2Drive 83.02 DS / 60.00 SR。

本重建覆盖 Abstract 与 §3(Methods:预置、粗到精选择、旋转增广、自蒸馏)及 §4 主表结构,版本锚定 arXiv:2506.06659v3。

1. Definitions

入库概念(→ CPT)

论文内定义(未入库概念,标 CANDIDATE,不新建 CPT)

  • 选择式规划:预定义词表 \(\{\tau_i\}_{i=1}^N\),学习打分器输出 \(\{s_i\}\),推理取最高分轨迹。
  • 粗筛(coarse filtering):沿用 Hydra-MDP 策略——图像特征 \(\mathcal E_\text{img}=\text{Enc}_i(I)\)、轨迹特征 \(f_j=\text{Enc}_t(\tau_j)\)、经轨迹解码器得 \(g_j=\text{TransDec}(\mathcal E_\text{img},f_j)\),各度量头输出 \(s_j^{(m)}=\sigma(\text{head}^{(m)}(g_j))\);取 \(\mathcal I_{\text{top}k}=\text{argsort}_k(\{s_j\})\)\(T_\text{filter}\) 与其特征 \(G_\text{filter}\)
  • 精化打分(fine-grained scoring)\(\{h_{j,l}\}_{l=1}^{n_\text{ref}} =\text{RefineDec}(\mathcal E_\text{img},g_j)\),逐层输出 \(s_{j,l}^{(m)}=\sigma(\text{head}^{(m)}(h_{j,l}))\);最终按末层分数 \(s_{k,n_\text{ref}}^{(m)}\) 选轨迹。损失 \(L_\text{ori}=L_\text{coarse}+L_\text{refine}\),其中 \(L_\text{coarse}=L_\text{imi}+\sum_{m,i}\text{BCE}(s_i^{(m)},y_i^{(m)})\)\(L_\text{refine}\) 同构但只作用于 \(T_\text{filter}\) 且施加于每层输出。
  • 旋转增广:对每场景从 \(U[-\Theta,\Theta]\) 采随机角 \(\theta\)(正为 ego 左转),把原视野相机与两个扩展视野相机(如 front、front-left、front-right)拼成伪全景,再按位移窗口裁剪输入图;合成场景的真值轨迹把每个位置绕初始位姿旋转 \(-\theta\),保证世界坐标不变;增广损失 \(L_\text{aug}\) 与原损失同式。
  • 软标签自蒸馏:教师与学生同架构,教师参数为学生参数的 EMA;学生吃原始与增广数据得 \(L_\text{ori}\)\(L_\text{aug}\),教师只吃原始数据产生 \(\hat y_i^{(m)}=y_i^{(m)}+\text{clip}(s_{i,\text{teacher}}^{(m)}- y_i^{(m)},-\delta_m,\delta_m)\)\(L_\text{soft}=L_\text{imi-soft}+ \sum_{m,i}\text{BCE}(s_i^{(m)},\hat y_i^{(m)})\)\(L=L_\text{ori}+L_\text{aug}+L_\text{soft}\);推理用教师模型输出。

2. Axioms(作者公理:论文接受而未证明的前提)

  • AX-1(选择式优于纯回归):只模仿单条专家轨迹不显式评估安全性,打分式选择可显式建模候选质量。
  • AX-2(精确选优的困难):在数千候选中精确选出最优、并区分细微但安全关键的差异是选择式范式的主要难点,稀有困难场景尤甚。
  • AX-3(数据不平衡可合成):困难场景的稀缺可通过 ego 旋转等价的视图增广合成(且该变换对规划问题保持真值一致性)。
  • AX-4(硬标签损害稳定性):以硬决策边界拟合轨迹评估会损害训练稳定性,需软标签。
  • AX-5(粗筛候选含 hard negatives):粗筛后的候选集中 hard negative 占比高,须专门的精化阶段区分。

3. Theorems(作者可推导命题;本层薄)

骨架阶段占位。本文为方法型,未提出独立命题层。P3 投影时若识别出值得保留的定性命题,再实体化为 CLM 并回填 ID。

4. Evidence(实证 → CLM/EVI 映射)

骨架阶段占位(待 P3)。可用观察锚点:NAVSIM v1 主表(ResNet-34 / V2-99 / ViT-L 三档,93.5 PDMS 最高)、NAVSIM v2 EPDMS、Bench2Drive(83.02 DS / 60.00 SR)、粗到精 / 旋转增广 / 自蒸馏的消融。均为论文自报,无库内 EVI/VER。

5. Argument(论证结构)

  • AR-1(由 AX-2 + AX-5 推出两段选择):先在整词表粗筛出 top-\(k\) 候选,再用多层精化解码器逐层打分区分 hard negative,最后按末层分数选轨迹。
  • AR-2(由 AX-3 推出旋转增广):以伪全景拼接 + 角度窗口裁剪合成 ego 旋转后的场景,真值同步反向旋转保持世界坐标不变,从而增加困难场景与朝向多样性。
  • AR-3(由 AX-4 推出自蒸馏):EMA 教师产生裁剪软标签,学生同时看原始与增广数据,以 \(L_\text{ori}+L_\text{aug}+L_\text{soft}\) 稳定训练。
  • AR-4(经验支撑):NAVSIM v1/v2 与 Bench2Drive 结果支撑 AR-1..AR-3(属 Evidence,非证明)。

6. Commentary

作者评论

  • 结论段:粗到精过滤、旋转增广与自蒸馏共同带来 SOTA 规划能力。

本库评论

  • 与 GTRS 的机制重叠:GTRS(PPR-2506.06664)的精化模块同样使用 top-\(k\) 精化 + EMA 教师软标签与裁剪阈值 \(\delta_m\),公式结构与本文一致;两文同期,引用时不宜把该机制归给单一方。
  • 增广的等价性假设:旋转增广把“ego 朝向变化”当作可从视图裁剪合成、且世界坐标真值可反向旋转对齐的变换——该假设在纯前视输入下依赖伪全景拼接,其边界(遮挡、视野外目标)是潜在误差源。
  • 推理用教师:EMA 教师既是软标签来源也是推理模型,属常见做法但意味着推理路径与训练学生不同。
  • 分数口径:v1 PDMS 93.5 来自 ViT-L 骨干档,与 ResNet-34 档(89.9)不是同一条件;跨方法比较须对齐骨干。
  • 评测域:NAVSIM(非反应式)与 Bench2Drive(闭环)并存,引用须注明基准。

7. Traceability

原文位置 层元素
Abstract AX-1、AX-2、AR-1、AR-2、AR-3
§3.1 Preliminaries(式 1–2) Definition(选择式规划)
§3.2 Coarse-to-Fine(式 3–9) AX-2、AX-5、Definition(粗筛、精化、损失)、AR-1
§3.3 Rotation-based Augmentation AX-3、Definition(旋转增广)、AR-2
§3.4 Self-distillation with Soft-labeling(式 10–12) AX-4、Definition(软标签自蒸馏)、AR-3
§4 实验(主表与消融) AR-4 的经验支撑
§5 Conclusion 作者评论

Review Log

  • 2026-09-14 骨架起草(Tier-1 展开批次,第 8 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。

关联(5)

  • PPR-2503.12820 Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
  • PPR-2506.06659 DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
  • PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • CPT-017 PDM Score (PDMS)