Research KB 登录

FRM-2303.12077 Formalization

VAD 五层重建(骨架):核心对象是全向量化的场景表示与规划约束——以地图向量(车道线/道路边界/人行横道)与多模智能体运动向量取代稠密栅格化表示,ego 查询依次与智能体、地图查询交互后由规划头加驾驶命令输出轨迹,训练期再用碰撞、越界与车道方向三条实例级向量约束正则规划;公理层含『稠密栅格计算密集且缺实例级结构』与『向量化实例可作显式规划约束』。

id
type formalization
formalizes PPR-2303.12077
updated

0. Overview

VAD(PPR-2303.12077,Jiang 等 2023,ICCV)处理场景表示的计算效率与实例级结构信息缺失。论文的诊断:既有工作依赖稠密栅格化场景表示(智能体占据、语义地图)做规划,计算密集且丢失实例级结构信息;模块化范式下规划无法访问原始传感,感知误差也不能在规划阶段被识别与纠正。VAD 把驾驶场景建模为全向量化表示:用地图查询预测地图向量(车道线、道路边界、人行横道),用智能体查询经可变形注意力与智能体—智能体、智能体—地图交互预测多模运动向量;规划则以随机初始化的 ego 查询依次与智能体查询、地图查询做注意力交互(位置嵌入来自预测位置),再连同 ego 状态与高层驾驶命令(左/右/直)由 MLP 规划头输出轨迹。训练期另加三条实例级向量化规划约束:ego—智能体碰撞约束、ego—边界越界约束、ego—车道方向约束。论文报告在 nuScenes 上规划 SOTA,VAD-Base 平均碰撞率相对此前最优降 29.0%、快 2.5×,轻量变体 VAD-Tiny 最快达 9.3×。

本重建覆盖 Abstract 与 §3(Method:向量化场景学习、交互式规划、向量化规划约束、端到端学习),版本锚定 arXiv:2303.12077v3。

1. Definitions

入库概念(→ CPT)

  • nuScenes → 候选:论文主评测集(开环 L2 与碰撞率);库内暂无对应 BMK 卡,且其口径与 NAVSIM(BMK-006)不可混用。

论文内定义(未入库概念,标 CANDIDATE,不新建 CPT)

  • 向量化地图:地图查询 \(Q_m\) 从 BEV 特征提取信息,预测地图向量 \(\hat V_m\in\mathbb R^{N_m\times N_p\times 2}\) 及类别分;三类元素为车道线(给方向)、道路边界(指示可行驶区)、人行横道。
  • 向量化智能体运动:智能体查询 \(Q_a\) 经可变形注意力从共享 BEV 特征学智能体级特征,MLP 头解码属性(位置、类别、朝向);经智能体—智能体与智能体—地图交互后预测多模运动向量 \(\hat V_a\in\mathbb R^{N_a\times N_k\times T_f\times 2}\)(每模代表一种驾驶意图)及各模概率。
  • ego—智能体交互\(Q'_\text{ego}=\text{TransformerDecoder}(q,k,v, q_\text{pos},k_\text{pos})\)\(q=Q_\text{ego}\)\(k=v=Q_a\)\(q_\text{pos}=\text{PE}_1(p_\text{ego})\)\(k_\text{pos}=\text{PE}_1(p_a)\)(位置嵌入提供相对位置关系)。
  • ego—地图交互:同结构,用另一个 MLP \(\text{PE}_2\) 编码 ego 与地图元素位置,输出 \(Q''_\text{ego}\)(含动静两类信息)。
  • 规划头\(\hat V_\text{ego}=\text{PlanHead}(\text{ft}=f_\text{ego}, \text{cmd}=c)\)\(f_\text{ego}=[Q'_\text{ego},Q''_\text{ego}, s_\text{ego}]\);因采用 HD-map-free 规划,需高层命令 \(c\in\{\text{左转},\text{右转},\text{直行}\}\) 作导航。
  • 三条向量化规划约束(训练期):ego—智能体碰撞约束 \(\mathcal L_\text{col}\)(维持纵向与横向安全);ego—边界越界约束 \(\mathcal L_\text{bd}=\frac1{T_f}\sum_t\mathcal L^t_\text{bd}\)\(\mathcal L^t_\text{bd}=\delta_\text{bd}-d^t_\text{bd}\)(当 \(d^t_\text{bd}<\delta_\text{bd}\),否则 0),\(\delta_\text{bd}\) 为地图边界阈值;ego—车道方向约束 \(\mathcal L_\text{dir}\)(以最近车道向量方向为先验正则运动方向)。
  • 总损失\(\mathcal L=\omega_1\mathcal L_\text{map}+ \omega_2\mathcal L_\text{mot}+\omega_3\mathcal L_\text{col}+ \omega_4\mathcal L_\text{bd}+\omega_5\mathcal L_\text{dir}+ \omega_6\mathcal L_\text{imi}\);地图学习用曼哈顿距离 + focal,运动预测用 \(l_1\) + focal(minFDE 选代表轨迹),模仿用 \(l_1\)

2. Axioms(作者公理:论文接受而未证明的前提)

  • AX-1(模块化范式代价):规划模块拿不到原始传感数据、感知误差无法在规划阶段被识别与修正,导致安全问题。
  • AX-2(栅格化的双重缺陷):稠密栅格化表示计算密集,且缺失实例级结构信息。
  • AX-3(向量实例可作显式约束):向量化的智能体运动与地图元素可直接充当实例级规划约束,从而提升规划安全性。
  • AX-4(去栅格与去后处理提升效率):摆脱栅格化表示与手工后处理可显著提速。
  • AX-5(免 HD 地图需命令):HD-map-free 规划必须有高层驾驶命令提供导航意图。

3. Theorems(作者可推导命题;本层薄)

骨架阶段占位。本文为方法型,未提出独立命题层。P3 投影时若识别出值得保留的定性命题,再实体化为 CLM 并回填 ID。

4. Evidence(实证 → CLM/EVI 映射)

骨架阶段占位(待 P3)。可用观察锚点:nuScenes 规划主表(L2 与碰撞率分 1/2/3 秒)、延迟与 FPS(VAD-Base 224.3 ms / 4.5 FPS,VAD-Tiny 59.5 ms / 16.8 FPS)、三条约束的消融。均为论文自报,无库内 EVI/VER。

5. Argument(论证结构)

  • AR-1(由 AX-2 推出全向量化表示):以地图向量与智能体运动向量取代栅格化占据与语义地图,保留实例级结构。
  • AR-2(由 AX-3 推出三条约束):把向量化实例直接用作训练期的碰撞、越界与方向约束,显式约束规划轨迹。
  • AR-3(交互式规划设计):ego 查询先与智能体查询交互(动态),再与地图查询交互(静态),位置嵌入注入相对位置关系。
  • AR-4(由 AX-5 推出命令条件):规划头以三种驾驶命令为条件。
  • AR-5(由 AX-4 推出效率主张):全可微端到端训练、无手工后处理,因而更快。
  • AR-6(经验支撑):nuScenes 结果、碰撞降幅与延迟数据支撑 AR-1..AR-5(属 Evidence,非证明)。

6. Commentary

作者评论

  • 结论段:向量化范式在安全(碰撞率)与效率(FPS)上同时改进了端到端规划,作者认为这对实际部署关键。

本库评论

  • 承重关系:VAD 的向量化思想是多条后续线(VADv2 的词表采样、SparseDrive 的稀疏实例、SparseDriveV2 的免 BEV 打分)共同的前驱;引用时应把它记为“向量化表示”的起点,而非把后续设计归给它们自身。
  • 约束是训练期正则:三条约束只在训练期作用于规划输出,推理期不生效——与 Hydra-MDP 的“训练期规则蒸馏”同类时序,但机制不同(几何约束 vs 分数蒸馏);与 Centaur 的测试期更新则分属不同轴。
  • 效率数字的条件:VAD-Base 224.3 ms、VAD-Tiny 59.5 ms 均含感知全链路;表内另有带 \(\ddagger\) 的灰色行(未在正文说明差异来源),引用时须回源确认其设置,不可直接混用。
  • 多模运动预测的角色:智能体多模预测是约束与交互的输入,而非最终输出;其模态数 \(N_k\) 影响碰撞约束的严格程度。
  • 评测域:nuScenes 开环(L2/碰撞),与 NAVSIM 口径不同(后者含更细的 CPT-017(PDMS)子项),跨库分数不可比。

7. Traceability

原文位置 层元素
Abstract AX-2、AX-3、AX-4、AR-1、AR-2
§3 Overview Definition(四步结构)
§3.1 Vectorized Scene Learning AX-2、Definition(地图向量、运动向量)
§3.2 Planning via Interaction(式 1–3) AX-5、Definition(ego—智能体/地图交互、规划头)、AR-3、AR-4
§3.3 Vectorized Planning Constraint(式 4–6) AX-3、Definition(三条约束、\(\delta_\text{bd}\))、AR-2
§3.4 End-to-End Learning(式 7–9) Definition(损失组合)
§4 实验(主表、延迟、消融) AR-6 的经验支撑

Review Log

  • 2026-09-14 骨架起草(Tier-1 展开批次,第 13 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。

关联(3)

  • PPR-2303.12077 VAD: Vectorized Scene Representation for Efficient Autonomous Driving
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • CPT-017 PDM Score (PDMS)