Research KB 登录

PPR-2303.12077 Paper

VAD: Vectorized Scene Representation for Efficient Autonomous Driving

id
updated
type paper
title VAD: Vectorized Scene Representation for Efficient Autonomous Driving
authors Bo Jiang, Shaoyu Chen, Qing Xu, Bencheng Liao, Jiajie Chen, Helong Zhou
venue ICCV 2023 (arXiv:2303.12077)
arxiv 2303.12077
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2303.12077v3
source-hash sha256:ea5edafe559b8106c3669887fc4a973e4e33c90a159ca03c783b3da8eaa431f3
admitted-under A2-direct-edge
admission-note 被 DiffusionDrive/DiffusionDriveV2/CLOVER/HUGSIM 等直接引用;VADv2(PPR-2402.13243)是其概率规划续作。

定位

Jiang 等(ICCV 2023)提出 VAD(Vectorized scene representation for Autonomous Driving)。论文指出既有端到端规划依赖稠密栅格化场景表示(智能体占用、语义地图),计算密集且丢失实例级结构信息。VAD 把场景建模为完全向量化表示:智能体运动与地图元素被显式用作实例级规划约束,一方面提升规划安全,另一方面因去掉计算密集的栅格表示与人工设计的后处理而显著提速。论文报告在 nuScenes 端到端规划上与既有最优方法相比大幅领先,基础模型 VAD-Base 亦有显著加速。

与本库的关系

  • 准入身份:A2-direct-edge(被 DiffusionDrive、DiffusionDriveV2、CLOVER、HUGSIM 等直接引用)。
  • 谱系定位:向量化表示线。VADv2(PPR-2402.13243)把它扩展为概率规划;SparseDrive(PPR-2405.19620)进一步稀疏化;HUGSIM(PPR-2412.01718)将其列为闭环评估口径下的评测对象(闭环读法见 DIS-003)。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(10)

  • PPR-2205.15997 TransFuser: Imitation With Transformer-Based Sensor Fusion for Autonomous Driving
  • PPR-2212.10156 Planning-oriented Autonomous Driving
  • PPR-2402.13243 VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
  • PPR-2405.19620 SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
  • PPR-2412.01718 HUGSIM: A Real-Time, Photo-Realistic and Closed-Loop Simulator for Autonomous Driving
  • FRM-2212.10156 UniAD 五层重建(骨架):核心对象是规划导向的模块化流水线——TrackFormer(检测 + 多目标跟踪,含显式 ego 查询)、MapFormer(地图全景分割)、MotionFormer(场景中心的多模联合预测,含 agent/场景锚与目标点交互)、OccFormer(保留实例身份的占用预测)四模块以统一 query 串联,Planner 以命令嵌入条件化 ego 查询输出轨迹,并在推理期用牛顿法按占用图避碰优化;公理层含『框架应面向规划这一终极目标设计』与『端到端下不可假设真值感知』。
  • FRM-2303.12077 VAD 五层重建(骨架):核心对象是全向量化的场景表示与规划约束——以地图向量(车道线/道路边界/人行横道)与多模智能体运动向量取代稠密栅格化表示,ego 查询依次与智能体、地图查询交互后由规划头加驾驶命令输出轨迹,训练期再用碰撞、越界与车道方向三条实例级向量约束正则规划;公理层含『稠密栅格计算密集且缺实例级结构』与『向量化实例可作显式规划约束』。
  • FRM-2402.11502 GenAD 五层重建(骨架):核心对象是把端到端驾驶重铸为生成建模——先用实例中心场景 tokenizer 把周围场景变成含地图语义的实例 token,再用 VAE 在结构化潜空间学未来轨迹先验,并让 GRU 在潜空间里推进时间演化、由 MLP 逐点解出 waypoint;因运动预测与规划共享输出空间,二者用同一套潜空间与生成器完成;公理层含『渐进式流水线无法全面建模交通演化过程』与『轨迹高度结构化、存在可学先验』。
  • DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。
  • IDX-001 NAVSIM 规划线