Research KB 登录

BMK-006 Benchmark

NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)

id
updated
type benchmark
title NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
alias NAVSIM, EPDMS
venue NeurIPS 2024 D&B Track (v1, Dauner et al., arXiv:2406.15349); CoRL 2025 (v2, Cao et al., arXiv:2506.04218); code autonomousvision/navsim
evaluates PPR-2406.15349
source-hash c4119f02855f06adf277cc21c6620543360ac64686199e75393c01f3339b4cd4
version v2.1.2 (2025-04-24, incl. navhard_two_stage); v1 PDMS navtest 口径沿用
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-07
admitted-under U0-user-directive
admission-note 用户指令性准入(2026-09-07,D18 U0):按 D1 预筛门槛暂不满足(本库暂无以其为锚点的 EVI);预置用途=驾驶规划类 claim 的未来验证侧翼(非反应式仿真与 nuPlan 闭环的互证轴)。

数据底座

数据工件为 DAT-001data-from 边属 dataset→paper,本卡按目录规则不设该字段,血缘由本节提及表达)(OpenScene——nuPlan 数据的 2Hz 紧凑再分发);NAVSIM 的 train/test split 是 OpenScene logs 之上的场景筛选器(navtrain ⊂ trainval、navtest 与 navhard_two_stage ⊂ test),筛选规则的协议锚点见下文协议节。

背景(面向不熟悉 NAVSIM 的读者)

  • 定位:开环与闭环评估之间的折中(论文原话 middle ground)。开环(比对人类轨迹的 L2 误差)便宜但与闭环表现脱节;闭环模拟器(如 nuPlan)指标有意义但算力昂贵、且仿真器与真实数据有域差。NAVSIM 的方案:真实数据 + 非反应式仿真,用仿真结果算指标,但不做完整闭环。
  • 非反应式仿真机制:agent 只在每个场景的首帧被查询,输出固定 4s 轨迹,此后不再与环境交互;ego 由 LQR 控制器 + 运动学自行车模型以 10Hz 推进,邻车按日志重演。对比闭环(nuPlan R):邻车不会对 ego 做反应;对比开环:指标是仿真后果(碰撞/进度/舒适)而非轨迹相似度。论文实证该口径与闭环指标的相关性优于开环 L2。
  • 与 nuPlan 的关系:数据底座 OpenScene 是 nuPlan 的再分发子集(120h @2Hz、8 相机 + 5 LiDAR 合并点云,存储 20TB→2TB),面向端到端(感知输入)方法;评分函数 PDMS 是 nuPlan 闭环分数的高效重实现,得名于规则式规划器 PDM。即:同源数据、轻量仿真、端到端社群的评测口径——与本库 BMK-003(nuPlan 全闭环)互为互证轴但分数不可互换。
  • split 的 curated 属性:navtrain(103k)/ navtest(12k)由启发式过滤产生——剔除恒速基线 PDMS>0.8 的平凡场景与人类轨迹 PDMS<0.8 的标注噪声场景;过滤后恒速基线从 79% 跌到 22%、人类专家 95%,即测试集刻意非平凡。v2(EPDMS,另一论文)沿用同一过滤思想另建 navhard_two_stage(协议见下节)。

协议

  • 数据底座:OpenScene(nuPlan 数据的传感器子集);场景输入为感知/地图结果,agent 输出 4s 轨迹,仿真器非反应式重演(背景车不受 ego 影响)。
  • v1(PDMS):子分数 NC(无过错碰撞,门控)、DAC(可行驶区,门控)× 加权平均 EP(ego progress,权重 5)、TTC(权重 5)、Comfort(C,权重 2)——权重沿用 PDM-Closed 与 2023 nuPlan Challenge 成本权重(此前本卡误记 C=5,已修正)。标准测试 split = navtest;训练 split = navtrain。
  • v2(EPDMS,两阶段):stage 1 用原始观测、stage 2 用合成观测(pseudo-simulation 引入反应式交互近似);子分数扩为罚项组(NC、DAC、DDC 驾驶方向、TLC 红绿灯,门控相乘)+ 软成本组(TTC 5、EP 5、LK 车道保持 2、EC 扩展舒适 2,加权平均);Comfort(C) 改为 HC(history comfort)。新 split:navhard_two_stage。发布 v2.1.2 起 navhard_two_stage 为 v2 标准困难集。
  • navhard 的场景筛选(v2 论文补充材料,非规则式):450 个 Stage 1(真实观测)场景为半自动策展——人工挑选 + 对当时 SOTA planner 的 failure mining,目标是评测多样性(特征化为例:无保护左转、密集交通),与 navtest 的启发式 PDMS 阈值过滤机制不同;另含 5462 个预生成合成 Stage 2 场景(MTGS 神经渲染新视角)。devkit 实现(COD-002 @ 0a380a9)与此一致:train_test_split/navhard_two_stage.yaml 为硬编码 token 清单(log + 场景 token 嵌套列表,含 Stage 1 token 与合成 frame token 的成对映射),非场景过滤器。相关实验用的 correlation subset = 244 Stage 1 + 4164 Stage 2 观测,从完整 navhard 下采样,选样准则 = 同时被 pseudo-simulation 与 nuPlan 闭环支持;引用相关性结论时勿与完整 navhard 混同。出处锚点:v2 补充材料 cache/sources/2506.04218/Cao2025_supp.pdf(sha256 71bee91c43c07e3a1cc86a5e2d05127d92501c0af3fb9278dce70d5bae494d18,“navhard Leaderboard” 节)。

指标计算(实现权威:COD-002 @ 0a380a9;定义:PPR-2406.15349

PDMS 的完整定义与辨析见 CPT-017;本节锄定实现细节。总分公式:

\[\mathrm{PDMS}=\Big(\underbrace{\mathrm{NC}\cdot\mathrm{DAC}}_{\text{门控}}\Big) \times\frac{5\,\mathrm{EP}+5\,\mathrm{TTC}+2\,\mathrm{C}}{12}\]

各子分的实现口径(pdm_scorer.py):

  • NC:ego 多边形与障碍物相交判定(_calculate_no_at_fault_collision)——AGENT_TYPES(车辆/行人/自行车)记 0,静态物体记 0.5;ego 静止时被撞不罚(非过错,stopped_speed_threshold=5e-3 m/s 判静止);红灯杆碰撞不重复罚(同人 token 已碰过不重计)。
  • DAC:可行驶区域多边形 map(PDMDrivableMap)内 ego 全程不出界为 1,出界记 0。
  • EP:沿路线中心的累计进度,以门控后最优 proposal 进度为上界归一(masked_progress.max()),clip [0,1];上界 ≤ 5 m(progress_distance_threshold)时全部 proposal 记 1——对应论文“上界 < 5 m 丢弃低/负进度”。
  • TTC:常速(速度×航向角)外推 ego 多边形,窗口 1 s(future_collision_horizon_window,离散步 0.3 s)内与他车相交记 0,否则 1。
  • C:六项 within-bound 合取,阈值表与 nuPlan 相同(4.89 / 2.40−(−4.05) / 8.37 / 4.13 / 1.93 / 0.95,pdm_comfort_metrics.py)——v1 口径即 nuPlan 舒适度表的移植。

BMK-003(nuPlan 闭环)的结构差异:门控集仅两项(nuPlan 四项);EP 上界为 PDM-Closed 搜索/掩膜最优而非专家进度;TTC 为外推碰撞而非 within-bound 时窗。同构不同值,分数不可互换。

版本口径警示:devkit HEAD 同时含 v2/EPDMS 子分数(lane_keeping/extended_comfort/history_comfort 权重 2.0、驾驶方向门控),引用“默认配置”时须区分 v1 PDMS(本节)与 v2 EPDMS(另论文 arXiv:2506.04218)。

v2 指标计算(EPDMS;实现权威 COD-002 @ 0a380a9 pdm_scorer.py/pdm_and_traffic_scorer.py;论文 PPR-2506.04218

结构:gating(乘法门控)× weighted(加权平均),门控项比 v1 多两项。

门控(MultiMetricIndex,任一失败按 v1 同规则惩罚):

  1. NC(at-fault collision,沿用 v1)
  2. DAC(drivable area,沿用 v1)
  3. TLC(traffic light compliance,v2 新增)——红绿灯合规
  4. DDC(driving direction compliance,v2 新增门控)——窗口 1.0 s,compliance 阈值 2 m、violation 阈值 6 m(沿 nuPlan)

加权(WeightedMetricIndex;注意 v1 的单项 Comfort 2.0 在 v2 拆为两项):

权重 说明
EP(progress) 5.0 沿用 v1(ε 死区同 BMK-003 节)
TTC 5.0 沿用 v1(1 s 窗口)
LK(lane keeping) 2.0 v2 新增;偏移限 0.5 m、窗口 2 s(出处注 hydraMDP++)
HC(history comfort) 2.0 v2 新增;历史帧舒适度
EC(two-frame extended comfort) 2.0 v2 新增;跨帧两帧扩展舒适度(用 stage 间 ego 仿真状态)

两阶段聚合PPR-2506.04218 §3;run_pdm_score_from_submission.py):stage 1 在真实观测上评分;stage 2 在预生成的合成观测(3DGS)上评分,各 stage 2 分数按合成观测起点与 stage 1 规划终点的邻近度加权(ŵ⁽ⁱ⁾),合成后的组合分即 EPDMS。EC 的两帧输入来自 stage 1 的 ego 仿真状态传递。

已知偏差

  • 非反应式仿真的固有近似:背景车不对 ego 做反应,闭环交互特性靠指标代理(PDMS 与闭环 CLS 的相关性是 v1 论文的实证主张,非协议保证);v2 两阶段是对该近似的部分修正,两代分数不可比
  • v1 的 Comfort 与 v2 的 HC/EC 定义不同;跨代引用子分数须注明代际。
  • 门控子分数(×0 即总分归零)使 PDMS/EPDMS 对灾难性失败极敏感,与 nuPlan 的加权平均聚合语义不同——跨基准比较须显式声明。

承重关系

  • 本库现无 EVI 锚点(见 admission-note)。预置用途:①驾驶规划类 claim(CLM-025/026/027/033..038 谱系)的验证侧翼——NAVSIM 与 nuPlan 闭环的相关性证据可作三角互证;②未来 ingest 依托其数据的规划论文(Hydra-MDP 系等)时,此卡承载其评测口径。
  • BMK-003(nuPlan 闭环)的关系:数据同源(nuPlan)、仿真语义不同(非反应式 vs 闭环反应式)——分数不可互换,相关性论断逐条核对来源。

关联(87)

  • PPR-2103.00020 Learning Transferable Visual Models From Natural Language Supervision
  • PPR-2211.15654 OpenScene: 3D Scene Understanding with Open Vocabularies
  • PPR-2212.10156 Planning-oriented Autonomous Driving
  • PPR-2306.07962 Parting with Misconceptions about Learning-based Vehicle Motion Planning
  • PPR-2312.03031 Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?
  • PPR-2404.07762 NeuroNCAP: Photorealistic Closed-loop Safety Testing for Autonomous Driving
  • PPR-2405.19620 SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
  • PPR-2406.06978 Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
  • PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World Model
  • PPR-2406.15349 NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking
  • PPR-2408.00415 DriveArena: A Closed-Loop Generative Simulation Platform for Autonomous Driving
  • PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
  • PPR-2412.01718 HUGSIM: A Real-Time, Photo-Realistic and Closed-Loop Simulator for Autonomous Driving
  • PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
  • PPR-2503.05689 GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
  • PPR-2503.12820 Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
  • PPR-2504.01941 End-to-End Driving with Online Trajectory Evaluation via BEV World Model
  • PPR-2504.19580 ARTEMIS: Autoregressive End-to-End Trajectory Planning With Mixture of Experts for Autonomous Driving
  • PPR-2505.15111 iPad: Iterative Proposal-Centric End-to-End Autonomous Driving
  • PPR-2506.04218 Pseudo-Simulation for Autonomous Driving(NAVSIM v2)
  • PPR-2506.06659 DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
  • PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
  • PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
  • PPR-2506.13757 AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
  • PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
  • PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
  • PPR-2507.17596 PRIX: Learning to Plan From Raw Pixels for End-to-End Autonomous Driving
  • PPR-2510.08562 ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
  • PPR-2510.12796 DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
  • PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
  • PPR-2601.05083 Driving on Registers
  • PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
  • PPR-2605.09701 DriveFuture: Future-Aware Latent World Models for Autonomous Driving
  • PPR-2605.15120 CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
  • PPR-2607.29031 Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
  • PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
  • BMK-003 “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”
  • DAT-001 OpenScene — nuPlan 传感器数据的紧凑再分发(OpenDriveLab)
  • COD-002 navsim — NAVSIM 官方开发套件(数据/非反应式仿真/PDMS-EPDMS 实现)
  • FRM-2205.15997 TransFuser 五层重建(骨架):核心对象是用自注意力做多模态融合的模仿学习驾驶架构——在多个分辨率上用 transformer 模块融合透视视图图像与 LiDAR BEV 直方图特征,得 512 维环境表示后经单层 GRU 自回归预测差分 waypoint,另加深度/语义/HD 地图/车辆检测四个辅助任务;公理层含『几何式融合在动态体密集场景下模仿学习欠佳』与『单步观测已足』,并以 PID 控制器、creeping 与安全启发式兜底 IL 的 inertia 问题。
  • FRM-2211.15654 OpenScene 五层重建:CLIP 共嵌入不变量下的三级特征构造(多视图融合 f2D → 余弦蒸馏 f3D → prompt-相似度 ensemble f2D3D)与零样本推理;断言投影待 G1 签发后进行。
  • FRM-2212.10156 UniAD 五层重建(骨架):核心对象是规划导向的模块化流水线——TrackFormer(检测 + 多目标跟踪,含显式 ego 查询)、MapFormer(地图全景分割)、MotionFormer(场景中心的多模联合预测,含 agent/场景锚与目标点交互)、OccFormer(保留实例身份的占用预测)四模块以统一 query 串联,Planner 以命令嵌入条件化 ego 查询输出轨迹,并在推理期用牛顿法按占用图避碰优化;公理层含『框架应面向规划这一终极目标设计』与『端到端下不可假设真值感知』。
  • FRM-2303.12077 VAD 五层重建(骨架):核心对象是全向量化的场景表示与规划约束——以地图向量(车道线/道路边界/人行横道)与多模智能体运动向量取代稠密栅格化表示,ego 查询依次与智能体、地图查询交互后由规划头加驾驶命令输出轨迹,训练期再用碰撞、越界与车道方向三条实例级向量约束正则规划;公理层含『稠密栅格计算密集且缺实例级结构』与『向量化实例可作显式规划约束』。
  • FRM-2306.07962 Parting(Dauner 等, CoRL 2023)五层重建:论证主线是 PDM 方法族逐级构造至 PDM-Hybrid(学习模块只修正跟踪器不消费的远端路点,C-horizon 原则);开环与闭环负相关(TH-1)与规则基线强(TH-2)是引子,Val14(TH-3)是评测载体。
  • FRM-2308.01898 UniSim 五层重建(骨架):核心对象是把单条记录日志转成高保真闭环多传感器仿真的神经传感仿真器——用神经特征网格分别重建静态背景与动态 actors 并合成为新视点下的 LiDAR 与相机数据,支持增删 actor 与改变其摆放,并以动态对象的可学习先验与卷积网络补全外推视图中未见区域;公理层含『准确评估需在闭环中测试』与『闭环须依新场景配置与自车决策改写传感数据』。
  • FRM-2309.17080 GAIA-1 五层重建(骨架):核心对象是把驾驶世界建模铸成无监督序列建模的生成式世界模型——视频、文本、动作分别编码为离散/连续 token(图像每帧 576 token,文本来自 T5-large,动作仅速度与曲率两个标量),按“文本—图像—动作”交错成一个序列,用自回归 transformer 预测下一个图像 token,再由单独训练的视频解码器还原到像素空间;公理层含『压缩应朝向语义而非高频』与『预测自车动作的多种未来结果是安全导航的关键问题』。
  • FRM-2310.12432 CAT 五层重建(骨架):核心对象是以环境增强视角做安全端到端驾驶的闭环对抗训练——用贝叶斯因式化把“场景为安全关键”的联合分布拆成“交通先验 × ego 估计 × 碰撞似然”三项(前提是 ego 反应单向依赖未来交通流),从而把对抗交通生成归结为标准运动预测子问题的乘积,使物理攻击更可行、迭代学习管线算力成本显著更低;公理层含『仅用真实数据集检索的场景不足以训练/评测,因事故易发事件极罕见』。
  • FRM-2312.03031 “Is Ego Status All You Need”五层重建(骨架):这是诊断性而非提出式论文——核心对象是指出 nuScenes 开环端到端规划的三大问题(含 ego 状态的模型被 ego 状态主导、感知信息被闲置;L2 与碰撞率不足以刻画规划质量;开环中其他智能体不响应 ego 使碰撞度量有偏且忽略 yaw),并据此给出极简基线 BEV-Planner(仅 BEV + ego 查询交叉注意 + L1,不用任何感知标注)与基于地图先验的新指标 CCR(路缘碰撞率)。
  • FRM-2404.07762 NeuroNCAP 五层重建(骨架):核心对象是以 Euro NCAP 为蓝本的安全关键场景闭环评测——用从真实驾驶传感序列学习的神经(NeRF 式)仿真器重构可配置的新场景,按目标 actor 行为分 stationary/frontal/side 三类,把 ego 与目标 actor 初始化到“若维持当前速度与转向约 4 秒后碰撞”,每场景随机抖动后跑 100 次;结果显示 UniAD/VAD 在开环名义场景表现良好,却在闭环安全关键场景下碰撞率高达 98–99%,暴露规划与辅助输出不一致这一设计缺陷。
  • FRM-2405.17398 Vista 五层重建(骨架):核心对象是可泛化、高保真且动作可控的驾驶视频世界模型——第一阶段把 SVD 改造成预测模型(首帧作条件、弃用噪声增强),用“潜替换”注入最多三帧动态先验(位置/速度/加速度由三帧决定),并加动力学增强损失(按运动差异加权)与结构保持损失(频域高通)保细节;第二阶段以统一 Fourier 嵌入 + UNet 交叉注意力(零初始化投影 + LoRA)学四类异构动作控制(角度速度/轨迹/命令/目标点),并以模型自身预测不确定性作通用奖励。
  • FRM-2406.08481 LAW 五层重建(骨架):核心对象是一个可插入既有框架的潜世界模型自监督任务——把当前帧视觉潜表示与 ego waypoint 向量拼接经 MLP 构成动作感知潜表示,由 transformer 式潜世界模型预测下一帧的视觉潜表示,并以真实下一帧提取的潜表示做 MSE 监督,从而在无需人工标签的前提下优化场景特征与轨迹预测;公理层含『自监督表示学习在 NLP/CV 的成功可迁移到驾驶』与『未来帧潜表示可由当前潜表示与 ego 轨迹预测』。
  • FRM-2408.00415 DriveArena 五层重建(骨架):核心对象是首个面向真实场景驾驶智能体的高保真闭环仿真系统——模块化的 TrafficManager(基于 LimSim 的多车分层决策与规划、协作因子与轨迹权重集,支持 OpenStreetMap 任意城市路网,ego 可开环或闭环受控)与基于扩散的 Dreamer(条件编码含地图/物体布局、文本、相机参数、ego 位姿与参考图,用跨视图注意力保多视图一致、用图像自回归保时序一致并支持无限流式生成)循环耦合,使只处理真实图像的智能体可在其中闭环导航。
  • FRM-2409.00588 DPPO 五层重建(骨架):核心对象是“用策略梯度微调扩散策略”的算法框架与最佳实践——把去噪过程视为多步 MDP 并嵌入环境 MDP,构成一个更大的“扩散策略 MDP”,使每步策略似然成为可解析求值的 Gaussian 似然,从而可直接套用任意策略梯度方法(并以 PPO 实例化);论文报告 RL 微调与扩散参数化之间存在协同,带来结构化、on-manifold 的探索、稳定训练与策略鲁棒性。
  • FRM-2412.01718 HUGSIM 五层重建(骨架):核心对象是基于 3D 高斯泼溅的重建式照片级闭环仿真器——分解式场景表示(地面多平面约束 + 单轮车正则的动态车 + 3DRealCar 非原生车)、LQR 与运动学自行车模型的闭环、IDM 正常与攻击代价搜索的激进 actor,以及 HD-Score(NC/DAC 门控 × TTC/COM 加权,再乘路线完成度 R_c);公理层含『评估需闭环』『闭环视觉评测需照片级渲染』与『闭环中 EP 不适用』。
  • FRM-2412.18607 DrivingGPT 五层重建(骨架):核心对象是把驾驶仿真与轨迹规划统一为单一序列建模问题——用 VQ-VAE 把前视图像压成图像 token、把“帧间相对”轨迹分量按分位数裁剪后分箱成动作 token,交错成一种多模态驾驶语言(统一词表大小 D+3M),由自回归 transformer 以标准 next-token 预测同时承载世界建模与端到端策略两个子任务;公理层含『因果式长动作视界会让模型复制历史动作而非基于观测驾驶』与『视频扩散世界模型缺乏纳入动作模态的灵活性』。
  • FRM-2502.13144 RAD 五层重建(骨架):核心对象是以 3DGS 构建光真实数字副本、在其上做闭环强化学习的端到端驾驶框架——策略通过大规模试错探索状态空间、学习分布外场景;奖励由动态碰撞、静态碰撞、位置偏离与朝向偏离四项构成(任一触发即终止 episode,因事后 3DGS 渲染的传感数据含噪);训练分感知预训练、规划预训练(IL 初始化以防 RL 冷启动不稳)与强化后训练(RL 引导安全、IL 作正则贴合人类)三阶段。
  • FRM-2503.11650 Centaur 五层重建(骨架):核心对象是以不确定性为目标的测试时训练——把打分式规划器看作词表上的分类器,先按 5 个方向锚(sharp/slight left、forward、slight/right)对采样候选聚类求和归一化,再以该 5 类分布的 Shannon 熵(Cluster Entropy)作无监督目标,在推理前用历史梯度缓冲(F=4)的平均做单步参数更新;公理层含『预编程回退层/代价函数无法随新数据学习而过度保守』与『词表巨大时朴素熵偏向邻居多的轨迹』。
  • FRM-2503.12820 Hydra-MDP++ 五层重建(骨架):核心对象是在固定离散规划词表上的多教师蒸馏——700K 轨迹 K-means 得词表,分类式解码器先模仿日志轨迹,再以离线仿真的 PDM 指标系统为教师做多头蒸馏,教师指标在传统 NAVSIM 项外扩入红绿灯合规(TL)、车道保持(LK)与扩展舒适(EC);公理层含『模仿不足需与环境关联』与『固定动作空间可离线生成度量真值』。
  • FRM-2504.01941 WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。
  • FRM-2504.19580 ARTEMIS 五层重建(骨架):核心对象是把规划建成逐点自回归的条件序列生成——每个 waypoint 由“规划时间嵌入 + 当前 ego 状态 + 历史规划查询”拼成的查询经带共享与私有专家的 MoE 块(配批量重分配加速)与 BEV 特征交互后、从预测的高斯分布采样得到;路由走内生场景特征而非驾驶命令,且刻意不用专家平衡损失;公理层含『命令分布不均衡且偶与专家轨迹不一致』与『只用当前 ego 状态以防因果混淆』。
  • FRM-2505.09315 TransDiffuser 五层重建(骨架):核心对象是在不用任何轨迹锚点或场景先验的前提下解决扩散式规划的模式坍缩——把场景编码器(冻结的 Transfuser 骨干)与动作/ego 状态嵌入作为多模态条件输入去噪解码器,并在去噪过程中加批级多模态表示去相关正则(惩罚表示相关矩阵的非对角项、逼近对角形);公理层含『既有扩散规划器靠预定义词表或场景先验缓解坍缩,而这些归纳偏置在部署中不可得』与『规划性能取决于多模态表示质量』。
  • FRM-2506.06659 DriveSuprim 五层重建(骨架):核心对象是把选择式规划的“精确选优”拆成粗到精两段——粗筛在整词表上按 Hydra-MDP 式打分取 top-k,精化解码器再对含大量 hard negative 的候选逐层输出细粒度分数;为缓解困难场景的数据不平衡引入 ego 旋转等价的视图增广(伪全景裁剪 + 真值同步反向旋转),并用 EMA 教师裁剪软标签做自蒸馏稳定训练。
  • FRM-2506.06664 GTRS 五层重建(骨架):核心对象是统一粗/细粒度轨迹评估的三支柱框架——基于 Diffusion Policy 的动态候选生成器、用超稠密词表(16384)+ 词表 dropout 训练并在较小子集(8192)推理的泛化打分器、以及传感器扰动与仅训练期精化(top-k + EMA 教师软监督、目标裁剪)的增广打分器;公理层含『静态词表粗离散、动态候选覆盖窄』与『超稠密训练/小子集推理可诱导泛化』。
  • FRM-2506.08052 ReCogDrive 五层重建(骨架):核心对象是把 VLM 的驾驶认知先验与扩散规划器耦合、并以扩散版 GRPO 做安全后训练的三阶段框架——先用“生成/精炼/质控”三级流水线造出模仿人类认知顺序的驾驶 QA 数据训练 VLM,再把其认知 token 注入扩散规划器生成连续稳定轨迹,最后用 DiffGRPO 以 NAVSIM 仿真器的 PDMS 作奖励做强化;公理层含『把规划当语言建模会产出违格式/不可行动作且推理慢』与『多模专家演示下纯模仿会学出平均轨迹』。
  • FRM-2506.09985 V-JEPA 2 五层重建(骨架):这是 FAIR 的通用世界模型工作而非驾驶方法——先在逾 100 万小时互联网视频上做“无动作”联合嵌入预测预训练(得到强运动理解与人类动作预判),再把其与语言模型对齐以做视频问答,最后用不足 62 小时无标注机器人视频后训练出潜动作条件世界模型 V-JEPA 2-AC,并在两个实验室的 Franka 机械臂上零样本做图像目标规划;库内引用它的价值在于它是 Drive-JEPA / Auto-JEPA 的预训练权重来源。
  • FRM-2506.24113 Epona 五层重建(骨架):核心对象是把驾驶世界建模重构为“时间域上的顺序未来预测”的自回归扩散世界模型——既不像视频扩散那样对固定长度帧序列做全局联合分布建模(破坏因果时序),也不像 token 式自回归那样逐 token 预测(弱化空间相关并扭曲高频),而是分离出策略 π(TrajDiT 预测轨迹)与整帧条件分布 p(VisDiT 生成下一帧),由多模态时空 transformer 编码历史,并用 chain-of-forward 训练抑制自回归误差累积;世界模型因此可同时充当实时运动规划器。
  • FRM-2507.00603 World4Drive 五层重建(骨架):核心对象是免感知标注的意图感知物理潜世界模型——意图编码器把轨迹词表端点聚成 3 命令 × 6 意图,物理世界潜编码器用视觉基础模型(Grounded-SAM 伪语义 + 度量深度前向投影)注入空间语义先验,世界模型按各意图预测未来潜状态并由选择器以潜距离选模、ScoreNet 打分;训练全靠与真实未来观测的潜空间自监督对齐,公理层含『既有方法直接取相机特征作潜表示而缺空间语义理解』。
  • FRM-2507.04049 DIVER 五层重建(骨架):核心对象是以强化学习引导扩散生成多模轨迹的框架——策略感知扩散生成器(PADG)以地图元素与周围智能体为条件、由单一真值轨迹与轨迹锚引导生成“多个参考真值”以覆盖不同驾驶风格,再把扩散过程当作随机策略用 GRPO 目标的轨迹级多样性/安全奖励去引导,以破解模仿学习固有的模式坍缩;并针对 L2 类开环指标无法刻画多样性提出多样性度量。
  • FRM-2507.17596 PRIX 五层重建(骨架):核心对象是仅用相机的端到端规划——ResNet 骨干配可跨尺度共享权重自注意力的上下文重标定 Transformer(CaRT)产出多尺度特征,再以 Token Memory 与 Planner Grid 两种学习表示(后者不是几何 BEV,仅靠语义与轨迹损失锚定到 ego 帧、不使用相机内外参)条件化一个带锚点的两步扩散规划头,输出 8 个 waypoint;公理层含『部署受模型规模、LiDAR 与密集 BEV 阻碍』与『固定相机装置下几何可被参数吸收』。
  • FRM-2510.04333 RAP 五层重建(骨架):核心对象是“训练端到端规划器不需要光真实”这一主张及其实现——用轻量 3D 栅格化(对标注图元做栅格化)替代昂贵的光真实渲染,构造反事实恢复机动与跨智能体视角合成等增强,并用 Raster-to-Real 特征空间对齐弥合 sim-to-real 差距;公理层含『模仿学习缺恢复数据,闭环下小错误不可纠正并累积』与『驾驶依赖几何与动力学而非纹理光照』。
  • FRM-2510.08562 ResAD 五层重建(骨架):核心对象是把轨迹预测任务重构为“相对确定性惯性参考的残差预测”——用恒速模型给出物理先验基线,令模型容量集中在交通规则、障碍等情境驱动的偏离上,并以逐点残差归一化(PRNorm)抑制远距不确定 waypoint 的大幅误差主导学习信号;多模性则通过对初始速度施加零均值高斯扰动、经恒速模型传播出 K 条惯性参考簇来获得(同时增强对 GPS/IMU 噪声的鲁棒性)。
  • FRM-2510.12796 DriveVLA-W0 五层重建(骨架):核心对象是把世界建模(预测未来图像)当作给 VLA 驾驶模型的密集自监督信号,以修补“监督赤字”——动作监督稀疏低维、令大容量 VLA 表示能力被闲置;该范式按 VLM 主干类型分别实例化为离散视觉 token 的自回归世界模型与连续视觉特征的扩散世界模型,另配轻量 MoE 动作专家(含 query-based / 自回归 / 流匹配三种解码方案)解决实时推理延迟。
  • FRM-2512.10226 Latent-CoT-Drive 五层重建(骨架):核心对象是把驾驶 VLA 的思维链从自然语言换到“动作对齐的潜语言”——推理轨迹由动作提案 token(与最终输出同一词表、每 10 步构成 1 秒块)与潜世界模型 token(同一 1 秒窗口的 ego 中心世界状态)交错组成,多分支(默认 2)展开成反事实未来并作为最终动作的条件;公理层含『自然语言不适合表达时空几何与多智能体交互』『文本链的生成延迟与动作—文本对齐弱』。
  • FRM-2601.05083 Driving on Registers 五层重建(骨架):核心对象是极简纯 transformer 的端到端驾驶架构——以“相机感知的 register token”(每相机 R 个 register、得 N×R 个场景 token)把多相机特征压成紧凑场景表示、仅用 LoRA 微调预训练 ViT,再由两个轻量 transformer 解码器先生成候选轨迹、再模仿 oracle 打可解释子分数(安全/舒适/效率),从而支持推理期的行为条件驾驶。
  • FRM-2601.22032 Drive-JEPA 五层重建(骨架):核心对象是把 V-JEPA 式潜预测预训练接到端到端驾驶,并用规则仿真器提供多模伪教师——先在 330 小时驾驶视频上自监督预训练 ViT 编码器,再由 learnable 查询的 transformer 解码器出提案,并以“词表(8192 聚类中心)+ NAVSIM v2 EPDM 离线评分筛出的多模高质量轨迹”作为伪教师替代单条人类轨迹监督,最后用带舒适项的 momentum-aware 打分选轨迹;公理层含『单场景仅一条人类轨迹难以学多模行为』与『像素空间世界模型贵、潜世界模型难扩展』。
  • FRM-2603.14482 V-JEPA 2.1 五层重建(骨架):这是 V-JEPA 系列训练配方的改进而非驾驶方法——针对 V-JEPA 2 在需要像素级理解的稠密任务上的严重不足,改用“稠密预测损失”(可见上下文与掩蔽 token 全部参与损失、显式强制时空接地)+“深层自监督”(在多个中间编码器层分层施加自监督目标)+“多模态 tokenizer”(统一图文与视频训练)+ 模型与数据缩放四项要素,在分割/深度/短期动作预判等稠密任务上达最优、同时保持全局视频理解。
  • FRM-2603.24581 Latent-WAM 五层重建(骨架):核心对象是空间感知压缩世界编码器(可学习 scene query 压缩多视角图像 + 几何基础模型蒸馏)与动态潜世界模型(因果 Transformer 自回归预测未来世界状态,3D-RoPE + teacher forcing mask + ego 状态监督);公理层含『世界状态须轻量以支撑长时程转移』与『推理只需 SCWE + 轨迹解码器』;论证为对既有世界模型三缺陷(压缩不足/空间理解缺/历史动态利用不足)的逐项回应。
  • FRM-2603.29163 SparseDriveV2 五层重建(骨架):核心对象是把静态轨迹词表推到超稠密——先把轨迹分解为几何路径与速度剖面两组因子、以组合覆盖动作空间(词表比先前方法稠密 32×),再用粗粒度因子化打分筛出 top-K 路径与 top-K 速度、组合后只对小子集做细粒度打分;其经验前提是对 Hydra-MDP 的 scaling 研究显示锚点越密性能越好、在算力约束前不饱和;作者据此主张动态生成并非必要。
  • FRM-2605.09701 DriveFuture 五层重建(骨架):核心主张是潜世界模型的关键不在于模拟未来状态、而在于以未来状态条件化当前决策——先由共享 BEV 编码器与轨迹编码器经可学未来查询预测“轨迹条件下的未来潜状态”,训练时用条件源随机化(真值/等加速度运动学代理/空 token)支撑推理期无真值轨迹与 CFG,再用单层交叉注意力把该预测潜与带 stop-gradient 的真实未来观测潜接地,最后以其显式条件化一个扩散轨迹规划器;公理层含『把未来潜当预测目标/辅助信号会使当前与未来特征在潜空间纠缠』。
  • FRM-2605.19771 BeyondDrive 五层重建(骨架):核心对象是让模仿学习显式吸收失败——提出“安全不对称”性质(模仿误差几乎相同的两条轨迹安全性可截然不同,一条可恢复、一条致碰撞),故用流匹配的负轨迹生成器合成“安全关键但贴近专家”的硬负样本、以多样性感知采样提高失败模式覆盖,再用排斥距离损失同时吸引预测靠近专家并推离硬负样本,从而在轨迹空间建立可判别的安全边界。
  • FRM-2605.31476 IDOL 五层重建(骨架):核心对象是以逆动力学为桥梁的潜 BEV 世界模型规划——先用候选条件的潜 BEV 世界模型滚出多条候选未来潜状态序列,再用逆动力学模型对相邻潜状态解码出“空间动力学图(变化发生在哪)”与“全局动力学特征(整体变什么)”,以双分支融合(空间交叉注意力 + MLN 校准)把想象出的转移转成规划相关的查询更新,并用重锚定防迭代漂移;公理层含『仅预测未来不足以保证更好规划,除非预测演化能转成可执行运动更新』与『纯池化逆动力学特征对规划过粗』。
  • FRM-2607.29031 Auto-JEPA 五层重建(骨架):核心对象是“只学影响未来自车动作的场景特征”的动作导向潜世界模型——冻结的 V-JEPA 2 视觉编码器 + 24 层 transformer 预测器把视觉、ego 运动史与导航命令压成 8 个连续潜 token(驾驶意图),训练时与冻结轨迹自编码器给出的真值轨迹潜表示做联合嵌入对齐,推理时以该意图为检索键从非参数轨迹记忆中取 300 条候选、经场景打分器排序与可行驶区门控过滤;公理层含『规划无需重建完整未来世界』与『预测目标与检索候选须同处一个潜空间』。
  • CLM-025 同一 diffusion 骨干下,稠密概率性 cost 网格引导促成平滑、预见性的避障;稀疏实例级引导即使供给 oracle 邻车轨迹仍诱发末期突变机动并损害舒适度——避障行为质量由引导信息形态决定。
  • CPT-017 PDM Score (PDMS)
  • DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。
  • DIS-004 术语 predictive 在本库两类专名中的路由:Predictive Driver Model 规划器族(PPR-2306.07962)及其派生的评分名(CPT-017、BMK-006),与 Predictive World Model 环境未来状态任务(DAT-001)。
  • IDX-001 NAVSIM 规划线