BMK-003
Benchmark
“nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”
| id | |
|---|---|
| updated | |
| type | benchmark |
| title | “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)” |
| alias | nuPlan Val14, Test14 |
| venue | “Motional nuPlan; splits via Dauner 2023 (Val14) / PlanTF (Test14, Test14-hard)” |
| version | “nuPlan dataset v1.1 splits as consumed by PPR-2606.26017 / PPR-2501.15564” |
| evaluates | PPR-2106.11810 |
| source-hash | “582c0ba7ac89e5cabb0e714f2a752a9dda6e1cf8b2acf014919720565cb700a9” |
| tier | 0 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-07 |
背景
nuPlan(caesar2021nuplan,NeurIPS 2021)是 Motional 发布的大规模真实驾驶数据集 + 闭环模拟器。它的定位差异在于评估对象:此前的主流数据集(nuScenes、Argoverse、Lyft L5 等)评估的是短期运动预测(motion forecasting),nuPlan 是第一个把评估对象放到长时程规划上的大规模基准。数据体量为 1,500 小时真车人类驾驶记录,采集自四个城市(Las Vegas、Boston、Pittsburgh、Singapore),交通模式差异显著;原始论文自称是首个提供传感器数据的大规模规划数据集(其对比表口径)。
评测与训练的基本单位是场景(scenario):从真车日志中切出的片段,包含 ego 与全部邻车的轨迹及地图。每个场景带类型标签(变道、让行行人、无保护左转等),供场景化指标按标签分派附加计算(论文 metrics 节明确此分派)。
理解本基准的评分,关键是先分清开环与闭环两种评估方式。开环(open-loop, OL)把规划器输出轨迹与人类记录轨迹做 L2 比对;nuPlan 论文指出这在多模态驾驶行为下不适定——面对同一局面存在多条合理规划,它们可以合法地与人类选择不同模态,L2 距离因此不度量质量。闭环(closed-loop, CL)则把规划输出交给控制器真实推进 ego 车辆状态:车辆逐步偏离原日志位置,规划器在每一步用新状态重新规划。nuPlan 的分数只来自闭环,因此分数反映的是交互后果——有没有撞、是否压线、是否按时到达——而非轨迹相似度。开环误差在本卡中仅作参照量保留(见“指标计算”节)。
闭环之下再分两种邻车行为模式,这是本卡的核心口径:
- non-reactive(NR):邻车按日志原样重演(log-replay),不响应 ego 的行为。ego 一旦偏离原轨迹就会出现伪交互——最典型的情形是“ego 正常停车,邻车照原速撞上来”;nuPlan 论文引 Lyft L5 的经验指出,闭环评估中报告的规划器干预(intervention,术语卡 CPT-018)大多数正源于此。
- reactive(R):邻车也由规划模型驱动、像 ego 一样被跟踪与重规划,因此会对 ego 的行为做出反应。R 更接近真实交通交互,但其结果取决于邻车用的是什么规划模型——这一点不是协议公开标准,是跨论文比较时的主要偏差源(见协议节与已知偏差节)。
论文层面只点名指标名(交通规则违反、人类驾驶相似度、车辆动力学、目标达成四族,另有按场景类型分派的 scenario-based 指标),不给精确口径——阈值、聚合与门控结构只存在于 devkit 代码与配置中,见后文“指标计算”节逐条锚定。
评测协议
- 数据与 splits:nuPlan 大规模真实驾驶数据集(caesar2021nuplan),闭环仿真评估。评测 split:Val14(1.1k 场景,PPR-2306.07962 划分——14 类场景类型 × 各约 80 场景);Test14 与 Test14-hard(PPR-2309.10443(PlanTF)划分,hard 为 curated 困难子集(每类 PDM-Closed 跑 100 取最差 20))。训练:G2DP 用 nuPlan 1M split(约百万级场景的训练划分)。数据工件与 archive 对应见下节“数据底座”。
- 模式与 R 模式的实现口径:NR/R 双模式(机制见背景节),两模式分数不可直接比。R 模式的邻车策略论文层面未声明(实现权威
COD-001):devkit 标准 reactive 配置为 IDM agents(
idm_agents_observation.yaml)——邻车由 IDM 策略(Treiber 2000)驱动,只控纵向(沿日志轨迹投影路径的进度与速度),横向不主动变道;默认参数:target_velocity 10 m/s、min_gap 1.0 m、headway 1.5 s、accel_max 1.0 / decel_max 2.0 m/s²、仅仿真 ego 100 m 半径内邻车;行人/锥桶等 open-loop 类型按日志重演。devkit 另有 ML 反应式选项(ego_centric_ml_agents,checkpoint 驱动)但非默认。本库两源(PPR-2606.26017 / PPR-2501.15564)均未声明其 R 模式邻车策略——社区惯例是 devkit 默认 IDM,但该等同行属未验证假定,严格复现需查各自开源 repo 的运行配置。经 repo 核实(2026-09-07,COD-003/COD-004):Diffusion Planner 与 Flow Planner 的开源评估脚本均为裸调 devkit+simulation=closed_loop_reactive_agents、不覆盖 observation → 两者的 R 模式确为 devkit 默认 IDM;BMK-003 已知偏差首条的该假定对两 baseline 已升级为经核实口径。 - 对照构造:hybrid 类 = 学习型输出 + 现成规则精修模块(sun2024generalizing,零调参挂接)。
数据底座(archive 级锚定,DAT-002)
基准实例化的数据工件是 nuPlan 原生 v1.1 分发(DAT-002,20Hz .db),不是 OpenScene pkl(DAT-001)——devkit 闭环仿真消费 .db,两者不可互换。各 split 的 archive 对应:
- Test14 与 Test14-hard ⊂
nuplan-v1.1_test.zip(95.92 GB)——Test14 是 test split 的场景过滤器,hard 为 curated 子集,单个 test.zip 全覆盖。 - Val14 ⊂
nuplan-v1.1_val.zip(96.96 GB)。 - maps:
nuplan-maps-v1.0.zip(0.97 GB)。 - 最小实例化组合 = test.zip + maps ≈ 97 GB(Test14-hard 复现所需);主表复现另加 val.zip(合计 ≈ 194 GB)。
- 传感器 blob(16.6 TB)不需要:NR 按日志重演、R 模式 IDM 重仿真,两者均只消费 .db 中的标注与轨迹。
- 训练复现(nuPlan 1M split ≈ 1 TB .db,场景以 Las Vegas 为主、占比分布论文未给出,本库不断言)属具体论文复现规划,不属基准定义。
指标计算(实现权威:COD-001 @ e9241677)
本节所有常数为 nuplan/planning/script/config/common/simulation_metric/
默认配置(v1.2 线;挑战赛配置可覆盖)。开放商议中的 ADE/FDE/MR
概念卡见 CPT-014/015/016。叙述顺序:先给开环参照量,再给闭环总分的合成结构(门控 × 加权),最后逐项展开各子分。各场景分数越高越好,0–1 线性映射为 0–100 报告;报告总分 = 全场景平均。
开环误差族(OL 参照)
规划轨迹与专家轨迹在 1 Hz 降采样得到的采样点上比对(compute_traj_errors,discount_factor=1)。ADE 与 FDE 的定义见 CPT-014/015:
其中 \(\mathcal{F}_h\) 为从当前采样点起、未来 \(h\) 秒内按 1 s 间隔取到的比对点集合(含末端点),\(T_h\) 为其中最远点。horizon \(h\in\{3,5,8\}\) s;两者打分同为 \(\max(0,\,1-\mathrm{err}/8\,\mathrm{m})\)。
devkit 实现中三个视界共用一条误差序列:序列一次性构建,长度由“专家可用时间戳中不超过规划器轨迹末端的部分”决定(专家真值止于日志末尾即止),而非按视界分别取数;各视界只做前缀切片。序列不足时均值与最大值静默取短(无标记),最终位移下标越界即崩;更早的崩溃点是截断分支用规划器末端时刻插值专家轨迹(规划器永远提议完整 8 s,专家真值止于日志末尾,插值断言失败;2026-09-08 已在 mini 日志末端场景实证复现)。因此有效评测数据必须保证每个场景末端有 ≥8 s 未来余量;余量不足时 devkit 无输出可对齐。miss rate(CPT-016)以 max displacement 判定,阈值 6/8/16 m 按 horizon 顺序对应(3 s↔6 m、5 s↔8 m、8 s↔16 m),score \(=\mathbb{1}[\mathrm{MR}\le 0.3]\)。
闭环总分:门控乘积 × 加权平均
每场景分数由聚合器 weighted_average_metric_aggregator.py:: _compute_scenario_score 合成:
结构上有两个互补的机制。门控是乘性否决:门控集 \(\mathcal{M}_{\mathrm{gate}}\) 中任一为 0,场景分直接为 0,加权各项(包括 5.0 权重的 progress)全部失去意义。加权平均是折中:非门控指标按权重线性合成。
| 门控指标 | 取值 | 语义 |
|---|---|---|
| no_ego_at_fault_collisions | 0 / 0.5 / 1 | at-fault 碰撞 |
| drivable_area_compliance | 0 / 1 | 驶出可行驶区 |
| ego_is_making_progress | 0 / 1 | 未推进 |
| driving_direction_compliance | 0 / 0.5 / 1 | 逆行 |
加权项与权重(closed_loop_{non,}reactive_agents_weighted_average.yaml):
| 加权指标 | 权重 \(w_i\) | 子分 \(s_i\) 的来源 |
|---|---|---|
| ego_progress_along_expert_route | 5.0 | 进度比(见下) |
| time_to_collision_within_bound | 5.0 | TTC ≥ 0.95 s 为 1(least_min_ttc) |
| speed_limit_compliance | 4.0 | violation 型打分(见下) |
| ego_is_comfortable | 2.0 | 六项 within-bound 布尔合取 |
| 其余(含 miss rate 等) | default 1.0 | 各自 compute_score |
配置注释原文佐证了设计意图:progress 与 TTC 并列最高权重(5.0);门控指标不进加权、以乘积方式作用(multiple_metrics 注释:“scenario score ... multiplied by the score of the multiple_metrics”)。
各子分定义如下;门控项(making progress、逆行)与两个加权项(进度比、violation 型)详列,TTC 子分仅一条阈值规则已入表,舒适度六项界展开。
进度比(ego_progress_along_expert_route,权重 5.0)
公式(ego_progress_along_expert_route.py,沿专家路线折线累计位移、两端以 \(\varepsilon\) 饱和):
\(P\) 为沿路线折线的累计进度(米);\(\varepsilon=2\) m(score_progress_threshold 默认值),专家停驶时比值记 1。
读懂这个分段函数的关键是把 \(P\) 理解为沿专家路线折线的带符号弧长坐标:ego 倒车时帧间投影增量为负,累加后 \(P_{\mathrm{ego}}\) 可为负。\(\varepsilon=2\) m 是噪声死区带宽,把零点附近的三个行为类别区分开:
- 倒车(硬零):\(P_{\mathrm{ego}} < -\varepsilon\) → 直接记 0。协议禁止倒车逃逸(代码注释:“Ego is not allowed to fully drive backwards”);若无此分支,倒车会被分子钳位成 \(\varepsilon\),与停车同分——此分支使惩罚序严格单调:倒车(0)严格差于停车(小正分)。
- 静止/抖动(分子钳位):\(-\varepsilon \le P_{\mathrm{ego}}\)(且 \(P_{\mathrm{expert}}>\varepsilon\))→ 分子被
max铛到 \(\varepsilon\),\(s_{\mathrm{prog}}=\varepsilon/P_{\mathrm{expert}}\):小正分。静止 ego 的仿真位姿噪声使帧间投影增量在零附近随机正负,钳位避免噪声产生负比值。 - 专家静止(分母钳位):\(P_{\mathrm{expert}} \le \varepsilon\)(如等红灯全程)→ 分母记 \(\varepsilon\); ego 未大幅倒车时 \(s_{\mathrm{prog}}=\varepsilon/\varepsilon=1\)——专家不动时不罚任何合理 ego 行为。
两个钳位都生效时(双方均未动)比值恰为 1;双方均大于 \(\varepsilon\)
时退化为 \(\min(1, P_{\mathrm{ego}}/P_{\mathrm{expert}})\)——超额进度(ego 沿路线走得比专家更远)由 min 饱和封顶。边界:\(P_{\mathrm{ego}}=-\varepsilon\) 恰好落在钳位分支(硬零判据是严格小于)。
violation 型打分(碰撞 count 公式 / 限速积分损失公式)
基类 violation_metric_base.py 提供按违规事件数计分的通用公式
\(s=\max\!\left(0,\,1-\dfrac{n}{\mathrm{thr}+1}\right)\),其中 \(n\) 为违规事件数(每个 MetricViolation
计 1——对碰撞是单次碰撞事件;对连续型违规指标是一段连续违规窗口
episode)。thr 为容忍事件数:\(n\le\) thr 时线性扣分,\(n>\mathrm{thr}+1\) 后钳位为 0。本卡总分口径内该公式的实际消费者只有碰撞子分(限速重写了打分、其余子分布尔化或走独立公式),episode 语义是基类为通用性保留、当前未被任何总分构成项触发。碰撞子类(no_ego_at_fault_collisions.py:: _compute_collision_score)按 VRU / 车辆 / 物体三类分别计(阈值 0 / 0 / 1),三类子分相乘:VRU 或车辆类发生 1 次 at-fault 碰撞该类子分即 0(thr=0 → \(n=1\) 已使 \(s=1-1/1=0\));物体类 thr=1,第 1 次碰撞该类子分降至 \(1-1/2=0.5\)(场景分减半),第 2 次起归 0——“容忍”的含义是不直接归零而非不扣分。注意该指标同时是门控项(见上表乘入门控积),故此处的类型分解决定的是“哪种碰撞置零”,而非加权折减。
- 限速子分不使用次数公式:
speed_limit_compliance.py重写了_compute_violation_metric_score,改为按“超速幅度 × 持续时间”的积分损失计分:
其中 \(v^{\mathrm{over}}_t=\max(0,\,v^{\mathrm{ego}}_t-v^{\mathrm{limit}}_t)\) 为逐采样点的超速幅度(\(v^{\mathrm{limit}}\) 取 ego 所在道路对象的限速:ego 在 lane 上时取该 lane 的
speed limit;ego 在 lane-connector 上时取其入边 lane 与出边 lane 两条
speed limit 的较大者——不是 lane-connector 折线的某条边);\(\Delta t\) 为相邻采样点的时间间隔、\(T_{\mathrm{scenario}}\) 为场景首末采样点的时间跨度,两者取自同一份 ego 速度时序;\(v^{\mathrm{thr}}_{\mathrm{over}}=\) max_overspeed_value_threshold 默认 2.23 m/s(≈8 km/h,配置 speed_limit_compliance_statistics.yaml 默认值)。直观含义:全程恒以超过限速
2.23 m/s 的幅度行驶 → loss=1 → 0 分;更弱/更短的超速按“超速面积占阈值面积比例”线性扣分。全程无违规时经布尔统计短路直接记 1;ego 位姿不在任何 lane/lane-connector 上(如已驶出可行驶区)时不判定超速——该情形由 drivable_area_compliance 门控负责。另注意 config 中的 max_violation_threshold=1.0 对限速子类不参与打分(仅是基类构造签名的历史遗留),不能按次数公式解读。
at-fault 碰撞判定链(no_ego_at_fault_collisions,门控项)
源码 no_ego_at_fault_collisions.py + utils/collision_utils.py +
oriented_box.py::in_collision,语义逐行核对(2026-09-08)。
检测与去重:逐仿真帧对自车框与全部邻车框做有向框相交判定(shapely Polygon.intersects,边界触碰算碰撞;圆近似预检默认关闭)。每条邻车轨迹(track)全场景只记首次相交帧,其后帧的持续重叠不再计数。
分类(_get_collision_type,elif 链按此优先级短路,速度阈值
5e-2 m/s):
- 自车速度 ≤ 0.05 → 自车静止碰撞(STOPPED_EGO,无责);
- track 静止 → 静止目标碰撞(STOPPED_TRACK,有责)。静止判定:静态对象(锥、护栏、区域标志、通用物体)恒为静止;Agent 类(车辆、行人、自行车)取其速度幅值 ≤ 0.05;
- track 在自车后方 → 后向碰撞(ACTIVE_REAR,无责)。后方 = 自车后轴位置指向 track 中心的向量与自车朝向夹角 arccos > 150°;
- 自车前保险杠边与 track 框相交 → 前向碰撞(ACTIVE_FRONT,有责)。前保险杠边 = 自车框几何外环顶点 0 与 3 的连线(角点顺序前左、后左、后右、前右,即前左–前右连线);
- 其余 → 侧向碰撞(ACTIVE_LATERAL,有责与否取决于门控,见下)。
侧碰门控:仅当碰撞帧的自车时间戳不在变道指标的“共同或连通路径对象时间戳集”(EgoLaneChangeStatistics. timestamps_in_common_or_connected_route_objs,即自车四角点同处一条车道路径对象或图连通的一组对象中)时,侧向碰撞记有责——换道中途(角点分属不连通对象)或不在可行驶结构内的侧碰有责,正常车道内行驶的侧碰无责。该时间轴依赖逐帧行程依赖缓存(route_extractor 的候选集机制),不可化简为纯几何判据。
能量 δv(ego_delta_v_collision,等质量 2000 kg):\(\delta v= frac12\sqrt{v^2+V^2-2vV\cos(\psi-\Psi)}\),\(v/V\) 为自车(后轴)速度与 track 速度幅值,\(\psi/\Psi\) 为二者朝向;静态对象
\(V=0\)。δv 只进入统计量(各类型碰撞能量的最大/最小/均值),不参与打分。
类型划分:VRU = 行人 + 自行车;车辆;物体 = 锥/护栏/区域标志/通用。打分见 violation 型打分块(三类阈值 0/0/1、连乘)。
舒适度(ego_is_comfortable,六项全过为 1)
纵向加速度 \(a_{\mathrm{lon}}\in[-4.05,\,2.40]\,\mathrm{m/s^2}\)、\(|a_{\mathrm{lat}}|\le 4.89\,\mathrm{m/s^2}\)、\(|j_{\mathrm{mag}}|\le 8.37\,\mathrm{m/s^3}\)、\(|j_{\mathrm{lon}}|\le 4.13\,\mathrm{m/s^3}\)、\(|\dot\psi|\le 0.95\,\mathrm{rad/s}\)、\(|\ddot\psi|\le 1.93\,\mathrm{rad/s^2}\)。
making progress(门控项)
\(P_{\mathrm{ego}} > 0.2\,P_{\mathrm{expert}}\)(min_progress_threshold=0.2)为 1;否则为 0。
逆行(driving_direction_compliance,门控项,三档 0/0.5/1)
逆行距离 ≤ 2 m 无惩罚、
6 m 记 0,中间 0.5(
driving_direction_compliance_threshold=2/driving_direction_violation_threshold=6米)。
驶出可行驶区(drivable_area_compliance,门控项)与距离等价定理
devkit 判定链(drivable_area_compliance.py + route_extractor.py)。先定义用词:自车(ego)指被评估的规划主体;路径(route)指车道路径对象,即普通车道(lane)与路口连接段(lane connector),是带图连接关系的车道级图元;可行驶区域(drivable area)是面级集合,由道路段、路口、一般可驶区域与停车场四层多边形拼成(NuPlanMap._initialize_drivable_area 的 concat 语义),比车道覆盖更宽且无图结构;多边形(polygon)指其中单个闭合面。
判定链从取角点开始:逐仿真帧从自车位姿算出车体四角点(car_footprint.all_corners(),几何中心 ± 半长 2.588 m / 半宽
2.297/2 m,太平洋(Pacifica)车型常数)。锚点语义(2026-09-08
修正):日志 ego_pose 的 x,y 是后轴位姿(devkit 从 db 构建自车状态用 EgoState.build_from_rear_axle,车辆领域惯例:运动量以后轴为参考点),几何中心 = 后轴沿朝向前移 rear_axle_to_center
= half_length − rear_length = 1.461 m;自车速度取 ego_pose 表的
vx,vy(后轴速度)。以下区分两个路径概念,二者独立计算、不可混同:角点自身路径——每个角点独立查其所属车道或路口连接段(逐角点维护候选集缓存并向出边(outgoing_edges,车道对象的下游邻接对象)扩展,即 EgoLaneChangeStatistics 产出的
corners_route);自车中心路径——自车几何中心所属的车道或路口连接段(ego_driven_route)。对每个角点依次两步:
① 角点自身路径为空(该角点不在任何车道或路口连接段内),且角点不被可行驶区域的任何多边形包含(包含判定用 shapely 的
polygon.contains,恰在边界上的点不算在内),记逐帧违规标志。该标志只进入逐帧时序输出(corners_in_drivable_area),不直接影响分数。
② 仅对有①违规标志的角点判定远离标志(far,far from drivable
area,“角点远离可行驶区域”)。先定义“到路径对象的距离”:路径对象是路网图节点,携带多种几何属性——面几何(polygon,车道两条边界围成的闭合区域)、基线折线(baseline path,沿车道中心累计弧长用的折线)及图连接关系;本判定链与后文等价定理中的“到路径对象的距离”一律指到其面几何的距离,定义为:点在面内部时记 0,在外部时取点到面边界的最短距离。据此,豁免判定为:角点到自车中心路径对象集合各面几何距离的最小值小于 0.3 m,则本帧豁免(车身斜置轻微越线但整车仍压在车道上时不罚)。豁免不成立时,计算角点到可行驶区域最近多边形的距离(对层内逐多边形调
Point.distance 取最小),达到或超过 0.3 m(max_violation_threshold
默认 0.3)则远离标志置真并永久传播(后续任何帧都不再恢复)。场景分 = 全程无任何远离标志则 1,否则 0(score = not far),布尔。
距离等价定理(本库发现):远离标志的判定链可以只算可行驶区域、不算路径——判定约化为统一距离判据
其中 \(\mathcal{D}\) 为可行驶区域面集(全部单多边形),区域内部点的距离记 0。前提:路径图元面集包含于可行驶区域面集——豁免分支保护的“角点贴近自车所在车道”情形才会被距离判定覆盖。此前提在两个 mini 图上由 41 场景逐位一致间接支持,全图静态核验未做;存在标注缺口的地图上本判据不适用,须回退完整判定链。0.3 m 容差同时吸收了包含判定的边界语义(边界点上包含为假但距离为 0,小于 0.3 m,不触发)。
验证:图形处理器(GPU)实现(纯距离判据 + 逐帧 ±0.5 m 候选裁剪)与 devkit 完整判定链在两个 mini 日志的 41 个场景(含 0 / 0.15 /
0.5 / 1.0 / 2.0 m 横向扰动三态覆盖)上布尔分逐位一致。锚点修正记录(2026-09-08):首轮验证(commit 1a11d57)时参考生成器把后轴坐标误作几何中心注入 devkit,与 kernel 同错而自洽;按
build_from_rear_axle 真实语义修正两侧后,3 个场景分数翻转(08 日志 scene-0007 0→1、scene-0021 1→0;10 日志 scene-0003
1→0),修正后 41 场景重新逐位一致(commit 7feef65)。候选裁剪必须逐帧做:整条轨迹的外接框会横跨数百米,把远处多边形卷入候选、挤掉真正的近邻候选(同一提交内有踩坑记录)。
已知偏差
- reactive 语义实现依赖:R 模式结果取决于模拟器对邻车反应式重演的具体实现(邻车用哪个规划模型、跟踪精度如何),非协议公开标准——跨论文比较 R 分数须确认模拟器配置一致(FRM-2606.26017 与 FRM-2501.15564 本库评论各自独立指出)。devkit 默认配置(IDM 纵向跟驰、无变道意图)与真实人类反应(含横向决策)的差距是该偏差的具体形态,见协议节“R 模式的实现口径”。
- Test14-hard 的 curated 属性意味着“困难子集”构成随划分者变化;与 Val14 的官方性不同层级。
- 单一 seed / 多 seed 报告口径未见统一惯例(两源 FRM 均保留该 caveat)。
- 本卡的 1,500h / 4 城市等数据集体量事实锚定 arXiv:2106.11810 原始论文(proposal 阶段口径);数据集后续版本的精确场景计数论文未给出,本卡不作断言。
承重关系
- PPR-2606.26017:主基准(EVI-024 主表;EVI-025 消融在 Val14/Test14)。
- PPR-2501.15564:主基准(Table 1 全三 split × NR/R;w/ refine. 变体)。
- 口径差异:两源 G2DP-vs-DP 比较须逐 split × 模式对齐;G2DP 的 interPlan/DeepScenario 结果不可回填 nuPlan 口径。
关联(25)
- PPR-2106.11810 nuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles
- PPR-2212.10156 Planning-oriented Autonomous Driving
- PPR-2306.07962 Parting with Misconceptions about Learning-based Vehicle Motion Planning
- PPR-2309.10443 Rethinking Imitation-based Planner for Autonomous Driving(PlanTF)
- PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
- PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- DAT-001 OpenScene — nuPlan 传感器数据的紧凑再分发(OpenDriveLab)
- DAT-002 nuPlan v1.1 原生数据分发(nuscenes.org,20Hz .db)
- COD-001 nuplan-devkit — nuPlan 官方开发套件(数据集/闭环模拟/指标实现)
- COD-003 Diffusion-Planner — Diffusion Planner 官方实现(ZhengYinan-AIR)
- COD-004 Flow-Planner — Flow Planner 官方实现(DiffusionAD org,NeurIPS 2025)
- FRM-2306.07962 Parting(Dauner 等, CoRL 2023)五层重建:论证主线是 PDM 方法族逐级构造至 PDM-Hybrid(学习模块只修正跟踪器不消费的远端路点,C-horizon 原则);开环与闭环负相关(TH-1)与规则基线强(TH-2)是引子,Val14(TH-3)是评测载体。
- FRM-2309.10443 PlanTF(Cheng 等, CoRL 2023)五层重建:核心是 hidden imitation gap——完美模仿的 log replay 经 LQR 执行后在 Test14-hard 上掉 5.65(TH-1),说明执行链偏差是学习系闭环失败的构成性成分;Test14-random/hard 与 1M 帧训练 split 的定义亦出自本文。
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- FRM-2606.26017 G2DP 五层重建:核心对象是 CPT-013 时空代价体(占据概率栅格 × 路线进度图融合)在推理期的可微引导;公理层为能量重加权目标分布、Top-K 车体聚合与末段注入等六个作者前提;论证主干是 Table 4 在同一 DiT 骨干下隔离『稠密网格 vs 稀疏实例』的引导模态消融(稀疏臂按 PPR-2501.15564 附录 C 实现、以 oracle 邻车供给)。
- CLM-026 nuPlan 训练的模型零样本迁移 interPlan:相对共享生成管线的 Diffusion Planner 大幅领先,增益集中于安全维度(碰撞避免、TTC),progress/speed-limit 类项持平或微降;优势依场景类型非全域均匀。
- EVI-024 Table 1:G2DP 系居纯 IL planner 首位,Test14-hard R 77.61(+7.2 over Flow Planner,+8.4 over Diffusion Planner)。
- EVI-025 Table 4:Grid +3.35 score/+3.59 collision/+4.94 TTC;Sparse(Oracle) −1.96 score/−10.13 comfort/+0.64 collision。稀疏臂按 PPR-2501.15564 附录 C 式 10 的实例级有向距离能量实现,与稠密臂在信号形态与信息内容两轴同时不同(评注已补)。
- CPT-014 Average Displacement Error (ADE)
- CPT-015 Final Displacement Error (FDE)
- CPT-016 Miss Rate (MR)
- CPT-017 PDM Score (PDMS)
- CPT-018 Intervention
- DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。