FRM-2309.10443
Formalization
PlanTF(Cheng 等, CoRL 2023)五层重建:核心是 hidden imitation gap——完美模仿的 log replay 经 LQR 执行后在 Test14-hard 上掉 5.65(TH-1),说明执行链偏差是学习系闭环失败的构成性成分;Test14-random/hard 与 1M 帧训练 split 的定义亦出自本文。
| id | |
|---|---|
| type | formalization |
| formalizes | PPR-2309.10443 |
| updated |
0. Overview
PlanTF(PPR-2309.10443)回应的是模仿式驾驶规划器缺少统一评测平台的问题:nuPlan 提供大规模真实数据与标准化闭环基准后,论文用它系统研究两件此前未被充分考察的事——ego 规划真正需要的输入特征,以及抑制复合误差(compounding error)的有效数据增广方式——并指出一个被现有学习框架忽略的 imitation gap。在此基础上论文集成发现、训练出纯模仿的规划器 PlanTF,并主张设计得当的纯模仿方法能与含手工规则的方法竞争,且在长尾场景上泛化更好。
重建范围是论文的方法与实验(§3–§4)。阅读顺序:§1 给出术语到 CPT/BMK 的绑定与论文内定义(Test14 系 split、1M 帧训练划分、imitation gap、PlanTF 与 RL adapter),§2 是作者接受而未证明的三个前提(AX-1..3),§3 是三条可推导命题(TH-1..3),§4 把每个实证观察映射到其表格锚点,§5 复现论证结构,§6 分列作者与本库评论,§7 是节/表到各层元素的追溯表,末尾 Review Log 记录审核与修订状态。
对象映射要点:Test14-random / Test14-hard 与 1M split → BMK-003(split 定义的权威承载);PDM-Closed 的定义出自 PPR-2306.07962(本文以它作困难子集的筛选器)。
1. Definitions
Test14-random 与 Test14-hard:均取 nuPlan Planning Challenge 指定的 14 类场景。前者从每类随机采样 20 个场景并在选定后固定;后者为考察长尾表现,先用规则系规划器 PDM-Closed(PPR-2306.07962 定义)在每类上跑 100 个场景,再取该 100 中表现最差的 20 个。精确定义以 BMK-003 为准。
1M split:训练用 nuPlan 训练集全部 75 类场景,总帧数上限 1M frames。该划分是后续入库工作(PPR-2501.15564、PPR-2606.26017)所报“nuPlan 1M split”的出处。
imitation gap:训练目标与最终执行之间的偏差——模仿式 planner 以日志中的专家轨迹(footprint 级)为监督目标,其输出还要经过下游跟踪器与车辆动力学才成为实际轨迹;训练时不含跟踪器与动力学的知识,因此即使模仿完美,实际轨迹仍可能显著偏离记录轨迹。论文给出的量化证据是 log replay(完美模仿)加 LQR 在 Test14-hard 上的 NR-CLS 相比完美跟踪下降 5.65。
PlanTF:纯模仿的 Transformer 规划器基线。agents / map / ego 三路独立编码后拼接,经 Transformer 编码器栈做场景级联合输出(他车预测与 ego 规划),输出 8 s 时域;按论文的评测纪律不加紧急停车或后优化,以测本征性能。
RL adapter:论文为补偿 imitation gap 提出的可选模块(强化学习微调),其奖励项与权重见 Table rewards——位置追踪(指数核)、动作幅值平方、动作变化率平方,以及纵向加速度、jerk、横摆角速度的越限惩罚;它是执行偏差的补丁式处理,不是论文主张的原则解。
2. Axioms(作者接受而未证明的前提)
AX-1(输入表征敏感性):模仿式 planner 的闭环表现对输入特征的构造方式(编码是否共享、归一化、增广)高度敏感,且敏感方向与开环指标不同。支撑是 §3.1 的对照表:共享编码与分离编码、含不含 history 的变体互有胜负。
AX-2(hidden gap):闭环分数是规划质量与跟踪误差的复合——任何不建模跟踪器与动力学的训练都携带一部分不可由模仿消除的执行偏差。支撑是 log replay 加 LQR 在 Test14-hard 上的 NR-CLS 比完美跟踪低 5.65。
AX-3(诚实评测):测 planner 本征性能时不施加规则式紧急停车或后优化;报告分数必须声明是 NR 还是 R 模式。
3. Theorems(作者可推导的命题)
TH-1(imitation gap 的量化):完美模仿的 log replay 经 LQR 执行后,Test14-hard 的 NR-CLS 下降 5.65——执行链偏差是学习式 planner 闭环失败的构成性成分,而非模型缺陷。
TH-2(表征结论):对 centerline 与各类输入要素的消融表明,在开源特征组合下纯模仿即可达到稳定的闭环表现,部分回应了 Parting(PPR-2306.07962)的 AX-3;两文在“表征优先”上一致。
TH-3(Test14-hard 的判别力):以 PDM-Closed 每类最差 20/100 的规则做 curated 选取,得到的子集对 planner 弱点敏感——hard 与 random 的分数被系统性拉开。
4. Evidence(实证观察与其表格锚点)
EV-1(对应 TH-1):Table il_gap,log replay 加 LQR 的消融。
EV-2(对应 TH-2):Table ego_features,输入要素消融。
EV-3(对应 TH-3):Test14-random 与 Test14-hard 的全基线对照表。
引用来源注:G2DP 的 Table 1 中 PlanTF 行(84.27 / 76.95 / 69.70 / 61.61)是 G2DP 环境下的重跑读数,并非本文自报,引用时须区分(EVI-024 已注明)。
5. Argument(论证结构)
AR-1:TH-1 是 Parting(FRM-2306.07962)AX-4(控制器感知)的独立定量证实——两篇论文不引用同一实验却得出相容结论:闭环失败不等于规划失败。
AR-2:AX-2 解释了学习系 NR-CLS 的天花板,并为 BMK-003 记录的“log replay 拿不到满分”现象提供了独立来源。
AR-3:Test14-hard 以 PDM-Closed 的失败度作选取判据,把 Parting 的规则基线从“对照”升级为“筛选器”,BMK-003 的 hard 子集由此完全可复现。
6. Commentary
作者评论
设计判断:困难子集用规则系 planner(PDM-Closed)的失败度来定义“困难”,以任务内在度量替代人工标注。自述局限:在线 leaderboard 已关闭,Test14 属本地复算口径,无外部裁判。
本库评论
imitation gap 仅在 LQR 加运动学自行车模型的执行链下量化,更换跟踪器后 5.65 这一数值不可迁移(A5 谨慎外推)。RL adapter 是补丁而非原则解:AX-2 指出的执行偏差在 BMK-003 的“log replay 不等于满分”中独立可见。G2DP Table 1 的 PlanTF 行是 G2DP 环境读数而非本文自报,两处数字引用必须分别注明来源(EVI-024 已注明)。
7. Traceability
| 论文坐标 | 层 | 元素 |
|---|---|---|
| §3 baseline model | 1 | PlanTF 定义(三路编码 + Transformer 栈) |
| §3.3 Table il_gap | 2/3 | AX-2 与 TH-1(imitation gap 5.65) |
| §3.3 reward 表 | 1 | RL adapter 的奖励项(跟踪误差补偿) |
| §4 训练设置 | 0/3 | 1M split 定义 → BMK-003、PPR-2501.15564、PPR-2606.26017 |
| §4 Table ego_features | 3 | TH-2、TH-3(Test14-random 与 hard 对照) |
关联对象:BMK-003、PPR-2306.07962、PPR-2501.15564、PPR-2606.26017。
Review Log
- 2026-09-07:五层重建骨架完成(imitation gap、Test14 系与 1M split 的定义)。
- 2026-09-10:按 D16/D27/D15 重写表达层并修正 frontmatter——
source改为formalizes(D25 边目录;viewer 的 formalization 关系字段读formalizes,旧写法使本卡的关系边不显示),删除tier/lifecycle/epistemic(D16 明言 FRM 不承载这两条轴),## 0.1 Object Mapping并入## 0. Overview与 §1 Definitions,各层由 bullet 改为连贯段落,术语首次出现括注原文,补上原有 §0.1 中 RL adapter 的映射内容并补足其定义。未改任何 AX/TH/EV/AR 编号与语义。 - G1 签发记录缺失:本卡的骨架过程(2026-09-07)未见 G1 忠实度审核的签发记录,TRIAGE 与本目录
_issues/均无对应文件——如实标记为历史缺口,不补造日期。本论文的 P3 投影(CLM/EVI)尚未发起。
关联(7)
- PPR-2306.07962 Parting with Misconceptions about Learning-based Vehicle Motion Planning
- PPR-2309.10443 Rethinking Imitation-based Planner for Autonomous Driving(PlanTF)
- PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
- PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- BMK-003 “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”
- FRM-2306.07962 Parting(Dauner 等, CoRL 2023)五层重建:论证主线是 PDM 方法族逐级构造至 PDM-Hybrid(学习模块只修正跟踪器不消费的远端路点,C-horizon 原则);开环与闭环负相关(TH-1)与规则基线强(TH-2)是引子,Val14(TH-3)是评测载体。
- EVI-024 Table 1:G2DP 系居纯 IL planner 首位,Test14-hard R 77.61(+7.2 over Flow Planner,+8.4 over Diffusion Planner)。