FRM-2506.06664
Formalization
GTRS 五层重建(骨架):核心对象是统一粗/细粒度轨迹评估的三支柱框架——基于 Diffusion Policy 的动态候选生成器、用超稠密词表(16384)+ 词表 dropout 训练并在较小子集(8192)推理的泛化打分器、以及传感器扰动与仅训练期精化(top-k + EMA 教师软监督、目标裁剪)的增广打分器;公理层含『静态词表粗离散、动态候选覆盖窄』与『超稠密训练/小子集推理可诱导泛化』。
| id | |
|---|---|
| type | formalization |
| formalizes | PPR-2506.06664 |
| updated |
0. Overview
GTRS(PPR-2506.06664,Li 等 2025,NVIDIA;NAVSIM v2 挑战赛冠军方案)处理轨迹打分器的泛化。论文的诊断:多模规划需要稳健的打分器从候选中选优,而既有打分器分两类各有局限——面向大规模静态词表的打分器能做粗离散覆盖,却难细粒度适应;面向小型动态候选的打分器精细,却覆盖不到更广的轨迹分布。GTRS 用三支柱统一两者:基于 Diffusion Policy 的动态轨迹生成器产出细粒度候选;词表泛化打分器(GTRS-Dense)在超稠密词表(\(\mathcal V_{XL}\),16384 条)上训练、施加词表 dropout(每批随机去掉一半),却在较小词表(\(\mathcal V_L\),8192 条)上推理;传感增广打分器(GTRS-Aug) 用受控 2D 水平视角旋转的传感扰动与仅训练期的精化模块(额外 Transformer 解码器、top-\(k\)、EMA 教师软监督与目标裁剪)提升分布外鲁棒性与细粒度判别。
本重建覆盖 Abstract、§3(The Three Pillars)与实验结构,版本锚定 arXiv:2506.06664v1。
1. Definitions
入库概念(→ CPT):
论文内定义(未入库概念,标 CANDIDATE,不新建 CPT):
- 轨迹生成器(trajectory generator):图像骨干 + BEV 编码器(BEV query 经 transformer encoder 注意图像特征)+ Diffusion Transformer,条件于 BEV 特征生成 \(N\) 条候选 \(\mathcal V_{dp}\);训练时按 Transfuser 式加 BEV 分割头监督,对真值 waypoint 做一阶差分归一化并用 DDPM 调度去噪。
- 广义词表打分器(Generalized Vocabulary Scorer, GTRS-Dense):在 Hydra-MDP 基础上改为“图像骨干 + 轨迹 tokenizer + Transformer 解码器”结构,建模轨迹 token 与图像 token 的交互。
- 超稠密词表 \(\mathcal V_{XL}\):16384 条轨迹,训练用;推理用较小词表 \(\mathcal V_L\)(8192 条)。
- 词表 dropout(vocabulary dropout):训练时每批随机移除 \(\mathcal V_{XL}\) 的一半轨迹;作用是(a)对齐训练与推理的轨迹 token 数,(b)制造有意的分布漂移以提升鲁棒性,(c)作为防止过拟合特定轨迹模式的正则。
- 传感增广(sensor augmentation):对输入图像施加受控的 2D 水平视角旋转,并对训练真值施加相应变换以保持标签一致。
- 精化训练(refinement training):仅训练期模块——额外 Transformer 解码器对 top-\(k\) 候选渐进精化分数;以 EMA 副本作教师给软监督,精化目标 \(\tilde y_i^m=\hat y_i^m+\text{clip}(s_{i,\text{teacher}}^m- y_i^m,-\delta_m,\delta_m)\),\(\delta_m\) 限制偏离真值的幅度。
2. Axioms(作者公理:论文接受而未证明的前提)
- AX-1(两类打分器的局限):静态词表提供有效粗离散但难细粒度适应;动态候选提供精细但无法覆盖更广的轨迹分布。
- AX-2(超稠密训练 / 小子集推理诱导泛化):在超稠密词表上训练、并在较小子集上推理,可迫使模型学出可泛化的打分表示。
- AX-3(感知分布漂移是 OOD 泛化的关键挑战):跨域鲁棒性主要受传感数据的感知分布漂移制约。
- AX-4(细粒度判别需专门机制):细微但安全关键的轨迹差异需要专门的精化判别训练来区分。
3. Theorems(作者可推导命题;本层薄)
骨架阶段占位。本文为竞赛技术报告型,未提出独立命题层。P3 投影时若识别出值得保留的定性命题,再实体化为 CLM 并回填 ID。
4. Evidence(实证 → CLM/EVI 映射)
骨架阶段占位(待 P3)。可用观察锚点:NAVSIM v2 挑战赛结果、GTRS-Dense / GTRS-Aug 的对比表、词表与 dropout 消融表、传感增广与精化消融。均为论文自报,无库内 EVI/VER。
5. Argument(论证结构)
- AR-1(由 AX-1 推出三支柱):同时要粗覆盖与细精度 → 动态扩散生成器(细候选)+ 词表泛化打分器(粗覆盖)+ 传感/精化增广(鲁棒)。
- AR-2(由 AX-2 推出训练/推理词表不对称):训练用 \(\mathcal V_{XL}\) 并随机 dropout 一半,推理用 \(\mathcal V_L\);由此同一打分器可评静态词表与动态候选,无需分别训练。
- AR-3(由 AX-3 推出传感增广):以受控水平视角旋转扰动输入并对真值做一致变换,提升跨域稳健性。
- AR-4(由 AX-4 推出精化训练):仅训练期加解码器对 top-\(k\) 渐进精化,EMA 教师给软监督并以 \(\delta_m\) 裁剪目标。
- AR-5(经验支撑):NAVSIM v2 挑战赛结果与消融支撑 AR-1..AR-4(属 Evidence,非证明)。
6. Commentary
作者评论
- 论文定位为 NAVSIM v2 挑战赛的获胜方案;摘要称即使在次优传感器输入下也表现优越,接近依赖真值感知的特权方法。
本库评论
- 文本形态:竞赛方案报告(方法描述简洁、依赖图表与配置),骨架按可得正文重建;实现细节需回源。
- 与 SparseDriveV2 的主张分歧(留档,不预判):GTRS 主张静态词表与动态候选需统一(并论证动态生成带来细粒度增益);SparseDriveV2(PPR-2603.29163)则主张稠密静态词表已足够、动态生成非必要。两者对照条件不同(骨干/算力/候选预算),按 D12 需先 scope 对齐,本卡不立 CFL。
- 训练/推理词表不对称是核心但脆弱的工程手法:\(\mathcal V_{XL}\) 与 \(\mathcal V_L\) 的构造与 dropout 率直接决定泛化效果,引用时须带上该配置。
- 精化为 training-only:不增加推理开销,但依赖 EMA 教师与裁剪阈值 \(\delta_m\) 的选取。
- 感知依赖:使用 BEV 分割辅助监督,非 perception-free。
- 评测域:NAVSIM v2(非反应式,BMK-006);未做反应式闭环(闭环读法见 DIS-003)。
7. Traceability
| 原文位置 | 层元素 |
|---|---|
| Abstract | AX-1、AR-1、AR-2、AR-3 |
| §3.1 Trajectory Generator | Definition(生成器) |
| §3.2 Scorer with Vocabulary Generalization | AX-1、AX-2、Definitions(\(\mathcal V_{XL}/\mathcal V_L\)、dropout)、AR-1、AR-2 |
| §3.3 Sensor-augmented Scorer with Refinement | AX-3、AX-4、Definitions(传感扰动、精化、式 1)、AR-3、AR-4 |
| §4 实验(挑战赛结果与消融) | AR-5 的经验支撑 |
Review Log
- 2026-09-14 骨架起草(Tier-1 升级批次第二批,第 9 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。
关联(5)
- PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
- PPR-2603.29163 SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- CPT-017 PDM Score (PDMS)
- DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。