FRM-2606.26017
Formalization
G2DP 五层重建:核心对象是 CPT-013 时空代价体(占据概率栅格 × 路线进度图融合)在推理期的可微引导;公理层为能量重加权目标分布、Top-K 车体聚合与末段注入等六个作者前提;论证主干是 Table 4 在同一 DiT 骨干下隔离『稠密网格 vs 稀疏实例』的引导模态消融(稀疏臂按 PPR-2501.15564 附录 C 实现、以 oracle 邻车供给)。
| id | |
|---|---|
| type | formalization |
| formalizes | PPR-2606.26017 |
| updated |
0. Overview
G2DP(PPR-2606.26017)处理的是扩散式运动规划器(diffusion-based motion planner)在闭环执行(closed-loop execution;DIS-003 的 benchmark 语义)中的约束缺失:生成模型学到的轨迹分布本身不保证安全与路线遵循,而现有引导(guidance)要么是稀疏的实例级几何查询(对少量预测邻车状态施加距离约束,视野受限于少量确定实体),要么是事后精修(post-hoc refinement,脱离学习分布并重新引入规则刚性)。它的方案是在推理期构造稠密、可微的时空代价体(CPT-013):U-Net 预测未来占据概率栅格,与路线进度图按权重 \(\gamma\) 融合为逐帧代价栅格,经车体区域 Top-K 聚合与时间求和形成能量泛函 \(E(\mathbf x)\),再用分类器引导(classifier guidance)的解析梯度注入 DPM-Solver(CPT-029)的末段采样。生成骨干(DiT,PPR-2212.09748)与占据预测器分开训练、仅在推理耦合,因此引导是即插即用模块、不重训骨干。
本重建覆盖论文 §3(方法)与 §4(实验)的全部主张,版本锚定 arXiv:2606.26017v3。阅读顺序:§1 给出术语到 CPT 的绑定与论文内定义(含公式),§2 是作者接受而未证明的六个前提(AX-1..6),§3 只有一条可推导命题(本文是实证论文,Theorems 层薄是常态、不虚构),§4 把每个实证观察映射到 CLM/EVI,§5 说明论证结构,§6 分列作者与本库评论,§7 是节/表/图到各层元素的追溯表,末尾 Review Log 记录审核状态。
1. Definitions
入库概念(→ CPT):
- 时空代价体(spatio-temporal cost volume)→ CPT-013:未来占据概率栅格与路线进度图融合成的稠密可微引导场,是本文的核心概念贡献。逐帧融合为 \(\psi_\tau(u,v)=\gamma\,O_\tau(u,v)+(1-\gamma)\,R(u,v)\)(式 1),占据权重取 \(\gamma=0.95\);车体代价为定向矩形内双线性采样值的 Top-K 均值 \(c^{(\tau)}=\frac1K\sum_{v\in\Omega_K}v\)(式 2,\(K=15\));能量为时间求和 \(E(\mathbf x)=\sum_{\tau=1}^{T}c^{(\tau)}\)(式 3)。
- DiT → PPR-2212.09748:生成骨干,在 ego 轨迹空间做保持方差的扩散(variance-preserving diffusion),以 adaLN(CPT-007,路由见 DIS-002)与交叉注意力(cross-attention,DIS-001)注入场景上下文。
- 引导模态对(grid guidance vs sparse guidance):前者是 CPT-013 的分布性稠密场,后者是 Diffusion Planner 式实例级距离函数。该对立未独立成 CPT(粒度不足),由 CLM-025 承载。
论文内定义(不满足 CPT 粒度,留 FRM 记录):ego 状态参数化 \((x_\tau,y_\tau,\cos\theta_\tau,\sin\theta_\tau)\);路线期望图 \(R(u,v)\)(路线中心线距离变换 + 前向偏好,鼓励沿路线前进);车体区域(oriented rectangular footprint)与其代价 \(c^{(\tau)}\)(式 2);能量 \(E(\mathbf x)\)(式 3)。输入表示(§3.3):占据预测器的输入是 ego-centric 鸟瞰(bird's-eye view, BEV)栅格——历史车体占位 footprint \(\mathbf P\) 与静态地图 \(\mathbf M\)——没有原始传感器(lidar/相机)通道:G2DP 全链路(含占据预测器训练)只消费 nuPlan .db 可得的标注、轨迹与地图,传感器数据(DAT-002,16.6 TB)对本论文任何复现档位都不需要。
2. Axioms(作者公理:论文接受而未证明的前提)
AX-1(引导目标分布形式化) 推理时把学习到的边际分布视为先验,用能量重加权定义目标分布
(式 4)。作者接受分类器引导的能量重加权解释适用于本设定,未论证其近似误差。
AX-2(能量泛函设计公理) 安全能量的正确形式是“车体区域内 Top-K 代价均值,再对时间求和”。Top-K 在单中心点(忽略车体尺寸)与取最大值(对单像素伪影敏感)之间取得平衡;时间求和保证预期性而非短视反应。这是设计决断,其合理性由消融(EVI-029)事后支撑而非先验证明。
AX-3(占据预测可用性公理) 冻结的 U-Net 占据预测器(focal loss 离线训练)的概率输出足够准确,可直接作为引导场消费;引导梯度不做不确定性加权。
AX-4(注入时机公理) 早期去噪步确立轨迹的宏观拓扑,因此引导只应注入末段(10 步中的第 8–9 步);过早注入会破坏模型的行为意图。
AX-5(评估协议) 闭环质量由 nuPlan 模拟器 + LQR 控制器在 NR/R 两种模式下测得;interPlan 与 DeepScenario 的零样本(不调参)结果作为泛化性证据。
AX-6(基线配方) Diffusion Planner 为共享生成管线的直接对照;其稀疏引导用 oracle 邻车轨迹实现(对稀疏方案有利的设定)。该臂的具体构造按 PPR-2501.15564 附录 C:逐邻车有向距离的碰撞能量(式 10,含 \(\Psi(x)=e^x-x\) 塑形与梯度支撑半径 \(r\))加归一化求和,是手工设计(hand-designed)、以实例索引的稀疏函数;oracle 替换只改信息供给(用 log-replay 精确邻车状态而非解码器预测),不改信号形态。
3. Theorems(作者可推导命题;本层薄)
TH-1(引导梯度解析性) 在 AX-2 的能量定义下,\(E(\mathbf x)\) 对轨迹状态的梯度可解析求出——双线性采样与 Top-K 选择均可微/可反传——因此无需训练即可把 \(-\lambda_t\nabla E\) 注入 DPM-Solver 更新(式 5)。该性质支撑引导机制的“不重训插拔”判断(论文 §3.3 推导,未单列实验;该判断现由 CLM-032 承载)。
除此之外无实质性可推导命题:本文是实证论文,论证重心在 Evidence 层,不虚构定理(元方法 failure mode 1/2)。
4. Evidence(实证 → CLM/EVI 映射)
- EV-1 — Table 1(nuPlan 三 split × NR/R 主表):系统级主结果,作为 CLM-025 命题末尾的 SOTA 背景句证据(原独立 SOTA 卡已并入);对应 EVI-024。
- EV-2 — Table 4(Test14-hard NR 引导模态消融:Grid vs Sparse(Oracle) vs None):核心论证,机制归因的直接证据;同骨干隔离同时支撑推理期正交性命题;对应 CLM-025 / CLM-032 / EVI-025。
- EV-3 — Tables 2–3(interPlan 零样本总分 + nuPlan 指标分项):泛化证据;对应 CLM-026 / EVI-026。
- EV-4 — Table 5(DeepScenario 零样本 NR,真实分布偏移):泛化证据;对应 CLM-027 / EVI-027。
- EV-5 — Fig. 8(\(\lambda_t\) × 窗口的二维扫描热力图):AX-4 的事后验证,调度敏感性使用边界证据;对应 CLM-032 / EVI-028。
- EV-6 — Table 6(聚合策略消融):AX-2 的事后验证,使用边界证据;对应 CLM-032 / EVI-029。
- EV-7 — Fig. 7(\(\gamma\) 扫描):融合权重敏感性,使用边界证据;对应 CLM-032 / EVI-030。
- EV-8 — Table 1 + Table 2 的 † 变体对照(历史输入的 reactive 消融):精修依赖对比同时支撑正交性命题的“替代事后精修”面;对应 CLM-031 / CLM-032 / EVI-031。
定性证据(未建 CLM,不入命题层):Fig. 2 多规划器闭环对比、Fig. 3 有/无引导的同初值对照、Fig. 4 引导梯度场可视化。
5. Argument(论证结构)
AR-1 “网格引导有效且优于稀疏引导”(CLM-025)是全文中心命题:EV-2 在同一骨干、同一初值下隔离了引导模态这一唯一变量,且 oracle 供给使稀疏基线处于有利条件——它是 EV-1 的 SOTA 数字可归因于引导(而非骨干)的必要前提。
AR-2 EV-1(Table 1)中 G2DP 对 Diffusion Planner 的增益与 EV-2 的消融增益互为印证:前者是系统级结果(混杂训练细节差异),后者是控制变量结果;两者一致支撑“增益来自引导设计”。
AR-3 泛化主张(CLM-026/CLM-027)依赖 AX-5 的零样本协议:模型与超参在 nuPlan 上冻结,interPlan/DeepScenario 不得调参——这使 EV-3/EV-4 的增益可归因于方法而非基准调适。
AR-4 AX-4(末段注入)由 EV-5 事后支撑;EV-6 支撑 AX-2 的 Top-K 选择;EV-7 支撑 \(\gamma=0.95\) 的融合权重。三者共同说明性能对引导调度不敏感到脆弱、但确有最优区——参数层证据闭合设计空间(三者均归入 CLM-032 的使用边界证据)。
AR-5 CLM-031(† 变体)与精修依赖对比(+4.1 vs +12.8)构成“网格引导与规则化安全准则部分对齐”的间接论证,同时解释 reactive 模式下为何去掉历史反而更好。
6. Commentary
作者评论
局限(§Conclusion 自述):依赖简化的车体矩形假设;引导调度(注入窗口、\(\lambda_t\))需调参;未来工作为端到端框架——从原始传感器直接映射到代价体,统一感知与引导生成于单循环。设计判断:占据预测与扩散骨干分开训练、推理耦合,使网格引导成为即插即用模块;概率性稠密场编码的是“风险分布”而非确定实体,故引导平滑、具预期性。开放问题:早期注入为何有害仅给出“宏观拓扑先稳”的解释假说;稀疏引导改用预测(非 oracle)邻车的表现未测。
本库评论
全部闭环数字为 nuPlan 模拟器单环境、未见多种子报告;reactive 语义依赖模拟器邻车重演实现,跨模拟器不可比。“+7.2 / +8.4 / +10.15”等增益数字口径各异(分别对最强模仿基线 / Diffusion Planner / 无引导版本),引用时必须注明对照方(EVI 各卡已注明)。稀疏引导消融仅在 Test14-hard NR 单一设定下做,“稠密优于稀疏”的普适性未跨基准复核(source gap)。\(\gamma=1.0\) 导致追尾增多、早期注入有害等机制归因是作者叙述加曲线形态支撑,无逐场景分解(A5 谨慎外推)。† 变体在 NR 上多数指标更差,“history-free 更强”严格限于 reactive/interactive 设定(CLM-031 Notes)。对照臂的构造混淆:稀疏臂是 PPR-2501.15564 附录 C 的手工设计实例级距离能量(式 10),稠密臂是学习得到的占据概率场,因此该对照同时改变了两个轴——信号形态(实例索引的确定函数 vs 以场为单位的分布)与信息内容(oracle 精确邻车状态 vs 预测占据概率);oracle 供给在信息轴上对稀疏臂有利(强化“差异来自引导形式”的归因),但它不等于“同信息、不同表示”的干净隔离。详见 EVI-025 评注与 SYN-003 的“稠密不是一个单轴”派生观察。
7. Traceability
| 论文坐标 | 层 | 元素 |
|---|---|---|
| §1 Fig. 1(teaser) | 0/6 | 问题定位(vanilla/sparse/dense 三分) |
| §3.1 | 1 | DiT 骨干 → PPR-2212.09748;ego-only 生成、DPM-Solver |
| §3.2 Eq. (1) | 1/2 | CPT-013 融合定义;AX-3(U-Net 占据) |
| §3.3 Eq. (2)(3) | 2 | AX-2(Top-K 车体聚合 + 时间求和) |
| §3.3 Eq. (4)(5) | 2/3 | AX-1;TH-1(解析梯度注入) |
| §3.4 | 2/4 | 末段注入 → AX-4 / EV-5 |
| §4.1 Table 1 | 4 | EV-1(CLM-025/EVI-024)、EV-8(CLM-031/CLM-032) |
| §4.2 Tables 2–3 | 4 | EV-3(CLM-026) |
| §4.2 Table 5 | 4 | EV-4(CLM-027) |
| §4.3 Table 4 | 4/5 | EV-2(CLM-025);AR-1/AR-2;稀疏臂构造 → PPR-2501.15564 附录 C(式 10) |
| §4.3 Fig. 7 | 4/5 | EV-7(CLM-032) |
| §4.3 Fig. 8 | 4/5 | EV-5(CLM-032);AR-4 |
| §4.3 Table 6 | 4/5 | EV-6(CLM-032) |
| §4.3 Figs. 2–4 | 4 | 定性证据(未建卡) |
| §5 Conclusion | 6 | 作者局限与未来工作 |
Review Log
- 2026-09-06:Tier-1 升级时完成 P2 骨架与 P3 投影(产出 CPT-013、CLM-025/026/027/031、EVI-024..031),早于 G1 记录要求的正式化,卡内无签发记录——如实标记为历史缺口,不补造日期。
- 2026-09-07:批裁决重组(
_issues/0001-batch-g2dp.md§八):SOTA 读数卡并入 CLM-025,三张调参读数卡删除,新增 CLM-032(推理期正交性);存留 Claim 为 CLM-025/026/027/031/032。 - 2026-09-10:P3 回填(用户指令):AX-6 补入稀疏臂的构造出处(PPR-2501.15564 附录 C 式 10)与“oracle 只改信息供给、不改信号形态”的界定;Traceability 加跨源行;本库评论补两轴混淆注记。G1 签发记录仍缺失(见上),本次回填由用户指令触发,该缺口保持可见。
- 2026-09-10:可读性重写(用户指令,对齐 D27 本体前置/连贯性与 D15 术语标注):每节改为连贯段落、补入式 (1)–(5) 的公式、术语首次括注;批裁决记录从 Commentary 移入本 Log。未改任何命题、AX/TH/EV/AR 编号与语义;本批仍无 VER 卡,验证缺口登记待 T-VERIFY。
关联(29)
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- PPR-2404.07569 Can Vehicle Motion Planning Generalize to Realistic Long-tail Scenarios?(interPlan)
- PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
- PPR-2504.17371 Highly Accurate and Diverse Traffic Data: The DeepScenario Open 3D Dataset
- PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- BMK-003 “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”
- DAT-002 nuPlan v1.1 原生数据分发(nuscenes.org,20Hz .db)
- FRM-2306.07962 Parting(Dauner 等, CoRL 2023)五层重建:论证主线是 PDM 方法族逐级构造至 PDM-Hybrid(学习模块只修正跟踪器不消费的远端路点,C-horizon 原则);开环与闭环负相关(TH-1)与规则基线强(TH-2)是引子,Val14(TH-3)是评测载体。
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- CLM-025 同一 diffusion 骨干下,稠密概率性 cost 网格引导促成平滑、预见性的避障;稀疏实例级引导即使供给 oracle 邻车轨迹仍诱发末期突变机动并损害舒适度——避障行为质量由引导信息形态决定。
- CLM-026 nuPlan 训练的模型零样本迁移 interPlan:相对共享生成管线的 Diffusion Planner 大幅领先,增益集中于安全维度(碰撞避免、TTC),progress/speed-limit 类项持平或微降;优势依场景类型非全域均匀。
- CLM-027 零样本迁移真实无人机记录的密集城市交通(DeepScenario,NR):安全与路线推进增益保持,碰撞避免与推进维度大幅超过 Diffusion Planner、推进维度反超规则基线 PDM-Closed;drivable area 与 driving direction 非最优。
- CLM-031 去掉邻车历史输入的 history-free 变体在 reactive/interactive 闭环下反而更优,且加事后规则精修后的增益依赖远小于稀疏引导对照(作者推断);该优势严格限于 reactive/interactive 设定,NR 下不成立。
- CLM-032 稠密网格引导是纯推理期模块:占据预测器与生成骨干分开训练、仅在推理耦合,不重训不改骨干即可注入解析梯度,且部分替代事后规则精修(作者推断)。
- EVI-024 Table 1:G2DP 系居纯 IL planner 首位,Test14-hard R 77.61(+7.2 over Flow Planner,+8.4 over Diffusion Planner)。
- EVI-025 Table 4:Grid +3.35 score/+3.59 collision/+4.94 TTC;Sparse(Oracle) −1.96 score/−10.13 comfort/+0.64 collision。稀疏臂按 PPR-2501.15564 附录 C 式 10 的实例级有向距离能量实现,与稠密臂在信号形态与信息内容两轴同时不同(评注已补)。
- EVI-026 Tables 2–3:interPlan 零样本 G2DP† 62.55(+9.65),collision +10.15、TTC +10.75;progress/speed limit 略降。
- EVI-027 Table 5:G2DP 较 DP collision +11.0、progress +10.5、TTC +6.7;progress/along-route 超 PDM-Closed。
- EVI-028 Fig. 8:steps 8–9 + lambda_t=0.5 峰值 77.61;早窗与 lambda_t≥0.8 均退化。
- EVI-029 Table 6:Top-15 双split峰值 92.26/80.05;Average 86.33 洗信号、Max 76.84 抗伪影差。
- EVI-030 Fig. 7:γ=0.95 峰值;γ=1.0 过度保守刹车致高密度区追尾,γ=0.2 安全弱化。
- EVI-031 Table 1/2 + 正文:G2DP† reactive +3.7、interPlan +0.81、精修依赖 +4.1 vs DP +12.8。
- CPT-007 adaptive layer norm (adaLN)
- CPT-013 spatio-temporal cost volume
- CPT-029 DPM-Solver
- SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。
- DIS-001 术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。
- DIS-002 术语 adaLN 的两种读法路由:vanilla adaLN(CPT-007)与其零初始化特化 adaLN-Zero(CPT-002)。
- DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。