FRM-2412.18607
Formalization
DrivingGPT 五层重建(骨架):核心对象是把驾驶仿真与轨迹规划统一为单一序列建模问题——用 VQ-VAE 把前视图像压成图像 token、把“帧间相对”轨迹分量按分位数裁剪后分箱成动作 token,交错成一种多模态驾驶语言(统一词表大小 D+3M),由自回归 transformer 以标准 next-token 预测同时承载世界建模与端到端策略两个子任务;公理层含『因果式长动作视界会让模型复制历史动作而非基于观测驾驶』与『视频扩散世界模型缺乏纳入动作模态的灵活性』。
| id | |
|---|---|
| type | formalization |
| formalizes | PPR-2412.18607 |
| updated |
0. Overview
DrivingGPT(PPR-2412.18607,Chen 等 2024)主张把驾驶仿真与轨迹规划统一进单一序列建模问题。论文的诊断:基于世界模型的搜索与规划被广泛视为通向人类水平物理智能的有前景路径,但当前驾驶世界模型主要依赖视频扩散模型——它们擅长视觉生成,却缺乏纳入动作等其他模态的灵活性;相反,自回归 transformer 在多模态数据建模上表现卓越。为此论文引入一种基于交错图像与动作 token 的多模态驾驶语言,并构建 DrivingGPT 以标准的 next-token 预测同时学习联合世界建模与规划;论文报告其在动作条件的视频生成与端到端规划上均表现良好,在大规模 nuPlan 与 NAVSIM 上超过强基线。
本重建覆盖 Abstract 与 §3(Driving as Next Token Prediction:问题形式化、多模态驾驶语言),版本锚定 arXiv:2412.18607v3。
1. Definitions
入库概念(→ CPT):
论文内定义(未入库概念,标 CANDIDATE,不新建 CPT):
- 问题形式化:驾驶建模为(部分可观测的)马尔可夫决策过程——状态空间 \(S\)、动作空间 \(A\)、随机转移 \(P(\mathbf s_{t+1}\mid\mathbf s_t, \mathbf a_t)\)、奖励 \(R\),并因只能观测到含噪的 \(\mathbf o_t\) 而引入观测概率 \(Z(\mathbf o_t\mid\mathbf s_t)\)。端到端策略 \(\pi(\mathbf a_t\mid\mathbf o_t)\) 与观测空间随机转移 \(P(\mathbf o_{t+1}\mid\mathbf o_t,\mathbf a_t)\) 都被视为重要,论文寻求把二者统一为单一序列建模任务。
- 观测 token 化:为简单起见观测空间只含前视相机图像 \(\mathbf o_i\in\mathbb R^{3\times H\times W}\)(环视相机、LiDAR、IMU 留待未来);为在图像压缩的信息损失与 transformer 有限上下文之间折中,用 VQ-VAE 把图像下采样为 \(\frac HS\times\frac WS\) 个 token(词表大小 \(D\))。
- 动作 token 化(帧间相对):与多数端到端规划器一次预测跨越 \(N\) 步的整条绝对轨迹不同,论文指出 next-token 预测的因果性禁止构造长动作视界序列——若用 \(N\) 步动作视界,最后一个历史动作将包含直到 \(N-1\) 的全部未来动作,模型会学会复制历史动作而非基于观测驾驶。故预测帧间相对轨迹 \((\mathbf a_t,\dots,\mathbf a_{t+N})=(T_{t+1\to t},T_{t+2\to t+1},\dots)\),其中 \(T_{i\to j}=(\Delta x_{ij},\Delta y_{ij},\Delta\theta_{ij})\)。量化时先把每个分量裁剪到其 1% 与 99% 分位之间 \(\bar{\mathbf a}_t=\min(\max(\mathbf a_t,\mathbf a^\text{1st}), \mathbf a^\text{99th})\),再均匀分 \(M\) 箱 \(\mathbf q_t=\lfloor(\bar{\mathbf a}_t-\mathbf a^\text{1st})/ (\mathbf a^\text{99th}-\mathbf a^\text{1st})\cdot(M-1)\rfloor\);因 \(x,y,\theta\) 量级与单位不同,三者用不同词表分别量化以减少信息损失。
- 统一视觉—动作序列建模:把序列构造为 \(\mathbf z_1,\mathbf q_1,\mathbf z_2,\mathbf q_2,\dots,\mathbf z_T, \mathbf q_T\),用带因果掩码的自回归 transformer 建模。视觉与动作被当作“两种外语”共用统一词表,总量为 \(D+3M\)(\(D\) 为 VQ-VAE 码本大小,\(3M\) 为动作词表);图像与动作 token 都用逐帧 1D 旋转位置编码;训练用标准交叉熵 \(\sum_t-\log p_\theta(x_t\mid x_{<t})\)。
- 两个子任务:该语言模型显式包含世界建模 \(p_\theta(\mathbf z_t\mid\mathbf z_{<t},\mathbf q_{<t})\) 与端到端驾驶 \(p_\theta(\mathbf q_t\mid\mathbf z_{\le t},\mathbf q_{<t})\) 作为子任务。
2. Axioms(作者公理:论文接受而未证明的前提)
- AX-1(世界模型路径):基于世界模型的搜索与规划是通向人类水平物理智能的有前景路径。
- AX-2(视频扩散的局限):当前驾驶世界模型主要依赖视频扩散模型,擅长视觉生成但缺乏纳入动作等其他模态的灵活性。
- AX-3(自回归的多模态优势):自回归 transformer 在多模态数据建模上具有卓越能力,适合统一视觉与动作。
- AX-4(策略与转移并重):端到端策略与观测空间随机转移都对驾驶重要,值得统一建模。
- AX-5(长动作视界的因果问题):在因果 next-token 预测下,长动作视界会让模型从历史动作获得过多特权信息,从而学会复制历史动作而非依据观测驾驶。
3. Theorems(作者可推导命题;本层薄)
骨架阶段占位。本文为序列建模方法型,未提出独立命题层。P3 投影时若识别出值得保留的定性命题,再实体化为 CLM 并回填 ID。
4. Evidence(实证 → CLM/EVI 映射)
骨架阶段占位(待 P3)。可用观察锚点:动作条件的视频生成质量、nuPlan 与 NAVSIM 上的规划结果、动作视界与相对/绝对轨迹表示、分组件量化与统一词表的消融。均为论文自报,无库内 EVI/VER。
5. Argument(论证结构)
- AR-1(由 AX-1 + AX-2 + AX-3 推出统一序列建模):以交错图像/动作 token 的多模态驾驶语言替代视频扩散,统一仿真与规划。
- AR-2(由 AX-4 推出子任务结构):同一自回归模型同时承载世界建模与端到端策略两个条件分布。
- AR-3(由 AX-5 推出动作表示设计):采用帧间相对轨迹、短动作视界与按分量分别量化的词表,避免特权信息泄漏。
- AR-4(观测 token 化):以 VQ-VAE 折中压缩损失与上下文长度。
- AR-5(训练配方):统一词表 \(D+3M\) + 逐帧 1D 旋转位置编码 + 标准交叉熵。
- AR-6(经验支撑):nuPlan 与 NAVSIM 上的生成与规划结果支撑 AR-1..AR-5(属 Evidence,非证明)。
6. Commentary
作者评论
- 摘要强调:以交错图像与动作 token 的驾驶语言统一世界建模与规划,用标准 next-token 预测即可同时胜任动作条件视频生成与端到端规划。
本库评论
- 与 GAIA-1 的同轴与差异(承重):GAIA-1(PPR-2309.17080)同样把世界建模铸为 token 序列预测并接受动作条件,但动作仅为速度与曲率两个连续标量、且分别经线性层映射;DrivingGPT 的关键差异是把动作也离散化进统一词表并采用帧间相对表示——该差异正是其对因果泄漏问题的回答,比较两者时应以此轴区分。
- 单前视观测空间的简化:论文明确只含前视相机,环视/LiDAR/IMU 留待未来;故其结论不能直接外推到多传感器设定的规划性能。
- 评测跨两套口径:nuPlan(大规模)与 NAVSIM(BMK-006 / CPT-017)并列,引用具体数字须注明基准。
- “统一”主张的强度:所谓统一是“同一序列模型可执行两个条件预测”,并非在同一解码过程中耦合;引用时不宜放大为“仿真与规划在一次前向中完成”。
7. Traceability
| 原文位置 | 层元素 |
|---|---|
| Abstract | AX-1、AX-2、AX-3、AR-1 |
| §3.1 Problem Formulation(MDP/POMDP) | AX-4、Definition(问题形式化) |
| §3.2 Observation Tokenization | Definition(前视观测、VQ-VAE)、AR-4 |
| §3.2 Action Tokenization | AX-5、Definition(帧间相对、分位裁剪与分箱、分组件词表)、AR-3 |
| §3.2 Unified Visual Action Sequence Modeling(式 1) | Definition(统一词表、RoPE、子任务)、AR-5 |
| §4 实验(nuPlan、NAVSIM) | AR-6 的经验支撑 |
Review Log
- 2026-09-14 骨架起草(Tier-1 展开批次,第 34 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。
关联(4)
- PPR-2309.17080 GAIA-1: A Generative World Model for Autonomous Driving
- PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- CPT-017 PDM Score (PDMS)