Research KB 登录

PPR-2412.18607 Paper

DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers

id
updated
type paper
title DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
authors Yuntao Chen, Yu-Quan Wang, Zhaoxiang Zhang
venue ICCV 2025 (arXiv:2412.18607)
arxiv 2412.18607
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2412.18607v1
source-hash sha256:fb5996c977d10fa728441fde659d453732cc7ac1e2b6a56384ae9ab87b54fd95
admitted-under A2-direct-edge
admission-note 被 DA-WAM、DiffusionDriveV2、Latent-WAM 引用为“世界建模与规划统一为序列建模”的代表。

定位

Chen 等(ICCV 2025)提出 DrivingGPT。论文的观察是:基于世界模型的搜索与规划被视为通向物理智能的路径,但既有驾驶世界模型多依赖视频扩散模型——擅长视觉生成,却缺乏纳入动作等其他模态的灵活性;相较之下自回归 transformer 在多模数据建模上表现出能力。DrivingGPT 把驾驶仿真与轨迹规划统一为单一序列建模问题:提出基于交错图像 token 与动作 token 的多模驾驶语言,用标准下一 token 预测学习联合的世界建模与规划。论文报告在动作条件视频生成与端到端规划(VQ token 空间)两方面都具表现,并在 nuPlan 与 NAVSIM 上超过强基线。

与本库的关系

  • 准入身份:A2-direct-edge(被 DA-WAM、DiffusionDriveV2、Latent-WAM 引用)。
  • 谱系定位:世界模型与规划统一的序列建模范式,与 Drive-WM(PPR-2311.17918)的视频扩散、OccWorld(PPR-2311.16038)的占用生成、GAIA-1(PPR-2309.17080)的离散 token 自回归构成表示媒介的设计空间。评测锚定 BMK-006 与 nuPlan。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(8)

  • PPR-2309.17080 GAIA-1: A Generative World Model for Autonomous Driving
  • PPR-2311.16038 OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
  • PPR-2311.17918 Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
  • PPR-2506.13757 AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2412.18607 DrivingGPT 五层重建(骨架):核心对象是把驾驶仿真与轨迹规划统一为单一序列建模问题——用 VQ-VAE 把前视图像压成图像 token、把“帧间相对”轨迹分量按分位数裁剪后分箱成动作 token,交错成一种多模态驾驶语言(统一词表大小 D+3M),由自回归 transformer 以标准 next-token 预测同时承载世界建模与端到端策略两个子任务;公理层含『因果式长动作视界会让模型复制历史动作而非基于观测驾驶』与『视频扩散世界模型缺乏纳入动作模态的灵活性』。
  • FRM-2506.24113 Epona 五层重建(骨架):核心对象是把驾驶世界建模重构为“时间域上的顺序未来预测”的自回归扩散世界模型——既不像视频扩散那样对固定长度帧序列做全局联合分布建模(破坏因果时序),也不像 token 式自回归那样逐 token 预测(弱化空间相关并扭曲高频),而是分离出策略 π(TrajDiT 预测轨迹)与整帧条件分布 p(VisDiT 生成下一帧),由多模态时空 transformer 编码历史,并用 chain-of-forward 训练抑制自回归误差累积;世界模型因此可同时充当实时运动规划器。
  • IDX-001 NAVSIM 规划线