PPR-2309.17080
Paper
GAIA-1: A Generative World Model for Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | GAIA-1: A Generative World Model for Autonomous Driving |
| authors | Anthony Hu, Lloyd Russell, Hudson Yeo, Zak Murez, George Fedoseev, Alex Kendall |
| venue | arXiv:2309.17080 |
| arxiv | 2309.17080 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2309.17080v1 |
| source-hash | sha256:1837d7728a400c77d6643fc40fe42229dcb93361f73c7b94601fa7570c76ec85 |
| admitted-under | A2-direct-edge |
| admission-note | 被 HUGSIM、Latent-WAM 等直接引用为生成式驾驶世界模型的早期代表。 |
定位
Hu 等(2023,Wayve)提出 GAIA-1(Generative AI for Autonomy)。论文的出发点是:自动驾驶要在非结构化真实世界中安全导航,关键难点是有效预测随自车动作展开的各种可能未来。GAIA-1 是一个生成式世界模型,以视频、文本与动作作为输入来生成真实感驾驶场景,并对 ego 行为与场景特征提供细粒度控制。方法上把世界建模表述为无监督序列建模:把输入映射为离散 token,预测序列中的下一 token。论文报告模型涌现出高层结构与场景动态的学习、上下文意识、泛化与几何理解等性质,且其学得表示对未来事件有预期能力。
与本库的关系
- 准入身份:A2-direct-edge(被 HUGSIM、Latent-WAM 等直接引用)。
- 谱系定位:生成式驾驶世界模型的基础参照。上游接离散 token 生成建模;下游 DrivingGPT(PPR-2412.18607)把世界建模与规划统一为多模 token 序列预测,OccWorld(PPR-2311.16038)改在 3D 占用空间,Vista(PPR-2405.17398)/Epona(PPR-2506.24113)改在视频扩散空间。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(8)
- PPR-2311.16038 OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
- PPR-2405.17398 Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
- PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
- PPR-2506.24113 Epona: Autoregressive Diffusion World Model for Autonomous Driving
- FRM-2309.17080 GAIA-1 五层重建(骨架):核心对象是把驾驶世界建模铸成无监督序列建模的生成式世界模型——视频、文本、动作分别编码为离散/连续 token(图像每帧 576 token,文本来自 T5-large,动作仅速度与曲率两个标量),按“文本—图像—动作”交错成一个序列,用自回归 transformer 预测下一个图像 token,再由单独训练的视频解码器还原到像素空间;公理层含『压缩应朝向语义而非高频』与『预测自车动作的多种未来结果是安全导航的关键问题』。
- FRM-2412.18607 DrivingGPT 五层重建(骨架):核心对象是把驾驶仿真与轨迹规划统一为单一序列建模问题——用 VQ-VAE 把前视图像压成图像 token、把“帧间相对”轨迹分量按分位数裁剪后分箱成动作 token,交错成一种多模态驾驶语言(统一词表大小 D+3M),由自回归 transformer 以标准 next-token 预测同时承载世界建模与端到端策略两个子任务;公理层含『因果式长动作视界会让模型复制历史动作而非基于观测驾驶』与『视频扩散世界模型缺乏纳入动作模态的灵活性』。
- FRM-2506.24113 Epona 五层重建(骨架):核心对象是把驾驶世界建模重构为“时间域上的顺序未来预测”的自回归扩散世界模型——既不像视频扩散那样对固定长度帧序列做全局联合分布建模(破坏因果时序),也不像 token 式自回归那样逐 token 预测(弱化空间相关并扭曲高频),而是分离出策略 π(TrajDiT 预测轨迹)与整帧条件分布 p(VisDiT 生成下一帧),由多模态时空 transformer 编码历史,并用 chain-of-forward 训练抑制自回归误差累积;世界模型因此可同时充当实时运动规划器。
- IDX-001 NAVSIM 规划线