PPR-2405.17398
Paper
Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
| id | |
|---|---|
| updated | |
| type | paper |
| title | Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability |
| authors | Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu, Andreas Geiger |
| venue | NeurIPS 2024 (arXiv:2405.17398) |
| arxiv | 2405.17398 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2405.17398v5 |
| source-hash | sha256:e7e2825cb2843fbdf18059b79344dec30e2e19af0e7ae48ef4ec0799aa63e72c |
| admitted-under | A2-direct-edge |
| admission-note | 被 HUGSIM、Latent-WAM 等直接引用为驾驶视频世界模型的代表。 |
定位
Gao 等(NeurIPS 2024,图宾根 / 上海 AI Lab)提出 Vista。论文诊断既有驾驶世界模型的三点不足:泛化到未见环境、关键细节的预测保真度、以及动作可控性。回应方式是三项设计:为在高分辨率下准确预测真实世界动态,提出两种新损失以促进运动实例与结构信息的学习;设计有效的潜替换方法,把历史帧作为先验注入以支持连贯的长时程 rollout;为动作可控性,把从高层意图(命令、目标点)到低层机动(轨迹、角度、速度)的多种控制经高效学习策略纳入。大规模训练后,论文报告在未见环境上的泛化、长时程生成与下游规划上都有表现。
与本库的关系
- 准入身份:A2-direct-edge(被 HUGSIM、Latent-WAM 等直接引用)。
- 谱系定位:驾驶视频世界模型线。与 GAIA-1(PPR-2309.17080)的离散 token 自回归、Drive-WM(PPR-2311.17918)的多视角预测、Epona(PPR-2506.24113)的自回归扩散在“预测媒介与可控接口”上构成同一设计空间;Latent-WAM 把同类显式视频生成路线列为高算力对照。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(8)
- PPR-2309.17080 GAIA-1: A Generative World Model for Autonomous Driving
- PPR-2311.17918 Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
- PPR-2506.24113 Epona: Autoregressive Diffusion World Model for Autonomous Driving
- FRM-2309.17080 GAIA-1 五层重建(骨架):核心对象是把驾驶世界建模铸成无监督序列建模的生成式世界模型——视频、文本、动作分别编码为离散/连续 token(图像每帧 576 token,文本来自 T5-large,动作仅速度与曲率两个标量),按“文本—图像—动作”交错成一个序列,用自回归 transformer 预测下一个图像 token,再由单独训练的视频解码器还原到像素空间;公理层含『压缩应朝向语义而非高频』与『预测自车动作的多种未来结果是安全导航的关键问题』。
- FRM-2311.17918 Drive-WM 五层重建(骨架):核心对象是首个与既有端到端规划器兼容的多视图驾驶世界模型——以“视图因式化”的联合时空建模在图像扩散模型上挂时序层与多视图层(冻结图像权重、只微调新增层)生成一致的多视图视频,并把它用于规划:规划器从真实多视图图采候选轨迹,按动作条件生成各候选的未来视频,用基于生成视频感知结果的图像奖励(地图奖励 × 物体奖励)选最优轨迹并迭代成树式 rollout。
- FRM-2405.17398 Vista 五层重建(骨架):核心对象是可泛化、高保真且动作可控的驾驶视频世界模型——第一阶段把 SVD 改造成预测模型(首帧作条件、弃用噪声增强),用“潜替换”注入最多三帧动态先验(位置/速度/加速度由三帧决定),并加动力学增强损失(按运动差异加权)与结构保持损失(频域高通)保细节;第二阶段以统一 Fourier 嵌入 + UNet 交叉注意力(零初始化投影 + LoRA)学四类异构动作控制(角度速度/轨迹/命令/目标点),并以模型自身预测不确定性作通用奖励。
- FRM-2506.24113 Epona 五层重建(骨架):核心对象是把驾驶世界建模重构为“时间域上的顺序未来预测”的自回归扩散世界模型——既不像视频扩散那样对固定长度帧序列做全局联合分布建模(破坏因果时序),也不像 token 式自回归那样逐 token 预测(弱化空间相关并扭曲高频),而是分离出策略 π(TrajDiT 预测轨迹)与整帧条件分布 p(VisDiT 生成下一帧),由多模态时空 transformer 编码历史,并用 chain-of-forward 训练抑制自回归误差累积;世界模型因此可同时充当实时运动规划器。
- IDX-001 NAVSIM 规划线