Research KB 登录

PPR-2405.04390 Paper

DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous Driving

id
updated
type paper
title DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous Driving
authors Chen Min, Dawei Zhao, Liang Xiao, Jian Zhao, Xinli Xu, Zheng Zhu
venue CVPR 2024 (arXiv:2405.04390)
arxiv 2405.04390
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2405.04390v1
source-hash sha256:1485e3f6fb647f528d08cd22dee22ce713d22c4401be6186ef72c60e28d26ae6
admitted-under A2-direct-edge
admission-note 被 Latent-WAM、DA-WAM 直接引用为“用时序预测增强场景表示”一类的代表。

定位

Min 等(CVPR 2024)提出 DriveWorld。论文指出视觉中心自动驾驶的预训练多依赖 2D 或 3D 预文本任务,忽略自动驾驶作为 4D 场景理解任务的时序特性。为此提出基于世界模型的 4D 表示学习框架,可从多相机驾驶视频做时空预训练:核心是记忆状态空间模型(Memory State-Space Model),含动态记忆库(Dynamic Memory Bank,学时序感知的潜动态以预测未来变化)与静态场景传播(Static Scene Propagation,学空间感知的潜静态以提供完整场景上下文);另引入任务提示(Task Prompt)解耦不同下游任务的特征。

与本库的关系

  • 准入身份:A2-direct-edge(被 Latent-WAM、DA-WAM 直接引用)。
  • 谱系定位:世界模型预训练线。DA-WAM 把 DriveWorld 归入“用时序预测增强场景表征、预测预训练与规划器优化阶段分离”一类,是本卡与 DA-WAM 定位段论述的锚点;与 LAW(PPR-2406.08481)、World4Drive(PPR-2507.00603)同族。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(7)

  • PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World Model
  • PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
  • PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
  • PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
  • FRM-2311.16038 OccWorld 五层重建(骨架):核心对象是在 3D 占据空间里做世界建模——以 VQ-VAE 式自监督场景 tokenizer 把 3D 占据压成离散高层 token(BEV 化 + 类别嵌入 + 码本),再以 GPT 式但“一次预测一组 token”的空间-时序生成 transformer(空间自注意力 + 2×2 窗口层次化下采样 K 次 + 各尺度子世界模型)同时生成未来占据与 ego 轨迹;公理层含『物体框预测无法捕捉更细粒度场景信息』与『占据只给低层级理解、需自监督 token 化』。
  • FRM-2405.04390 DriveWorld 五层重建(骨架):核心对象是面向 4D 场景理解的驾驶世界模型预训练——记忆状态空间模型把沿时间传达的信息拆成时序感知的潜动态(动态记忆库:后验/先验状态分布匹配 + 运动感知层归一化)与空间感知的潜静态(静态场景传播:取某帧 BEV 特征作潜结构、不做形变对齐),以 3D/4D 占据预测为 pretext,并用 LLM 文本产生的任务提示解耦各下游任务的表示;公理层含『既有视觉预训练多为 2D/3D pretext 忽略时序』与『占据比深度/2D 重建给出更完备几何先验』。
  • IDX-001 NAVSIM 规划线