Research KB 登录

PPR-2311.17918 Paper

Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving

id
updated
type paper
title Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
authors Yu-Quan Wang, Jiawei He, Lue Fan, Hongxin Li, Yuntao Chen, Zhaoxiang Zhang
venue CVPR 2024 (arXiv:2311.17918)
arxiv 2311.17918
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2311.17918v1
source-hash sha256:9dcdd41a41c3778e95677d7e2c73797293ae4b7165cc70a2778e6309b1cd0d71
admitted-under A2-direct-edge
admission-note 被 DA-WAM、Latent-WAM 直接引用为“生成未来视图用于规划”的代表。

定位

Wang 等(CVPR 2024)提出 Drive-WM。论文的动机是:在自动驾驶中提前预测事件并评估可预见风险,能帮助自车更好地规划动作、提升安全与效率。关键思路是让驾驶世界模型与既有端到端规划模型兼容。方法上通过视图分解(view factorization)做联合时空建模,生成高保真的多视角驾驶视频;在此基础上展示世界模型用于安全规划的可能:模型可基于不同驾驶机动推演多个未来,再依据图像式奖励确定最优轨迹。论文报告在真实驾驶数据集上生成高质量、连贯且可控的多视角视频,为真实世界仿真与安全规划打开空间。

与本库的关系

  • 准入身份:A2-direct-edge(被 DA-WAM、Latent-WAM 直接引用)。
  • 谱系定位:显式视频生成世界模型的一支,DA-WAM 把它归入“把预测未来更直接地带进规划、但预测状态常被共享/池化/弱关联”一类,是 DA-WAM 一对一未来潜主张的直接对照。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(5)

  • PPR-2405.17398 Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
  • PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
  • PPR-2504.01941 End-to-End Driving with Online Trajectory Evaluation via BEV World Model
  • FRM-2311.17918 Drive-WM 五层重建(骨架):核心对象是首个与既有端到端规划器兼容的多视图驾驶世界模型——以“视图因式化”的联合时空建模在图像扩散模型上挂时序层与多视图层(冻结图像权重、只微调新增层)生成一致的多视图视频,并把它用于规划:规划器从真实多视图图采候选轨迹,按动作条件生成各候选的未来视频,用基于生成视频感知结果的图像奖励(地图奖励 × 物体奖励)选最优轨迹并迭代成树式 rollout。
  • IDX-001 NAVSIM 规划线