Research KB 登录

PPR-2406.08481 Paper

Enhancing End-to-End Autonomous Driving with Latent World Model

id
updated
type paper
title Enhancing End-to-End Autonomous Driving with Latent World Model
authors Yingyan Li, Lue Fan, Jiawei He, Yu-Quan Wang, Yuntao Chen, Zhaoxiang Zhang
venue ICLR 2024 (arXiv:2406.08481)
arxiv 2406.08481
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2406.08481v2
source-hash sha256:82e111594cc9fbd3ede23a9bdc9c1d01b7946e616808ce7f448d8876ace34fa7
admitted-under A2-direct-edge
admission-note 被 DA-WAM、Latent-WAM、DA-WAM 谱系直接引用为 latent world model 规划的核心前置;库内多卡引用。

定位

Li 等(ICLR 2024)提出 LAW(LAtent World model)。论文的问题是:端到端规划器直接利用原始传感器数据可抽取更丰富场景特征,但如何学到更好的场景特征表示以充分利用传感器数据尚未解决。受自监督学习在自然语言与视觉中成功的启发,论文提出用潜世界模型做自监督:LAW 以当前特征与 ego 轨迹为条件预测未来场景特征。该自监督任务可无缝接入感知免标注(perception-free)与有感知(perception-based)两类框架,改善场景特征学习并优化轨迹预测。论文报告在 nuScenes 开环、NAVSIM 与 CARLA 闭环多个基准上取得领先。

与本库的关系

  • 准入身份:A2-direct-edge(被 DA-WAM、Latent-WAM 等直接引用)。
  • 谱系定位:latent world model 规划线的核心前置。下游 World4Drive(PPR-2507.00603)、Latent-WAM(PPR-2603.24581)、DA-WAM(PPR-2608.19085)、Drive-JEPA(PPR-2601.22032)、Auto-JEPA(PPR-2607.29031)均以其为坐标;DA-WAM 指出 LAW 属“预测预训练与规划器优化阶段分离”一类。评测锚定 BMK-006、nuScenes、CARLA。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(13)

  • PPR-2405.04390 DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous Driving
  • PPR-2504.01941 End-to-End Driving with Online Trajectory Evaluation via BEV World Model
  • PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
  • PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
  • PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
  • PPR-2607.29031 Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
  • PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2406.08481 LAW 五层重建(骨架):核心对象是一个可插入既有框架的潜世界模型自监督任务——把当前帧视觉潜表示与 ego waypoint 向量拼接经 MLP 构成动作感知潜表示,由 transformer 式潜世界模型预测下一帧的视觉潜表示,并以真实下一帧提取的潜表示做 MSE 监督,从而在无需人工标签的前提下优化场景特征与轨迹预测;公理层含『自监督表示学习在 NLP/CV 的成功可迁移到驾驶』与『未来帧潜表示可由当前潜表示与 ego 轨迹预测』。
  • FRM-2504.01941 WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。
  • FRM-2507.00603 World4Drive 五层重建(骨架):核心对象是免感知标注的意图感知物理潜世界模型——意图编码器把轨迹词表端点聚成 3 命令 × 6 意图,物理世界潜编码器用视觉基础模型(Grounded-SAM 伪语义 + 度量深度前向投影)注入空间语义先验,世界模型按各意图预测未来潜状态并由选择器以潜距离选模、ScoreNet 打分;训练全靠与真实未来观测的潜空间自监督对齐,公理层含『既有方法直接取相机特征作潜表示而缺空间语义理解』。
  • FRM-2605.09701 DriveFuture 五层重建(骨架):核心主张是潜世界模型的关键不在于模拟未来状态、而在于以未来状态条件化当前决策——先由共享 BEV 编码器与轨迹编码器经可学未来查询预测“轨迹条件下的未来潜状态”,训练时用条件源随机化(真值/等加速度运动学代理/空 token)支撑推理期无真值轨迹与 CFG,再用单层交叉注意力把该预测潜与带 stop-gradient 的真实未来观测潜接地,最后以其显式条件化一个扩散轨迹规划器;公理层含『把未来潜当预测目标/辅助信号会使当前与未来特征在潜空间纠缠』。
  • IDX-001 NAVSIM 规划线