PPR-2507.00603
Paper
World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
| id | |
|---|---|
| updated | |
| type | paper |
| title | World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model |
| authors | Yupeng Zheng, Pengxuan Yang, Zebin Xing, Qichao Zhang, Yuhang Zheng, Yinfeng Gao |
| venue | ICCV 2025 (arXiv:2507.00603) |
| arxiv | 2507.00603 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2507.00603v1 |
| source-hash | sha256:ca919a4b1ae0e2069fafc4e7fc96a60fb3c8ff911426a5e7f36a900024474dc6 |
| admitted-under | A2-direct-edge |
| admission-note | 被 Latent-WAM(PPR-2603.24581)作为感知免标注同类对照、被 DA-WAM(PPR-2608.19085)直接引用为“意图条件潜未来”代表。 |
定位
Zheng 等(ICCV 2025)提出 World4Drive。问题设定是:端到端驾驶直接从原始传感器生成规划轨迹,但通常依赖昂贵的感知监督来抽取场景信息;核心挑战在于如何构建信息充分的驾驶世界模型,以自监督方式实现无感知标注的端到端规划。World4Drive 用视觉基础模型构建潜在世界模型来生成与评估多模轨迹:先抽取场景特征(包括驾驶意图与由视觉基础模型提供空间语义先验的世界潜表示),再据当前场景特征与驾驶意图生成多模规划轨迹并预测多个意图驱动的未来潜状态,最后用一个世界模型选择器评估并选出最优轨迹。目标是感知免标注、端到端规划。
与本库的关系
- 准入身份:A2-direct-edge(被 Latent-WAM、DA-WAM 直接引用)。
- 谱系定位:latent world model 规划线。上游接 LAW(PPR-2406.08481);下游与 Drive-JEPA(PPR-2601.22032)、Latent-WAM(PPR-2603.24581)、DA-WAM(PPR-2608.19085)在“未来潜是否/如何进入打分”上分化:World4Drive 用意图条件潜未来 + 选择器,DA-WAM 强调每候选一对一未来潜条件打分。评测锚定 BMK-006。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(11)
- PPR-2405.04390 DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous Driving
- PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World Model
- PPR-2504.01941 End-to-End Driving with Online Trajectory Evaluation via BEV World Model
- PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
- PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
- PPR-2605.09701 DriveFuture: Future-Aware Latent World Models for Autonomous Driving
- PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2406.08481 LAW 五层重建(骨架):核心对象是一个可插入既有框架的潜世界模型自监督任务——把当前帧视觉潜表示与 ego waypoint 向量拼接经 MLP 构成动作感知潜表示,由 transformer 式潜世界模型预测下一帧的视觉潜表示,并以真实下一帧提取的潜表示做 MSE 监督,从而在无需人工标签的前提下优化场景特征与轨迹预测;公理层含『自监督表示学习在 NLP/CV 的成功可迁移到驾驶』与『未来帧潜表示可由当前潜表示与 ego 轨迹预测』。
- FRM-2507.00603 World4Drive 五层重建(骨架):核心对象是免感知标注的意图感知物理潜世界模型——意图编码器把轨迹词表端点聚成 3 命令 × 6 意图,物理世界潜编码器用视觉基础模型(Grounded-SAM 伪语义 + 度量深度前向投影)注入空间语义先验,世界模型按各意图预测未来潜状态并由选择器以潜距离选模、ScoreNet 打分;训练全靠与真实未来观测的潜空间自监督对齐,公理层含『既有方法直接取相机特征作潜表示而缺空间语义理解』。
- IDX-001 NAVSIM 规划线