PPR-2603.24581
Paper
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving |
| authors | Linbo Wang, Yupeng Zheng, Qiangyu Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu Han, Yifeng Pan, Dongbin Zhao |
| venue | arXiv:2603.24581 |
| arxiv | 2603.24581 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2603.24581v1 |
| source-hash | sha256:eae0174e386bebe813d1bea5740af24cad980975b542134569bf2c87904c7314 |
| admitted-under | U0-user-directive |
| admission-note | 用户 2026-09-10 指令性准入(D18 U0):NAVSIM 线 latent world model 分支基点;DA-WAM 直接将其作为对照坐标。 |
定位
Wang 等(2026)提出 Latent-WAM,目标是在数据与算力预算受限时提升世界模型式端到端规划的表示质量。论文把已有世界模型规划器分为两类并各指一处短板:一类经显式视频生成学规划(Epona、DriveVLA-W0),计算开销大且中间表示偏向与规划无关的视觉细节;另一类用隐式未来潜预测(LAW、World4Drive),表示轻量但质量不足——具体三点:(1) 潜表示压缩不充分;(2) 缺乏空间理解,或推理时依赖外部深度估计模型引入额外延迟;(3) 历史与动态信息利用不充分,多数方法只由第 \(T\) 帧预测第 \(T{+}1\) 帧表示。
Latent-WAM 用两个模块回应:**空间感知压缩世界编码器(Spatial-Aware Compressive World Encoder,SCWE)**把几何基础模型的知识蒸馏进视觉骨干,再用可学习 query 从增强特征中提取空间信息 token,实现场景信息的高压缩;动态潜世界模型(Dynamic Latent World Model,DLWM) 用因果 Transformer 以 ego 的历史世界状态(压缩视觉表示与运动表示)为条件,自回归预测未来世界状态,经自监督视觉预测与监督运动预测获得与规划相关的动态理解。最后由轻量轨迹解码器从世界状态表示生成轨迹。
方法(机制要点)
- SCWE:几何基础模型 → 视觉骨干的知识蒸馏;可学习 query 抽取空间感知 token;目标是高压缩且保留空间结构。
- DLWM:因果 Transformer 自回归建模,输入为历史世界状态(视觉 + 运动),输出未来世界状态;自监督视觉预测 + 监督运动预测联合训练。
- 推理链:动作条件的世界状态表示 → 轻量轨迹解码器。
- 效率主张:论文强调在更少训练数据与 104M 参数下取得更高 EPDMS。
实验结果(摘要)
- NAVSIM v2:89.3 EPDMS,论文称在 perception-free 设定下超过此前最佳同类方法(DriveVLA-W0)3.2 EPDMS。
- HUGSIM:28.9 HD-Score,45.9 RC(route completion)。
- 数据效率:论文以“性能 vs 训练数据规模”图展示在同 EPDMS 下使用显著更少训练数据、更小模型(World4Drive 因另用 ViT-L 深度估计器被单独标注)。
与本库的关系
- 准入身份:U0-user-directive(用户 2026-09-10 指令性准入)。
- 谱系定位:latent world model 分支。上游引用 DriveWorld(PPR-2405.04390)、LAW(PPR-2406.08481)、World4Drive(PPR-2507.00603)、DriveVLA-W0(PPR-2510.12796)、Epona(PPR-2506.24113)、OccWorld、GAIA-1、Vista 等;被 DA-WAM(PPR-2608.19085)作为“联合训练 EMA 潜目标但测试时丢弃动力学分支”的对照;被 Drive-JEPA(PPR-2601.22032)等引用。评测同时锚定 BMK-006(NAVSIM v2)与 HUGSIM(PPR-2412.01718)。
承重关系
- provenance:v1 tarball sha256
eae0174e…04c7314,缓存cache/sources/2603.24581/。
关联(13)
- PPR-2311.16038 OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
- PPR-2405.04390 DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous Driving
- PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World Model
- PPR-2412.01718 HUGSIM: A Real-Time, Photo-Realistic and Closed-Loop Simulator for Autonomous Driving
- PPR-2506.24113 Epona: Autoregressive Diffusion World Model for Autonomous Driving
- PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
- PPR-2510.12796 DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
- PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
- PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2412.01718 HUGSIM 五层重建(骨架):核心对象是基于 3D 高斯泼溅的重建式照片级闭环仿真器——分解式场景表示(地面多平面约束 + 单轮车正则的动态车 + 3DRealCar 非原生车)、LQR 与运动学自行车模型的闭环、IDM 正常与攻击代价搜索的激进 actor,以及 HD-Score(NC/DAC 门控 × TTC/COM 加权,再乘路线完成度 R_c);公理层含『评估需闭环』『闭环视觉评测需照片级渲染』与『闭环中 EP 不适用』。
- FRM-2603.24581 Latent-WAM 五层重建(骨架):核心对象是空间感知压缩世界编码器(可学习 scene query 压缩多视角图像 + 几何基础模型蒸馏)与动态潜世界模型(因果 Transformer 自回归预测未来世界状态,3D-RoPE + teacher forcing mask + ego 状态监督);公理层含『世界状态须轻量以支撑长时程转移』与『推理只需 SCWE + 轨迹解码器』;论证为对既有世界模型三缺陷(压缩不足/空间理解缺/历史动态利用不足)的逐项回应。
- IDX-001 NAVSIM 规划线