Research KB 登录

PPR-2608.19085 Paper

DA-WAM: Decision-Aligned Future Latents for Driving World Models

id
updated
type paper
title DA-WAM: Decision-Aligned Future Latents for Driving World Models
authors Ruiguo Zhong, Benshan Ma, Xiaolong Chen, Lang Zhang, Mingyue Feng, Yaonong Wang, Pei Liu, Jun Ma
venue arXiv:2608.19085(ICLR 2027 投稿格式)
arxiv 2608.19085
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2608.19085v2
source-hash sha256:4a11e581609809f0e2b799d06c01e865b40cdaa856946d85c3ff05f86edba9d0
admitted-under U0-user-directive
admission-note 用户 2026-09-10 指令性准入(D18 U0):作为 NAVSIM 线世界模型分支的基点之一。Tier-1 候选(是否升 Tier-1 须人工确认)。

定位

Zhong 等(2026,HKUST(GZ) / Leapmotor)提出 DA-WAM。出发点是:世界模型用于决策的价值不在于“能否预测未来”,而在于预测是否决策信息化(decision-informative)——每条候选动作的预测后果应直接决定该轨迹的评分。论文把已有路线归为两类,认为二者都未保证这一耦合:一类(DriveWorld、LAW、Drive-JEPA、Latent-WAM)主要用时序预测增强场景表征或轨迹学习,预测预训练与规划器优化往往阶段分离(编码器冻结或固定),未来表征无法随打分需求调整;另一类(Drive-WM、WoTE、World4Drive、DriveFuture)把预测未来更直接地带入规划,但预测状态常被池化、共享或与单个候选弱关联,打分器因此可能更多依赖几何线索而非“该动作会碰撞/会偏出”这类动作特定后果。

论文主张:对每个候选轨迹评估其自身预测未来,规划器才能区分几何相近但安全后果不同的轨迹。为此 DA-WAM 把三件事统一到同一决策目标下:预测表征学习在规划器优化全程持续(在线编码器 + 动量目标,避免预训练后冻结);每条候选得到各自的动作条件未来潜状态(一对一对应,不共享、不池化);未来潜条件打分器对该候选与自身潜状态联合评分。离线日志只记录专家轨迹的执行未来这一反事实限制,用“专家匹配 + 安全关键难负例”处理。

方法(机制要点)

  • 表征适配:在线编码器 \(E_\theta\) 以预训练 V-JEPA 2.1 初始化,在选定 transformer 层注入 LoRA,基座冻结、LoRA 参数受未来预测与轨迹规划梯度联合更新;训练时目标编码器 \(E_{\bar\theta}\) 对观测未来帧 \(X_{t+\Delta}\) 做 stop-gradient 编码,参数按 EMA 更新(\(\bar\theta \leftarrow \mu\bar\theta + (1-\mu)\theta\)),只用于训练。
  • 动作条件反事实世界模型:候选轨迹 \(\tau_i\) 经轨迹编码器得动作表示 \(a_i\);共享预测器 \(P_\phi\)\(a_i\) 为 query、当前场景 token \(Z_t\) 为 key/value 做注意力,输出候选特定未来潜 \(\widehat{Z}_i\)。参数共享使差异只来自动作 query,不引入候选特定偏置。
  • 专家匹配:把专家轨迹 \(\tau^{\mathrm{exp}}\) 与最近候选(ADE 最小)匹配,密集潜回归损失只施加于该候选的 \(\widehat{Z}_{i^{\mathrm{exp}}}\);其余 \(N-1\) 个反事实潜只经下游打分损失间接优化,避免把观测未来误配给未执行动作。
  • 未来潜条件打分:打分 transformer 交叉注意力融合 \((Z_t,a_i,\widehat{Z}_i)\) 得轨迹表示 \(h_i\);因子化头从 \(h_i\) 解码显式规划因子 \(\widehat{\mathbf{q}}_i=[\mathrm{NC},\mathrm{DAC},\mathrm{EP},\mathrm{TTC},\mathrm{Comfort}]\) 与总效用 \(\widehat{s}_i\),取最高分候选执行。
  • 训练与推理:除专家匹配的密集监督外,几何相似但安全结果不同的安全关键难负例提供边界附近对比信号,抑制打分器只靠几何。推理只用在线编码器、预测器与打分器,不需要未来观测或专家先验。

实验结果(摘要)

  • NAVSIM v1 navtest:DA-WAM PDMS 93.7(口径见 CPT-017;ViT/L),超过 DriveSuprim(93.5)等;NC 99.1、DAC 98.9、EP 90.0。
  • NAVSIM v2 navtest:EPDMS 87.7(ViT/L),TTC 97.9、LK 97.6。论文自报口径;与 DiffusionDriveV2 等对象的跨表数值差异属后续 reconciliation 议题,本卡不复述为权威值。

与本库的关系

  • 准入身份:U0-user-directive(用户 2026-09-10 指令性准入,NAVSIM / world-model 线基点)。
  • 谱系定位:位于 latent world model 与候选打分的交叉点。上游引用 DriveWorld(PPR-2405.04390)、LAW(PPR-2406.08481)、World4Drive(PPR-2507.00603)、Drive-JEPA(PPR-2601.22032)、Latent-WAM(PPR-2603.24581)、DriveFuture(PPR-2605.09701)、Auto-JEPA、IDOL、LCDrive;候选生成与打分侧引用 DiffusionDrive(PPR-2411.15139)、DriveSuprim(PPR-2506.06659)、GTRS(PPR-2506.06664)、SparseDriveV2、iPad、Centaur 等;评测口径锚定 BMK-006(NAVSIM v1/v2)。
  • 与 Latent-WAM 的机制差异:Latent-WAM 也联合训练空间编码器与 EMA 潜目标,但测试时丢弃动力学分支;DA-WAM 主张未来潜应作为打分器的直接条件在推理时保留。

承重关系

  • provenance:v2 tarball sha256 4a11e581…edba9d0,缓存 cache/sources/2608.19085/

关联(25)

  • PPR-2311.16038 OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
  • PPR-2405.04390 DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous Driving
  • PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World Model
  • PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
  • PPR-2504.01941 End-to-End Driving with Online Trajectory Evaluation via BEV World Model
  • PPR-2506.06659 DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
  • PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
  • PPR-2506.09985 V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
  • PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
  • PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
  • PPR-2512.10226 Latent Chain-of-Thought World Modeling for End-to-End Driving
  • PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
  • PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
  • PPR-2605.09701 DriveFuture: Future-Aware Latent World Models for Autonomous Driving
  • PPR-2605.19771 Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives
  • PPR-2605.31476 IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving
  • PPR-2607.29031 Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2503.05689 GoalFlow 五层重建(骨架):核心对象是目标点引导的 rectified-flow 多模轨迹生成——从训练轨迹端点聚类出 4096/8192 目标点词表,用距离分与可行驶区分双分数选点,再以该点为条件经单步 rectified flow 生成轨迹,并用 shadow trajectory 检测不可靠目标点;公理层含『无约束生成易发散』『目标点构成强约束』与『扩散长路径不适合实时』。
  • FRM-2503.12820 Hydra-MDP++ 五层重建(骨架):核心对象是在固定离散规划词表上的多教师蒸馏——700K 轨迹 K-means 得词表,分类式解码器先模仿日志轨迹,再以离线仿真的 PDM 指标系统为教师做多头蒸馏,教师指标在传统 NAVSIM 项外扩入红绿灯合规(TL)、车道保持(LK)与扩展舒适(EC);公理层含『模仿不足需与环境关联』与『固定动作空间可离线生成度量真值』。
  • FRM-2512.07745 DiffusionDriveV2 五层重建(骨架):核心对象是把去噪链视为 MDP 后用 RL 约束/探索的截断扩散生成器——锚内 GRPO 做组内优势、锚间截断 GRPO 负优势归零且碰撞罚一、尺度自适应乘性探索噪声;公理层含『IL 只监督单一正模式致负模式无约束』与『不同意图的锚不应直接比较优劣』;论证主干是多样性-质量权衡的对照与消融。
  • FRM-2603.24581 Latent-WAM 五层重建(骨架):核心对象是空间感知压缩世界编码器(可学习 scene query 压缩多视角图像 + 几何基础模型蒸馏)与动态潜世界模型(因果 Transformer 自回归预测未来世界状态,3D-RoPE + teacher forcing mask + ego 状态监督);公理层含『世界状态须轻量以支撑长时程转移』与『推理只需 SCWE + 轨迹解码器』;论证为对既有世界模型三缺陷(压缩不足/空间理解缺/历史动态利用不足)的逐项回应。
  • FRM-2608.19085 DA-WAM 五层重建(骨架):核心对象是候选特定的动作条件未来潜(每候选一个、不共享)与未来潜条件的因子化打分器;公理层含『世界模型的规划价值受其预测影响候选级打分的直接程度约束』与离线日志只记录专家执行未来;论证主干是同一骨干下的匹配消融(无未来预测/共享全局未来/当前潜/动作条件未来,± 安全关键难负例)隔离预测-行动耦合。
  • CPT-017 PDM Score (PDMS)
  • IDX-001 NAVSIM 规划线