Research KB 登录

PPR-2510.12796 Paper

DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving

id
updated
type paper
title DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
authors Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yu-Quan Wang
venue arXiv:2510.12796
arxiv 2510.12796
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2510.12796v2
source-hash sha256:29db4e8bba9d55dffa1327faf2b1f3d713d9225c56dcc335642057c5eb9dce0c
admitted-under A2-direct-edge
admission-note 被 Latent-WAM(PPR-2603.24581)作为“显式视频生成学规划”一类代表并作为其感知免标注基线(Latent-WAM 报告超过其 3.2 EPDMS)。

定位

Li 等(2025)提出 DriveVLA-W0。论文的出发点是:放大视觉-语言- 动作(VLA)模型以取得更通用驾驶智能有前景,但 VLA 受监督赤字限制——庞大模型容量仅由稀疏、低维的动作监督,大部分表征能力未被利用。补救方式是世界建模:预测未来图像,从而提供稠密自监督信号,迫使模型学习驾驶环境的内在动力学。论文将该范式在两类主流 VLA 原型上实例化——对使用离散视觉 token 的 VLA 用自回归世界模型,对使用连续视觉特征的 VLA 用扩散世界模型;再在学得的丰富表示上加轻量动作专家以解决实时部署的推理时延。

实验结果(摘要)

  • 论文在 NAVSIM v1/v2 与一个 680 倍规模的自建数据集上做扩展性验证。

与本库的关系

  • 准入身份:A2-direct-edge(被 Latent-WAM 直接引用并作为基线)。
  • 谱系定位:世界模型作为训练信号(而非推理期打分条件)的一类。Latent-WAM 把它归入“经显式视频生成学规划”一组,并以感知免标注设定报告超过它 3.2 EPDMS;与 DA-WAM 的“保证推理期使用未来潜”主张形成路线差异。评测锚定 BMK-006

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(5)

  • PPR-2506.24113 Epona: Autoregressive Diffusion World Model for Autonomous Driving
  • PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2510.12796 DriveVLA-W0 五层重建(骨架):核心对象是把世界建模(预测未来图像)当作给 VLA 驾驶模型的密集自监督信号,以修补“监督赤字”——动作监督稀疏低维、令大容量 VLA 表示能力被闲置;该范式按 VLM 主干类型分别实例化为离散视觉 token 的自回归世界模型与连续视觉特征的扩散世界模型,另配轻量 MoE 动作专家(含 query-based / 自回归 / 流匹配三种解码方案)解决实时推理延迟。
  • IDX-001 NAVSIM 规划线