PPR-2510.12796
Paper
DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving |
| authors | Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yu-Quan Wang |
| venue | arXiv:2510.12796 |
| arxiv | 2510.12796 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2510.12796v2 |
| source-hash | sha256:29db4e8bba9d55dffa1327faf2b1f3d713d9225c56dcc335642057c5eb9dce0c |
| admitted-under | A2-direct-edge |
| admission-note | 被 Latent-WAM(PPR-2603.24581)作为“显式视频生成学规划”一类代表并作为其感知免标注基线(Latent-WAM 报告超过其 3.2 EPDMS)。 |
定位
Li 等(2025)提出 DriveVLA-W0。论文的出发点是:放大视觉-语言- 动作(VLA)模型以取得更通用驾驶智能有前景,但 VLA 受监督赤字限制——庞大模型容量仅由稀疏、低维的动作监督,大部分表征能力未被利用。补救方式是世界建模:预测未来图像,从而提供稠密自监督信号,迫使模型学习驾驶环境的内在动力学。论文将该范式在两类主流 VLA 原型上实例化——对使用离散视觉 token 的 VLA 用自回归世界模型,对使用连续视觉特征的 VLA 用扩散世界模型;再在学得的丰富表示上加轻量动作专家以解决实时部署的推理时延。
实验结果(摘要)
- 论文在 NAVSIM v1/v2 与一个 680 倍规模的自建数据集上做扩展性验证。
与本库的关系
- 准入身份:A2-direct-edge(被 Latent-WAM 直接引用并作为基线)。
- 谱系定位:世界模型作为训练信号(而非推理期打分条件)的一类。Latent-WAM 把它归入“经显式视频生成学规划”一组,并以感知免标注设定报告超过它 3.2 EPDMS;与 DA-WAM 的“保证推理期使用未来潜”主张形成路线差异。评测锚定 BMK-006。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(5)
- PPR-2506.24113 Epona: Autoregressive Diffusion World Model for Autonomous Driving
- PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2510.12796 DriveVLA-W0 五层重建(骨架):核心对象是把世界建模(预测未来图像)当作给 VLA 驾驶模型的密集自监督信号,以修补“监督赤字”——动作监督稀疏低维、令大容量 VLA 表示能力被闲置;该范式按 VLM 主干类型分别实例化为离散视觉 token 的自回归世界模型与连续视觉特征的扩散世界模型,另配轻量 MoE 动作专家(含 query-based / 自回归 / 流匹配三种解码方案)解决实时推理延迟。
- IDX-001 NAVSIM 规划线