Research KB 登录

PPR-2506.24113 Paper

Epona: Autoregressive Diffusion World Model for Autonomous Driving

id
updated
type paper
title Epona: Autoregressive Diffusion World Model for Autonomous Driving
authors Kaiwen Zhang, Zhenyu Tang, Xiaotao Hu, Xingang Pan, Xiaoyang Guo, Yuan Liu
venue ICCV 2025 (arXiv:2506.24113)
arxiv 2506.24113
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2506.24113v1
source-hash sha256:3d0f56e3c57195954e084982d6ec5cfeb8d22af3dd1fdf3e58caf4dc8f019b4d
admitted-under A2-direct-edge
admission-note 被 Latent-WAM 直接引用为“经显式视频生成学规划”一类代表。

定位

Zhang 等(ICCV 2025)提出 Epona。论文指出:扩散模型在视频生成上视觉质量突出,适合驾驶世界建模,但既有视频扩散世界模型难以做变长、长时程预测,也难以整合轨迹规划——原因是它们依赖对固定长度帧序列做全局联合分布建模,而非在每步顺序构造局部化分布。Epona 用两项设计回应:解耦的时空分解(把时序动态建模与细粒度未来世界生成分开)与模块化的轨迹与视频预测(把运动规划与视觉建模整合进端到端框架)。由此支持高分辨率、长时程生成,并引入链式前向训练策略以应对误差累积。

与本库的关系

  • 准入身份:A2-direct-edge(被 Latent-WAM 直接引用)。
  • 谱系定位:视频扩散世界模型中处理长时程的一支。Latent-WAM(PPR-2603.24581)把它与 DriveVLA-W0(PPR-2510.12796)归为“显式视频生成学规划”组,并指其计算开销大、中间表示偏向与规划无关的视觉细节。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(6)

  • PPR-2309.17080 GAIA-1: A Generative World Model for Autonomous Driving
  • PPR-2405.17398 Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
  • PPR-2510.12796 DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
  • PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
  • FRM-2506.24113 Epona 五层重建(骨架):核心对象是把驾驶世界建模重构为“时间域上的顺序未来预测”的自回归扩散世界模型——既不像视频扩散那样对固定长度帧序列做全局联合分布建模(破坏因果时序),也不像 token 式自回归那样逐 token 预测(弱化空间相关并扭曲高频),而是分离出策略 π(TrajDiT 预测轨迹)与整帧条件分布 p(VisDiT 生成下一帧),由多模态时空 transformer 编码历史,并用 chain-of-forward 训练抑制自回归误差累积;世界模型因此可同时充当实时运动规划器。
  • IDX-001 NAVSIM 规划线