PPR-2607.29031
Paper
Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving |
| authors | Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li |
| venue | arXiv:2607.29031 |
| arxiv | 2607.29031 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2607.29031v1 |
| source-hash | sha256:0efd694cada0bf6821a2039bed4813effde6aeef43c632df0e944342687d76e3 |
| admitted-under | A2-direct-edge |
| admission-note | 被 DA-WAM(PPR-2608.19085)直接引用(JEPA 潜规划线,冻结视觉骨干 + 意图嵌入排序候选)。 |
定位
Yang 等(2026)提出 Auto-JEPA。论文的主张是:既有驾驶世界模型多做未来视频、占用、BEV 表示或智能体运动的稠密预测,但规划并不需要重建完整未来世界,只需关注影响未来 ego 动作的场景特征。据此提出以动作为导向的潜世界模型:给定视觉观测、自车运动历史与导航指令,预测一个与未来 ego 轨迹潜表示对齐的连续意图嵌入;该预测意图用于从固定轨迹记忆中检索可执行轨迹,再由场景条件候选选择模块排序。模型保持视觉编码器冻结、不需要显式感知标注、也不使用学习式轨迹生成器,只优化轨迹表示、意图预测与候选选择这三组任务特定模块。
实验结果(摘要)
- NAVSIM v1:91.3 PDMS(口径见 CPT-017);NAVSIM v2:89.1 EPDMS(论文自报)。
与本库的关系
- 准入身份:A2-direct-edge(被 DA-WAM 直接引用)。
- 谱系定位:JEPA 潜规划线中最“轻”的一支——冻结视觉骨干、以意图嵌入做候选检索与排序,与 DA-WAM(PPR-2608.19085,在线编码器 + 预测监督全程保持)、Drive-JEPA(PPR-2601.22032,预训练后蒸馏)在“预测表示如何与规划耦合”上给出三种答案。评测锚定 BMK-006。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(12)
- PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World Model
- PPR-2506.09985 V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
- PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2504.01941 WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。
- FRM-2506.09985 V-JEPA 2 五层重建(骨架):这是 FAIR 的通用世界模型工作而非驾驶方法——先在逾 100 万小时互联网视频上做“无动作”联合嵌入预测预训练(得到强运动理解与人类动作预判),再把其与语言模型对齐以做视频问答,最后用不足 62 小时无标注机器人视频后训练出潜动作条件世界模型 V-JEPA 2-AC,并在两个实验室的 Franka 机械臂上零样本做图像目标规划;库内引用它的价值在于它是 Drive-JEPA / Auto-JEPA 的预训练权重来源。
- FRM-2603.14482 V-JEPA 2.1 五层重建(骨架):这是 V-JEPA 系列训练配方的改进而非驾驶方法——针对 V-JEPA 2 在需要像素级理解的稠密任务上的严重不足,改用“稠密预测损失”(可见上下文与掩蔽 token 全部参与损失、显式强制时空接地)+“深层自监督”(在多个中间编码器层分层施加自监督目标)+“多模态 tokenizer”(统一图文与视频训练)+ 模型与数据缩放四项要素,在分割/深度/短期动作预判等稠密任务上达最优、同时保持全局视频理解。
- FRM-2605.09701 DriveFuture 五层重建(骨架):核心主张是潜世界模型的关键不在于模拟未来状态、而在于以未来状态条件化当前决策——先由共享 BEV 编码器与轨迹编码器经可学未来查询预测“轨迹条件下的未来潜状态”,训练时用条件源随机化(真值/等加速度运动学代理/空 token)支撑推理期无真值轨迹与 CFG,再用单层交叉注意力把该预测潜与带 stop-gradient 的真实未来观测潜接地,最后以其显式条件化一个扩散轨迹规划器;公理层含『把未来潜当预测目标/辅助信号会使当前与未来特征在潜空间纠缠』。
- FRM-2607.29031 Auto-JEPA 五层重建(骨架):核心对象是“只学影响未来自车动作的场景特征”的动作导向潜世界模型——冻结的 V-JEPA 2 视觉编码器 + 24 层 transformer 预测器把视觉、ego 运动史与导航命令压成 8 个连续潜 token(驾驶意图),训练时与冻结轨迹自编码器给出的真值轨迹潜表示做联合嵌入对齐,推理时以该意图为检索键从非参数轨迹记忆中取 300 条候选、经场景打分器排序与可行驶区门控过滤;公理层含『规划无需重建完整未来世界』与『预测目标与检索候选须同处一个潜空间』。
- CPT-017 PDM Score (PDMS)
- IDX-001 NAVSIM 规划线