Research KB 登录

PPR-2601.22032 Paper

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

id
updated
type paper
title Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
authors Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng
venue arXiv:2601.22032
arxiv 2601.22032
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2601.22032v2
source-hash sha256:3050f4ca45a830e14ad05ba6e827f9e821c1c44f7895d805ae98eac6567abaa8
admitted-under A2-direct-edge
admission-note 被 DA-WAM(PPR-2608.19085)直接引用(JEPA 潜规划线),并被 Latent-WAM 谱系引用。

定位

Wang 等(2026)提出 Drive-JEPA。论文关注两点:其一,端到端驾驶越来越多用自监督视频预训练学可迁移的规划表示,但为场景理解而预训练的视频世界模型带来的增益一直有限;其二,驾驶本身的固有歧义——每个场景通常只提供一条人类轨迹,使多模行为难以学习。Drive-JEPA 把视频联合嵌入预测架构(V-JEPA)与多模轨迹蒸馏整合:先适配 V-JEPA 到端到端驾驶,在大规模驾驶视频上预训练 ViT 编码器,使预测表示与轨迹规划对齐;再提出候选中心规划器,蒸馏模拟器生成的多样轨迹与人类轨迹,并用动量感知的选择机制促进稳定、安全的行为。论文报告在 NAVSIM 上,V-JEPA 表示配简单 transformer 规划器即取得良好表现。

与本库的关系

  • 准入身份:A2-direct-edge(被 DA-WAM 直接引用)。
  • 谱系定位:JEPA 潜预测规划线。与 Auto-JEPA(PPR-2607.29031)同为 JEPA 系;DA-WAM(PPR-2608.19085)以 V-JEPA 2.1 为编码器并主张预测监督全程保持(而非冻结后微调),本卡是其对照坐标之一。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(15)

  • PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World Model
  • PPR-2506.09985 V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
  • PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World Model
  • PPR-2603.14482 V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
  • PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
  • PPR-2607.29031 Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
  • PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
  • FRM-2504.01941 WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。
  • FRM-2506.08052 ReCogDrive 五层重建(骨架):核心对象是把 VLM 的驾驶认知先验与扩散规划器耦合、并以扩散版 GRPO 做安全后训练的三阶段框架——先用“生成/精炼/质控”三级流水线造出模仿人类认知顺序的驾驶 QA 数据训练 VLM,再把其认知 token 注入扩散规划器生成连续稳定轨迹,最后用 DiffGRPO 以 NAVSIM 仿真器的 PDMS 作奖励做强化;公理层含『把规划当语言建模会产出违格式/不可行动作且推理慢』与『多模专家演示下纯模仿会学出平均轨迹』。
  • FRM-2506.09985 V-JEPA 2 五层重建(骨架):这是 FAIR 的通用世界模型工作而非驾驶方法——先在逾 100 万小时互联网视频上做“无动作”联合嵌入预测预训练(得到强运动理解与人类动作预判),再把其与语言模型对齐以做视频问答,最后用不足 62 小时无标注机器人视频后训练出潜动作条件世界模型 V-JEPA 2-AC,并在两个实验室的 Franka 机械臂上零样本做图像目标规划;库内引用它的价值在于它是 Drive-JEPA / Auto-JEPA 的预训练权重来源。
  • FRM-2601.22032 Drive-JEPA 五层重建(骨架):核心对象是把 V-JEPA 式潜预测预训练接到端到端驾驶,并用规则仿真器提供多模伪教师——先在 330 小时驾驶视频上自监督预训练 ViT 编码器,再由 learnable 查询的 transformer 解码器出提案,并以“词表(8192 聚类中心)+ NAVSIM v2 EPDM 离线评分筛出的多模高质量轨迹”作为伪教师替代单条人类轨迹监督,最后用带舒适项的 momentum-aware 打分选轨迹;公理层含『单场景仅一条人类轨迹难以学多模行为』与『像素空间世界模型贵、潜世界模型难扩展』。
  • FRM-2603.14482 V-JEPA 2.1 五层重建(骨架):这是 V-JEPA 系列训练配方的改进而非驾驶方法——针对 V-JEPA 2 在需要像素级理解的稠密任务上的严重不足,改用“稠密预测损失”(可见上下文与掩蔽 token 全部参与损失、显式强制时空接地)+“深层自监督”(在多个中间编码器层分层施加自监督目标)+“多模态 tokenizer”(统一图文与视频训练)+ 模型与数据缩放四项要素,在分割/深度/短期动作预判等稠密任务上达最优、同时保持全局视频理解。
  • FRM-2605.09701 DriveFuture 五层重建(骨架):核心主张是潜世界模型的关键不在于模拟未来状态、而在于以未来状态条件化当前决策——先由共享 BEV 编码器与轨迹编码器经可学未来查询预测“轨迹条件下的未来潜状态”,训练时用条件源随机化(真值/等加速度运动学代理/空 token)支撑推理期无真值轨迹与 CFG,再用单层交叉注意力把该预测潜与带 stop-gradient 的真实未来观测潜接地,最后以其显式条件化一个扩散轨迹规划器;公理层含『把未来潜当预测目标/辅助信号会使当前与未来特征在潜空间纠缠』。
  • FRM-2607.29031 Auto-JEPA 五层重建(骨架):核心对象是“只学影响未来自车动作的场景特征”的动作导向潜世界模型——冻结的 V-JEPA 2 视觉编码器 + 24 层 transformer 预测器把视觉、ego 运动史与导航命令压成 8 个连续潜 token(驾驶意图),训练时与冻结轨迹自编码器给出的真值轨迹潜表示做联合嵌入对齐,推理时以该意图为检索键从非参数轨迹记忆中取 300 条候选、经场景打分器排序与可行驶区门控过滤;公理层含『规划无需重建完整未来世界』与『预测目标与检索候选须同处一个潜空间』。
  • IDX-001 NAVSIM 规划线