Research KB 登录

PPR-2506.09985 Paper

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

id
updated
type paper
title V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
authors Mahmoud Assran, Adrien Bardes, David Fan, Q. Garrido, Russell Howes, Mojtaba Komeili
venue arXiv:2506.09985
arxiv 2506.09985
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2506.09985v1
source-hash sha256:d98b14cd95c21359466bbee82fb5ab708abab321fa0a2079948e31d6df20843a
admitted-under A1-spine
admission-note A1-spine:DA-WAM(PPR-2608.19085)的在线编码器以 V-JEPA 2.1(PPR-2603.14482)初始化,而后者的方法学源头即本卡;DTW/Drive-JEPA 亦以其为骨干。

定位

Assran 等(2025,Meta)提出 V-JEPA 2。论文探索一种自监督路线:结合互联网规模视频数据与少量交互数据(机器人轨迹),得到能在物理世界理解、预测与规划的模型。做法分两步:先在超过 100 万小时的互联网视频与图像上预训练一个无动作的联合嵌入预测架构(JEPA),据报告在运动理解(Something-Something v2 top-1 77.3)与人类动作预期(Epic-Kitchens-100 recall-at-5 39.7)上取得领先;再把 V-JEPA 2 与大语言模型对齐,并在多个视频问答任务上取得领先;最后用少量机器人交互数据做动作条件后训练,用于规划。

与本库的关系

  • 准入身份:A1-spine(DA-WAM(PPR-2608.19085)承重:其在线编码器以 V-JEPA 2.1 初始化,方法学源头即本卡)。
  • 谱系定位:JEPA 自监督视频表示的基础模型。下游 Drive-JEPA(PPR-2601.22032)适配到驾驶,Auto-JEPA(PPR-2607.29031)用冻结视觉骨干 + 意图嵌入,DA-WAM(PPR-2608.19085)用 V-JEPA 2.1 + LoRA + EMA 目标并主张预测监督全程保持。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(8)

  • PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
  • PPR-2603.14482 V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
  • PPR-2607.29031 Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
  • PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
  • FRM-2506.09985 V-JEPA 2 五层重建(骨架):这是 FAIR 的通用世界模型工作而非驾驶方法——先在逾 100 万小时互联网视频上做“无动作”联合嵌入预测预训练(得到强运动理解与人类动作预判),再把其与语言模型对齐以做视频问答,最后用不足 62 小时无标注机器人视频后训练出潜动作条件世界模型 V-JEPA 2-AC,并在两个实验室的 Franka 机械臂上零样本做图像目标规划;库内引用它的价值在于它是 Drive-JEPA / Auto-JEPA 的预训练权重来源。
  • FRM-2603.14482 V-JEPA 2.1 五层重建(骨架):这是 V-JEPA 系列训练配方的改进而非驾驶方法——针对 V-JEPA 2 在需要像素级理解的稠密任务上的严重不足,改用“稠密预测损失”(可见上下文与掩蔽 token 全部参与损失、显式强制时空接地)+“深层自监督”(在多个中间编码器层分层施加自监督目标)+“多模态 tokenizer”(统一图文与视频训练)+ 模型与数据缩放四项要素,在分割/深度/短期动作预判等稠密任务上达最优、同时保持全局视频理解。
  • FRM-2608.19085 DA-WAM 五层重建(骨架):核心对象是候选特定的动作条件未来潜(每候选一个、不共享)与未来潜条件的因子化打分器;公理层含『世界模型的规划价值受其预测影响候选级打分的直接程度约束』与离线日志只记录专家执行未来;论证主干是同一骨干下的匹配消融(无未来预测/共享全局未来/当前潜/动作条件未来,± 安全关键难负例)隔离预测-行动耦合。
  • IDX-001 NAVSIM 规划线