PPR-2603.14482
Paper
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
| id | |
|---|---|
| updated | |
| type | paper |
| title | V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning |
| authors | Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha, Michael Rabbat |
| venue | arXiv:2603.14482 |
| arxiv | 2603.14482 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2603.14482v3 |
| source-hash | sha256:89ee6b2b14475f45eaafa3940b46f08ccebf8592276e34a208ed60f7e52bd7b1 |
| admitted-under | A1-spine |
| admission-note | A1-spine:DA-WAM(PPR-2608.19085)的在线编码器直接以本模型初始化;DA-WAM 对其注入 LoRA 并保留全流程预测监督。 |
定位
Mur-Labadia 等(2026,Meta)提出 V-JEPA 2.1,是 V-JEPA 2(PPR-2506.09985)的后续,目标是在图像与视频上同时学到稠密且高质量的视觉表示,同时保留强的全局场景理解。四项关键组件:遮蔽式(masking- based)稠密预测损失,让可见 token 与遮蔽 token 都贡献训练信号,以促进显式的空间与时间接地;深层自监督,在多个中间编码器层分层施加自监督目标以提升表示质量;多模 tokenizer,支持图像与视频的统一训练;以及在模型容量与训练数据两个方向上的有效扩展。论文称这些设计产出空间上结构化、语义上连贯、时间上一致的表示。
与本库的关系
- 准入身份:A1-spine(DA-WAM 承重:其在线编码器 \(E_\theta\) 以本模型初始化,注入 LoRA;预测表征质量直接决定 DA-WAM 的未来潜条件打分能力)。
- 谱系定位:JEPA 稠密表示线的最新节点。与 Drive-JEPA(PPR-2601.22032)在“预训练后蒸馏/微调”与 DA-WAM 的“预训练骨干 + LoRA + EMA 目标、预测监督全程保持”上构成不同耦合策略。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(5)
- PPR-2506.09985 V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
- FRM-2603.14482 V-JEPA 2.1 五层重建(骨架):这是 V-JEPA 系列训练配方的改进而非驾驶方法——针对 V-JEPA 2 在需要像素级理解的稠密任务上的严重不足,改用“稠密预测损失”(可见上下文与掩蔽 token 全部参与损失、显式强制时空接地)+“深层自监督”(在多个中间编码器层分层施加自监督目标)+“多模态 tokenizer”(统一图文与视频训练)+ 模型与数据缩放四项要素,在分割/深度/短期动作预判等稠密任务上达最优、同时保持全局视频理解。
- FRM-2608.19085 DA-WAM 五层重建(骨架):核心对象是候选特定的动作条件未来潜(每候选一个、不共享)与未来潜条件的因子化打分器;公理层含『世界模型的规划价值受其预测影响候选级打分的直接程度约束』与离线日志只记录专家执行未来;论证主干是同一骨干下的匹配消融(无未来预测/共享全局未来/当前潜/动作条件未来,± 安全关键难负例)隔离预测-行动耦合。
- IDX-001 NAVSIM 规划线