FRM-2601.22032
Formalization
Drive-JEPA 五层重建(骨架):核心对象是把 V-JEPA 式潜预测预训练接到端到端驾驶,并用规则仿真器提供多模伪教师——先在 330 小时驾驶视频上自监督预训练 ViT 编码器,再由 learnable 查询的 transformer 解码器出提案,并以“词表(8192 聚类中心)+ NAVSIM v2 EPDM 离线评分筛出的多模高质量轨迹”作为伪教师替代单条人类轨迹监督,最后用带舒适项的 momentum-aware 打分选轨迹;公理层含『单场景仅一条人类轨迹难以学多模行为』与『像素空间世界模型贵、潜世界模型难扩展』。
| id | |
|---|---|
| type | formalization |
| formalizes | PPR-2601.22032 |
| updated |
0. Overview
Drive-JEPA(PPR-2601.22032,Wang 等 2026)处理自监督视频预训练在端到端驾驶上的收益有限。论文的诊断:端到端驾驶日益借助自监督视频预训练学习可迁移的规划表示,但为场景理解而预训练视频世界模型迄今只带来有限提升;该困难被驾驶的固有模糊性放大——每个场景通常只提供一条人类轨迹,难以学到多模行为。Drive-JEPA 把视频联合嵌入预测架构(V-JEPA)与多模轨迹蒸馏整合:先用 V-JEPA 目标在 330 小时驾驶视频上预训练 ViT 编码器(自 V-JEPA 2 权重初始化);再用提案中心规划器蒸馏仿真器产生的多样轨迹与人类轨迹,并以动量感知选择促进稳定安全的行为。论文报告感知无关设定下比此前方法高 3 PDMS,完整框架在 NAVSIM v1 达 93.7 PDMS、v2 达 87.8 EPDMS。
本重建覆盖 Abstract 与 §3(Method:预置、驾驶视频预训练、waypoint 锚定提案生成、多模轨迹蒸馏、动量感知选择、损失),版本锚定 arXiv:2601.22032v1。
1. Definitions
入库概念(→ CPT):
论文内定义(未入库概念,标 CANDIDATE,不新建 CPT):
- V-JEPA 目标:以掩蔽视图 \(x\) 估计目标视图 \(y\) 的潜表示 \(\min_{\theta,\phi,\Delta_y}\|P_\phi(\Delta_y,E_\theta(x))- \mathrm{sg}(E_{\bar\theta}(y))\|_1\),\(\Delta_y\) 为指示被丢弃 patch 位置的可学掩码 token,目标支用 stop-gradient 与 EMA 编码器防表示坍缩;损失仅在掩蔽位置计算;编码器与预测器均为 ViT。
- 驾驶视频数据整理与扩展:编码器自 V-JEPA 2 权重初始化;从 CoVLA、DrivingDojo、OpenScene(trainval)整理大规模驾驶视频,统一为前视图、8 帧片段、\(512\times256\)、2 Hz;共训练到 330 小时。
- 感知无关端到端设定:仅用人类轨迹监督、不依赖感知标注;由前视图 \(I_t^1\) 与 \(I_{t-1}^1\) 经预训练 ViT 编码器得时空特征 \(\mathbf F_t\),用 \(M\) 个可学查询嵌入 \(\mathbf Q\)(每个对应一个未来 waypoint)经 transformer 解码器交叉注意力得 \(\mathbf H=\text{TransformerDecoder}(\mathbf Q,\mathbf F_t)\)。
- 多模轨迹蒸馏(MTD):先按 VADv2/HydraMDP 方式用 k-means 从训练集(>100k 条)轨迹中选 8192 个中心构词表,但用途不同——对每个场景用规则仿真器按 NAVSIM v2 的 EPDM 分数为词表轨迹离线评分(先把 8 waypoint 经 PID 控制器转成更密的 41 点轨迹,再逐步重放其他道路参与者与红绿灯并计算碰撞等指标),按排名与阈值选出多模高质量轨迹集 \(\mathcal P_t=\{P_t^1,\dots,P_t^{N_\text{pseudo}}\}\),作伪教师替代单条人类轨迹。轨迹损失为 \(\sum_{\ell=1}^{L}\lambda^{L-\ell}(\min\|W_t-\tilde W_\ell^{(n)}\|_2+ \sum_{P\in\mathcal P_t}\min\|P-\tilde W_\ell^{(n)}\|_2)\)(\(\min\) 对提案索引 \(n\) 取)。
- 动量感知轨迹选择:对末层提案查询沿 waypoint 维最大池化后经 MLP 出分数 \(S\),以 BCE 对由仿真器 EPDMS 导出的真值评分 \(\hat S\) 训练;为抑制 MTD 带来的时序不一致(相邻帧提案变化大导致不适),引入基于畸变的舒适分 \(S_c\)(比较上一帧已选轨迹 \(\hat W_{t-1}\) 与当前各提案),并按 \(S\leftarrow(7S+S_c)/8\) 重标定。
2. Axioms(作者公理:论文接受而未证明的前提)
- AX-1(视频预训练收益有限):为场景理解预训练视频世界模型,迄今对端到端规划只带来有限提升。
- AX-2(单轨迹的模糊性):每个场景通常只提供一条人类轨迹,使多模行为难以学习——这是监督稀疏的根源。
- AX-3(潜预测优于像素与旧潜模型):像素空间世界模型计算昂贵,既有潜世界模型难以扩展,故应采用 V-JEPA 式潜预测任务(兼具效率与防坍缩)。
- AX-4(仿真器可作多模教师):规则式仿真器能为词表轨迹给出度量评分,可用以构造多模伪教师目标。
3. Theorems(作者可推导命题;本层薄)
骨架阶段占位。本文为方法型,未提出独立命题层。P3 投影时若识别出值得保留的定性命题,再实体化为 CLM 并回填 ID。
4. Evidence(实证 → CLM/EVI 映射)
骨架阶段占位(待 P3)。可用观察锚点:感知无关设定的 PDMS 对比(比此前方法高 3 PDMS)、完整框架 v1 93.7 PDMS / v2 87.8 EPDMS、与 LAW/World4Drive/Epona 在编码器规模、数据规模与 PDMS 上的对比表(89.0 PDMS / 307M 编码器 / 330h)、MTD 与动量选择的消融与提案可视化。均为论文自报,无库内 EVI/VER。
5. Argument(论证结构)
- AR-1(由 AX-1 + AX-3 推出预训练方案):以 V-JEPA 目标在整理的大规模驾驶视频上自监督预训练 ViT 编码器,避免像素重建的高成本与旧潜模型的扩展困难。
- AR-2(由 AX-2 + AX-4 推出 MTD):用“词表 + 离线仿真评分”筛出多模高质量轨迹作伪教师,替代单条人类轨迹监督,从而缓解模式坍缩。
- AR-3(提案生成与选择):以可学查询解码提案,再用 MLP 打分选轨迹,真值评分来自仿真器。
- AR-4(多样性的副作用治理):MTD 提升多样性但放大时序不一致,故引入舒适项做动量感知重标定。
- AR-5(经验支撑):NAVSIM 结果与消融支撑 AR-1..AR-4(属 Evidence,非证明)。
6. Commentary
作者评论
- 结论段:以 V-JEPA 表示配合简单 transformer 解码器即可在感知无关设定超过此前方法,完整框架在 v1/v2 上设新 SOTA。
本库评论
- 与同谱系条目的比较须带数据与规模(承重):论文自列对比表给出 LAW(21M/约 20h/83.8 PDMS)、World4Drive(21M/约 20h/85.1)、Epona(1.1B/128h/86.1)与本方法(307M/330h/89.0)——模型规模与预训练数据量同时变化,故该对比不能归因于单一方法差异(与 DA-WAM 对照表中跨骨干比较的问题同型)。
- 词表的用途改变(须与 HydraMDP 区分):HydraMDP 用词表学分数(hydra-distillation);本卡用词表作候选池、由仿真器筛出多模目标做伪教师。共用“8192 词表”但机制不同,不可因词表相同而归为同类。
- 离线评分的规模化改造:论文称把 NAVSIM v2 的规则仿真器(本为评测设计)改造以提升向量化效率、满足大规模离线评分需求——该改造使评测工具参与训练目标构造,跨来源复现时须注意其实现差异。
- 动量选择的权重是手设:\((7S+S_c)/8\) 的配比为超参,舒适项的具体影响幅度须回源核对消融。
- 评测域:NAVSIM v1/v2(非反应式)。
7. Traceability
| 原文位置 | 层元素 |
|---|---|
| Abstract | AX-1、AX-2、AR-1、AR-2 |
| §3.1 Preliminary(式 1) | Definition(V-JEPA 目标)、AX-3 |
| §3.2 Driving Video Pretraining | Definition(数据整理与规模、感知无关设定) |
| §3.3 Waypoint-anchored Proposals Generation | Definition(提案生成) |
| §3.4 Multimodal Trajectories Distillation(式 2) | AX-2、AX-4、Definition(词表与伪教师、损失)、AR-2 |
| §3.5 Momentum-aware Trajectory Selection(式 3–4) | Definition(打分与舒适项)、AR-3、AR-4 |
| 实验(NAVSIM、对比表、消融) | AR-5 的经验支撑 |
| §5 Conclusion | 作者评论 |
Review Log
- 2026-09-14 骨架起草(Tier-1 展开批次,第 25 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。
关联(3)
- PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- CPT-017 PDM Score (PDMS)