Research KB 登录

FRM-2601.05083 Formalization

Driving on Registers 五层重建(骨架):核心对象是极简纯 transformer 的端到端驾驶架构——以“相机感知的 register token”(每相机 R 个 register、得 N×R 个场景 token)把多相机特征压成紧凑场景表示、仅用 LoRA 微调预训练 ViT,再由两个轻量 transformer 解码器先生成候选轨迹、再模仿 oracle 打可解释子分数(安全/舒适/效率),从而支持推理期的行为条件驾驶。

id
type formalization
formalizes PPR-2601.05083
updated

0. Overview

Driving on Registers(PPR-2601.05083,Valeo AI 等,2026)提出面向端到端驾驶的简单高效 transformer 架构。方法基于预训练视觉 transformer(ViT),引入相机感知的 register token,把多相机特征压缩成紧凑的场景表示,在不牺牲精度的前提下显著降低下游计算量。这些 token 驱动两个轻量 transformer 解码器:先生成候选轨迹、再对其打分。打分解码器学习模仿一个 oracle 并预测可解释的子分数(代表安全、舒适、效率等方面),从而在推理期支持行为条件的驾驶。论文报告:尽管设计极简,该方法在 NAVSIM-v1、NAVSIM-v2 与光真实闭环 HUGSIM 基准上超过或匹配强当代基线;结果表明纯 transformer 架构配合有针对性的 token 压缩足以实现准确、高效且自适应的端到端驾驶。

本重建覆盖 Abstract 与 §3(Method:简单设计、感知编码器、轨迹、打分、最终训练损失),版本锚定 arXiv:2601.05083v1。

1. Definitions

入库概念(→ CPT)

论文内定义(未入库概念,标 CANDIDATE,不新建 CPT)

  • 感知编码器(相机感知 register token):对每路相机,把 \(R\)相机 register(维度 \(D_\text{ViT}\))与已有 register、分类 token、patch token 一并送入 ViT;在 ViT 末层取回这 \(R\) 个相机 token;把 \(N\) 路相机的 token 归组得 \(N\times R\) 个场景 token。register 是逐相机初始化的(\(N\times R\) 个),故场景 token 是相机感知的(模型可区分某 token 来自前/左/右相机)。该压缩与 Perceiver 思路相近,差别在于 Perceiver 用交叉注意力压缩、需改动架构;本方法直接用预训练 ViT 初始化并以 LoRA 微调主干,从而学得“视觉到 register”的压缩,参数更少、训练更快。
  • 轨迹解码器:标准 transformer 解码器(\(k\) 个块,每块自注意力 + 对场景 token 的交叉注意力 + FFN,含残差);输入为一组可学轨迹查询 \(\mathcal Q_\text{traj}\)(随机初始化、训练中学得),ego 状态(位姿、速度、加速度、驾驶命令)编码后加到查询上;末端以 MLP 把轨迹 token 解码为 \(|\mathcal Q_\text{traj}|\) 条候选轨迹。每条轨迹为 \(n_p\) 个位姿 \((x,y,\theta)\),自当前时刻之后延至未来 \(T\),全部在 ego 局部坐标系下,相邻位姿时间间隔均匀。
  • 打分解码器:架构同上,学习模仿 oracle 并输出可解释子分数(安全、舒适、效率等),用时选优并支持推理期的行为条件驾驶。
  • 最终训练损失:论文 §3.5 给出组合损失(含轨迹监督与分数监督)。

2. Axioms(作者公理:论文接受而未证明的前提)

  • AX-1(简洁高效的必要性):端到端驾驶需要简单且高效的架构(作者以极简设计为目标,并以此为卖点)。
  • AX-2(预训练权重与计算约束并重):应复用预训练 ViT 权重;同时须限制解码器的输入规模,以把计算复杂度约束在可接受范围。
  • AX-3(可解释子分数支撑自适应):打分器应模仿 oracle 并给出可解释的子分数,从而支持行为条件的驾驶与推理期的可调偏好。
  • AX-4(纯 transformer 足够):纯 transformer 架构配合有针对性的 token 压缩,足以实现准确、高效且自适应的端到端驾驶。

3. Theorems(作者可推导命题;本层薄)

骨架阶段占位。本文为方法型,未提出独立命题层。P3 投影时若识别出值得保留的定性命题,再实体化为 CLM 并回填 ID。

4. Evidence(实证 → CLM/EVI 映射)

骨架阶段占位(待 P3)。可用观察锚点:NAVSIM-v1 与 NAVSIM-v2 的规划结果、HUGSIM 闭环基准上的结果、register 数与压缩比的消融、计算量/参数对比、以及行为条件驾驶的定性展示。均为论文自报,无库内 EVI/VER。

5. Argument(论证结构)

  • AR-1(由 AX-2 推出编码器设计):以逐相机 register 把多相机特征压成 \(N\times R\) 个场景 token,并以 LoRA 微调预训练 ViT,兼顾权重复用与下游计算约束。
  • AR-2(生成—打分两段):轻量轨迹解码器生成候选,打分解码器模仿 oracle 输出可解释子分数并选优。
  • AR-3(由 AX-3 推出行为条件):子分数的可解释性使推理期可按行为偏好(安全/舒适/效率)调节选择。
  • AR-4(由 AX-4 推出设计哲学):整体保持纯 transformer + 定向压缩,不引入复杂模块。
  • AR-5(经验支撑):三基准结果与消融支撑 AR-1..AR-4(属 Evidence,非证明)。

6. Commentary

作者评论

  • 摘要:极简设计即可在三个基准上超过或匹配强基线,说明纯 transformer + 定向 token 压缩已足以支撑准确、高效、自适应的端到端驾驶。

本库评论

  • 承重交叉引用(HUGSIM 作为评测设施):本卡在光真实闭环 HUGSIM(PPR-2412.01718)上评测,是库内 HUGSIM 被外部来源用作闭环评测的实例之一;引用其闭环结论时应回溯 HUGSIM 卡以确认口径(3DGS 重建 + 闭环交互)。
  • 与“词表/锚点 + 打分”路线的对照:本卡的候选由可学查询直接生成(随机初始化的轨迹查询),而非来自 K-Means 词表或锚点;与 ResAD 的“惯性参考扰动”(PPR-2510.08562)同为“不以固定词表定义候选”的做法,但机制不同(可学查询 vs 物理先验扰动),比较时须区分。
  • 行为条件驾驶的定位:可解释子分数使推理期可调行为偏好,这与 ReCogDrive 的“以 PDMS 为 RL 奖励”(PPR-2506.08052)、DIVER 的“多样性 + 安全奖励”(PPR-2507.04049)形成三种“把偏好写进目标”的不同位置:本卡写在推理期选择,而两者写在训练期奖励
  • Register token 的方法来源:视觉 register 出自 ViT 相关既有工作;本卡的新意在其逐相机初始化带来的相机感知性,引用时须带该限定。
  • 评测域:NAVSIM v1/v2(非反应式)与 HUGSIM(闭环)并列。

7. Traceability

原文位置 层元素
Abstract AX-1、AX-3、AX-4、AR-2
§3.1 A Simple Design Definition(总体设计)
§3.2 Perception Encoder AX-2、Definition(相机感知 register token、LoRA)、AR-1
§3.3 Trajectories Definition(轨迹解码器、候选轨迹表示)
§3.4 Scores AX-3、Definition(打分解码器、子分数)、AR-3
§3.5 Final Training Loss Definition(损失组合)
§4 实验(NAVSIM-v1/v2、HUGSIM、消融) AR-5 的经验支撑

Review Log

  • 2026-09-14 骨架起草(Tier-1 展开批次,第 50 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。

关联(7)

  • PPR-2412.01718 HUGSIM: A Real-Time, Photo-Realistic and Closed-Loop Simulator for Autonomous Driving
  • PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
  • PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
  • PPR-2510.08562 ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
  • PPR-2601.05083 Driving on Registers
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • CPT-017 PDM Score (PDMS)