Research KB 登录

FRM-2504.19580 Formalization

ARTEMIS 五层重建(骨架):核心对象是把规划建成逐点自回归的条件序列生成——每个 waypoint 由“规划时间嵌入 + 当前 ego 状态 + 历史规划查询”拼成的查询经带共享与私有专家的 MoE 块(配批量重分配加速)与 BEV 特征交互后、从预测的高斯分布采样得到;路由走内生场景特征而非驾驶命令,且刻意不用专家平衡损失;公理层含『命令分布不均衡且偶与专家轨迹不一致』与『只用当前 ego 状态以防因果混淆』。

id
type formalization
formalizes PPR-2504.19580
updated

0. Overview

ARTEMIS(PPR-2504.19580,Ni 等 2025,RA-L)处理端到端规划的表达能力与场景多样性。论文的诊断:模块化方法有误差传播;既有端到端模型多为静态一次性推断,不足以捕捉环境动态变化;单一网络架构在处理多样驾驶场景时存在表示局限。ARTEMIS 把规划形式化为条件序列生成 \(p(Y\mid S)=\prod_t p(y_t\mid y_{<t},S)\)逐点自回归生成轨迹,并在每次生成中动态路由场景相关查询到专门专家网络(MoE,含共享与私有专家)。路由决策来自场景特征本身而非驾驶命令——论文在 navtrain 上观察到命令分布显著不均衡(左转 >20000、右转 <10000、直行 >50000)且少数样本的命令与专家轨迹不一致,故仅凭命令选专家会让部分专家训练不足并丢失策略多样性。为提升 MoE 训练效率,论文提出轻量批量重分配策略。以 ResNet-34 为骨干,NAVSIM 上 87.0 PDMS / 83.1 EPDMS。

本重建覆盖 Abstract 与 §2(Method:预置、模型架构、训练损失),版本锚定 arXiv:2504.19580v2。

1. Definitions

入库概念(→ CPT)

论文内定义(未入库概念,标 CANDIDATE,不新建 CPT)

  • 条件序列生成形式化:输入历史传感序列 \(S=(s_1,\dots,s_T)\),生成未来轨迹 \(Y=(y_1,\dots,y_H)\)\(y_h\in\mathbb R^d\),目标 \(p(Y\mid S)=\prod_{t=1}^H p(y_t\mid y_{<t},S)\)\(z=\phi(S)\) 为特征提取,\(Y=\psi(z)\) 为生成。
  • MoE 形式\(y=\sum_{i\in E_\text{shared}}f_i(x)+\sum_{i\in E_\text{private}}g_i(x)\cdot f_i(x)\),共享专家捕捉通用知识、私有专家承担域特异策略,\(g_i\in[0,1]\) 为门控权重(沿用 DeepSeekMoE 式设计)。
  • 感知模块:沿用 Transfuser 设计,点云 \(D_l\in\mathbb R^{256\times 256}\) 与前视图图像 \(D_I\in\mathbb R^{1024\times256\times3}\) 经并行骨干(ResNet-34 等)提取 \(F_\text{cam},F_\text{lidar}\),经 Transformer 多阶段融合得 BEV 特征 \(F_\text{bev}\)
  • ego 状态编码:只编码当前 ego 状态 \(s_0\in\mathbb R^8\)(控制命令、2D 速度、加速度)为 \(Q_s\),刻意不用历史 ego 轨迹以避免因果混淆。
  • 位置与时间嵌入:规划时间步 \(t\) 的时间嵌入 \(TE_t\) 与位置嵌入 \(PE_t\);位置嵌入只在首个自回归步加到初始化序列上,避免反复叠加累积噪声。
  • 自回归生成:对当前规划序列加位置嵌入初始化 → 带 padding 掩码 \(M_t\) 的 Transformer 编码器更新规划查询 \(Q_{1:t}\)(当前步只与历史查询交互)→ 拼接 \(C_t=\text{Concat}(TE_t,Q_s,Q_{(1:t)})\) → 经 MoEBlock 与 \(F_\text{bev}\) 交互得 \(Q_{t+1}=\text{MoEBlock}(F_\text{bev},C_t)\)
  • 概率输出:MLP 预测每个 waypoint 的位置与朝向分布,采样 \(y_t\sim\mathcal N(\mu_t,\sigma_t^2)\) 得该步轨迹点,再更新查询序列;逐点拼接得初始轨迹。
  • 批量重分配 MoE(Batch Reallocation):路由查询去掉历史规划查询固定维度 \(Q_r=\text{Concat}(TE_t,Q_s,Q_t)\),路由网络 \(\mathcal R\) 两个 MLP 给出专家分配分 \(g_t\);按激活的专家把样本分组批量处理(共享 + 私有专家融合 \(F_\text{bev}\)),再逆重分配恢复顺序,取出下一步查询。
  • 精化\(Y=\Psi_\text{refine}(\hat y_i,Q_\text{agent},Q_\text{ego})\)
  • 训练:分阶段——先训感知(BEV 语义图 CE、智能体分类与定位,Hungarian 匹配),再端到端 \(\mathcal L_\text{planning}=\lambda_\text{traj}\mathcal L_\text{traj}+ \lambda_\text{NLL}\mathcal L_\text{NLL}+\mathcal L_\text{perception}\)\(L_1\) 规划损失 + 负对数似然);刻意不用 MoE 常用的专家平衡损失。

2. Axioms(作者公理:论文接受而未证明的前提)

  • AX-1(静态单次推断不足):模块化方法有误差传播,而既有端到端模型多为静态一次性推断,不足以捕捉环境动态变化。
  • AX-2(顺序生成与表示局限):逐点顺序生成能保留关键时序依赖;单一网络架构处理多样驾驶场景存在固有表示局限。
  • AX-3(命令路由不可靠):navtrain 上驾驶命令分布显著不均衡,且少数样本命令与专家轨迹不一致——仅凭命令选专家会导致部分专家训练不足、丢失策略多样性。
  • AX-4(历史 ego 轨迹致因果混淆):从历史 ego 轨迹直接学规划会造成因果混淆,故只编码当前 ego 状态。
  • AX-5(专家平衡损失有害于本设定):在特征分布不均衡的数据上施加 MoE 专家平衡损失会阻碍各专家获取专门策略知识。

3. Theorems(作者可推导命题;本层薄)

骨架阶段占位。本文为方法型,未提出独立命题层。P3 投影时若识别出值得保留的定性命题,再实体化为 CLM 并回填 ID。

4. Evidence(实证 → CLM/EVI 映射)

骨架阶段占位(待 P3)。可用观察锚点:NAVSIM 主表(87.0 PDMS / 83.1 EPDMS,ResNet-34)、路由方式对比(命令路由 vs 内生路由)、专家数消融、批量重分配的加速对比。均为论文自报,无库内 EVI/VER。

5. Argument(论证结构)

  • AR-1(由 AX-1 + AX-2 推出自回归 + MoE):以逐点自回归保留时序依赖,以 MoE 的专门专家克服单一网络的表示局限。
  • AR-2(由 AX-3 推出内生路由):路由依据场景特征而非驾驶命令,避免命令不均衡与命令—轨迹不一致带来的专家欠训练。
  • AR-3(由 AX-4 推出 ego 编码方案):仅编码当前 ego 状态(8 维)为 \(Q_s\)
  • AR-4(由 AX-5 推出训练取舍):不使用专家平衡损失。
  • AR-5(概率输出与精化):每个 waypoint 从预测高斯采样引入多模不确定性,再经精化模块融合智能体与 ego 查询得最终轨迹。
  • AR-6(工程加速):批量重分配把激活同一专家的样本聚组处理,提升 MoE 训练速度。
  • AR-7(经验支撑):NAVSIM 结果与消融支撑 AR-1..AR-6(属 Evidence,非证明)。

6. Commentary

作者评论

  • 结论段:自回归 + MoE 缓解了引导信息模糊时的轨迹质量退化,并以批量重分配改善训练速度。

本库评论

  • 第三种生成范式:ARTEMIS 的逐点自回归既非词表打分(VADv2/ Hydra-MDP 系,见 FRM-2402.13243FRM-2406.06978),也非锚点 + 扩散(DiffusionDrive 系),而是序列生成;库内比较时宜作为独立轴,不可与“词表采样”或“扩散生成”混归。
  • “不用专家平衡损失”是显式反常规选择:论文给出理由(不均衡分布下会阻碍专门化),与 MoE 通用实践相反;引用该设计时须带其前提。
  • 内生路由的可审计性代价:路由不依赖命令提高了覆盖面,但也使“为何由该专家处理”缺少显式标签依据,可解释性弱于命令路由。
  • 因果混淆处置:只用当前 ego 状态,与 PPR-2312.03031 的诊断同一问题域(ego 状态泄漏),处理方式不同(其做法是保留历史但加约束)。
  • 概率采样带来的评测波动:从高斯采样生成 waypoint,推理具随机性;与确定性方法的分数比较需注意该差异。
  • 评测域:NAVSIM(非反应式,含 EPDMS 扩展口径)。

7. Traceability

原文位置 层元素
Abstract AX-1、AX-2、AR-1
§2.1 Preliminaries(序列生成式 1、MoE 式 2) Definition(序列生成、MoE 形式)
§2.2 Perception Module Definition(Transfuser 式感知、\(F_\text{bev}\)
§2.2 Autoregressive Planning(命令不均衡观察、ego 编码、嵌入、式 3) AX-3、AX-4、Definition(ego 编码、嵌入、自回归、概率输出)、AR-2、AR-3、AR-5
§2.2 Batch Reallocation MoE Definition(批量重分配)、AR-6
§2.2 精化 Definition(\(\Psi_\text{refine}\)
§2.3 Training Loss AX-5、Definition(分阶段训练与损失)、AR-4
§3 实验 AR-7 的经验支撑

Review Log

  • 2026-09-14 骨架起草(Tier-1 展开批次,第 11 篇)。G1 忠实度审核待人工签发(DA7)。G1 未过,P3 不得开始。

关联(6)

  • PPR-2312.03031 Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?
  • PPR-2504.19580 ARTEMIS: Autoregressive End-to-End Trajectory Planning With Mixture of Experts for Autonomous Driving
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2402.13243 VADv2 五层重建(骨架):核心对象是把规划建成场景条件概率分布——先以最远点采样把连续动作空间离散成大规模规划词表(默认 4096 条,全部取自驾驶演示因而天然满足运动学约束),再用受 NeRF 启发的概率场函数(傅里叶位置编码 + transformer 解码器)预测每候选概率,以分布损失(KL→交叉熵)、冲突损失与场景 token 损失训练;公理层含『场景—动作无确定关系、解空间非凸时确定式回归有安全风险』与『概率对动作连续且对小扰动不敏感』。
  • FRM-2406.06978 Hydra-MDP 五层重建(骨架):核心对象是三范式对比下的多教师蒸馏——把『多模规划 + 单目标学习 + 不可微后处理』改为『多模规划 + 多目标学习』,在 VADv2 式固定词表上以模仿损失对齐人类、以离线仿真分数经 BCE 蒸馏规则教师,推理期按网格搜索权重组装子分数选轨迹;公理层含『仅模仿不足以关联环境』『不可微后处理基于不完美感知』『固定词表使离线批量仿真可行』。
  • CPT-017 PDM Score (PDMS)