Research KB 登录

PPR-2503.07656 Paper

DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving

id
updated
type paper
title DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving
authors Xiaosong Jia, Junqi You, Zhiyuan Zhang, Junchi Yan
venue ICLR 2025 (arXiv:2503.07656)
arxiv 2503.07656
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2503.07656v2
source-hash sha256:9a8be74da810271f1eaf9f32e6d765aa79c5fa0cba1fcbcbe6dde5b78144d2f7
admitted-under A2-direct-edge
admission-note 被 Latent-WAM(PPR-2603.24581)等直接引用;DA-WAM 相关谱系中作为并行任务交互架构代表。

定位

Jia 等(ICLR 2025)提出 DriveTransformer。论文指出端到端自动驾驶常见做法沿用感知-预测-规划的串行范式,导致误差累积与训练不稳定;任务的手工排序也限制了任务间协同(例如规划感知的感知、博弈式交互的预测与规划)的利用;此外稠密 BEV 表示在长距离感知与长时间时序融合上带来计算挑战。DriveTransformer 以三个特征回应:任务并行(智能体 query、地图 query、规划 query 在每个 block 直接相互交互)、稀疏表示(任务 query 直接与原始传感器特征交互)、流式处理(任务 query 被存储并作为历史信息在流式输入间传递),目标是把框架简化到易扩展。

与本库的关系

  • 准入身份:A2-direct-edge(被 Latent-WAM 等锚点引用)。
  • 谱系定位:端到端规划架构线。与 SparseDrive(PPR-2405.19620)的稀疏表示、iPad(PPR-2505.15111)的候选中心编码在“特征表示与任务组织”上互为对照;其“流式处理”也把驾驶规划与序列建模联系起来。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(6)

  • PPR-2405.19620 SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
  • PPR-2408.03601 DRAMA: An Efficient End-to-end Motion Planner for Autonomous Driving with Mamba
  • PPR-2504.19580 ARTEMIS: Autoregressive End-to-End Trajectory Planning With Mixture of Experts for Autonomous Driving
  • PPR-2505.15111 iPad: Iterative Proposal-Centric End-to-End Autonomous Driving
  • FRM-2503.07656 DriveTransformer 五层重建(骨架):核心对象是把端到端驾驶压成三种统一注意力算子的纯 transformer 框架——sensor cross attention 让任务查询直接取原始传感特征(3D 位置编码、不建 BEV)、task self-attention 让 agent/map/ego 查询在每层直接互交(任务并行、无手工顺序)、temporal cross attention 以各任务的 FIFO 查询队列注入历史(流式、含 ego 坐标变换补偿);公理层含『串行感知-预测-规划导致累积误差与训练不稳』与『手工任务顺序限制协同』。
  • IDX-001 NAVSIM 规划线