PPR-2205.15997
Paper
TransFuser: Imitation With Transformer-Based Sensor Fusion for Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | TransFuser: Imitation With Transformer-Based Sensor Fusion for Autonomous Driving |
| authors | Kashyap Chitta, Aditya Prakash, Bernhard Jaeger, Zehao Yu, Katrin Renz, Andreas Geiger |
| venue | IEEE TPAMI (arXiv:2205.15997) |
| arxiv | 2205.15997 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2205.15997v1 |
| source-hash | sha256:61b821db046c100ac1d09e0448f0936daeff6c30384050e366df7c1b0d00030f |
| admitted-under | A2-direct-edge |
| admission-note | 被全部 NAVSIM 锚点直接引用;其 ResNet-34 版本是 NAVSIM 对齐骨干的标准基线之一(HUGSIM 评测三方法之一即 LTF)。 |
定位
Chitta 等(TPAMI,图宾根)提出 TransFuser,研究互补传感器表示的融合。论文指出:基于几何的融合在感知(如目标检测、运动预测)上有效,但在端到端模仿驾驶场景中,面对动态智能体密集的复杂场景表现不佳。TransFuser 用自注意力整合图像与 LiDAR 表示:在多个分辨率上用 transformer 模块融合透视视图(PV)与鸟瞰视图(BEV)特征图。论文在长路线、密集交通的闭环评估口径(闭环读法见 DIS-003)以及 CARLA 官方榜上验证,报告驾驶分数大幅领先,相比几何融合把每公里平均碰撞率降低 48%。其去掉 LiDAR 输入的变体 Latent-Transfuser(LTF)是后续 NAVSIM 系评测中的常用基线。
与本库的关系
- 准入身份:A2-direct-edge(被全部 NAVSIM 锚点直接引用)。
- 谱系定位:模仿式端到端规划与多传感器融合的基础模型。作者群同时是 NAVSIM(PPR-2406.15349)、Centaur(PPR-2503.11650)等的作者,使该卡是 NAVSIM 评测生态的方法学祖先之一。与 VAD(PPR-2303.12077)的向量化表示、PRIX(PPR-2507.17596)的仅相机设定互为对照。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(8)
- PPR-2303.12077 VAD: Vectorized Scene Representation for Efficient Autonomous Driving
- PPR-2406.15349 NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking
- PPR-2503.11650 Centaur: Robust End-to-End Autonomous Driving with Test-Time Training
- PPR-2507.17596 PRIX: Learning to Plan From Raw Pixels for End-to-End Autonomous Driving
- FRM-2205.15997 TransFuser 五层重建(骨架):核心对象是用自注意力做多模态融合的模仿学习驾驶架构——在多个分辨率上用 transformer 模块融合透视视图图像与 LiDAR BEV 直方图特征,得 512 维环境表示后经单层 GRU 自回归预测差分 waypoint,另加深度/语义/HD 地图/车辆检测四个辅助任务;公理层含『几何式融合在动态体密集场景下模仿学习欠佳』与『单步观测已足』,并以 PID 控制器、creeping 与安全启发式兜底 IL 的 inertia 问题。
- FRM-2408.03601 DRAMA 五层重建(骨架):核心对象是把 Mamba(状态空间模型)引入端到端运动规划——编码器用多尺度卷积与四个 Mamba 融合模块替代 Transformer 自注意力来融合相机与 LiDAR BEV 特征(训练复杂度由 T²D 降为 TD²),解码器用可学的 Mamba-Transformer 层输出确定性轨迹,并以差异化 dropout 率作用的特征状态丢弃(FSD)缓解传感噪声与 ego 状态缺失;公理层含『自注意力对序列长度二次复杂』与『传感/导航输入本就不完美』。
- DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。
- IDX-001 NAVSIM 规划线