PPR-2507.17596
Paper
PRIX: Learning to Plan From Raw Pixels for End-to-End Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | PRIX: Learning to Plan From Raw Pixels for End-to-End Autonomous Driving |
| authors | Maciej K. Wozniak, Lian Liu, Yixi Cai, P. Jensfelt |
| venue | IEEE RA-L 2025 (arXiv:2507.17596) |
| arxiv | 2507.17596 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2507.17596v3 |
| source-hash | sha256:3af1e7b19961aafd5bbd631baff59304f817a0df53bccd6e4435c8ebd940aca8 |
| admitted-under | A2-direct-edge |
| admission-note | 被 DiffusionDriveV2(PPR-2512.07745)、DA-WAM(PPR-2608.19085)作为 NAVSIM v1/v2 对照直接引用。 |
定位
Wozniak 等(RA-L 2025,KTH)提出 PRIX(Plan from Raw pIXels)。论文的出发点是端到端驾驶模型的实际部署受制于模型体量大、依赖昂贵 LiDAR 与计算密集的 BEV 表示,尤其在仅有相机的量产车上难以扩展。PRIX 采用仅相机输入的架构:不做显式 BEV 表示、也不需要 LiDAR,用视觉特征提取器配生成式规划头直接从原始像素预测安全轨迹。核心模块 CaRT(Context-aware Recalibration Transformer)用于跨多层视觉特征做重校准以增强规划鲁棒性。论文报告在 NAVSIM v2 与 nuScenes 上取得 SOTA,并在 NAVSIM v1 上优于多数多模规划器与其他仅相机方法。
与本库的关系
- 准入身份:A2-direct-edge(被 DiffusionDriveV2、DA-WAM 直接引用)。
- 谱系定位:感知精简线——与 SparseDrive(PPR-2405.19620)的稀疏表示、TransFuser(PPR-2205.15997)的多传感器融合在“规划需要何种输入表示”上互为对照;仅相机设定也是 BMK-006 的评测前提之一。
- 评测口径锚定 BMK-006 与 nuScenes。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(7)
- PPR-2205.15997 TransFuser: Imitation With Transformer-Based Sensor Fusion for Autonomous Driving
- PPR-2405.19620 SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
- PPR-2510.08562 ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
- PPR-2601.05083 Driving on Registers
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2507.17596 PRIX 五层重建(骨架):核心对象是仅用相机的端到端规划——ResNet 骨干配可跨尺度共享权重自注意力的上下文重标定 Transformer(CaRT)产出多尺度特征,再以 Token Memory 与 Planner Grid 两种学习表示(后者不是几何 BEV,仅靠语义与轨迹损失锚定到 ego 帧、不使用相机内外参)条件化一个带锚点的两步扩散规划头,输出 8 个 waypoint;公理层含『部署受模型规模、LiDAR 与密集 BEV 阻碍』与『固定相机装置下几何可被参数吸收』。
- IDX-001 NAVSIM 规划线