PPR-2502.13144
Paper
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
| id | |
|---|---|
| updated | |
| type | paper |
| title | RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning |
| authors | Hao Gao, Shaoyu Chen, Bo Jiang, Bencheng Liao, Yiang Shi, Xiaoyang Guo |
| venue | NeurIPS 2025 (arXiv:2502.13144) |
| arxiv | 2502.13144 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2502.13144v2 |
| source-hash | sha256:ac49992e1ec70c915f577f6a8a11dceed883f737f81c2398324e39521317502b |
| admitted-under | A2-direct-edge |
| admission-note | 被 DiffusionDriveV2(PPR-2512.07745)等直接引用;库内 3DGS 闭环 RL 训练的代表。 |
定位
Gao 等(NeurIPS 2025,华中科技 / Horizon Robotics)提出 RAD。论文指出既有端到端驾驶算法多遵循模仿学习(IL)范式,存在因果混淆与开环 -闭环落差。RAD 改用基于 3DGS 的闭环强化学习(闭环读法见 DIS-003):借助 3D 高斯泼溅构建真实物理世界的照片级数字副本,让策略在其中大规模探索状态空间、通过试错学习处理分布外场景;为提升安全,设计专门奖励引导策略有效响应安全关键事件并理解真实世界因果关系;为更好对齐人类驾驶行为,把模仿学习作为正则项纳入 RL 训练。论文另提出一个由多样、先前未见 3DGS 环境构成的闭环评测基准,报告相比模仿式方法在多数闭环指标上更强,碰撞率约低 3 倍。
与本库的关系
- 准入身份:A2-direct-edge(被 DiffusionDriveV2 等直接引用)。
- 谱系定位:3DGS 仿真 + RL 训练线。HUGSIM(PPR-2412.01718)在结论中把“照片级闭环设定下微调驾驶算法”列为未来方向,RAD 是该方向的实例;与 CAT(PPR-2310.12432)的对抗训练、DIVER(PPR-2507.04049)与 DiffusionDriveV2(PPR-2512.07745)的 RL 约束在“训练信号来源”上互为对照。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(9)
- PPR-2310.12432 CAT: Closed-loop Adversarial Training for Safe End-to-End Driving
- PPR-2412.01718 HUGSIM: A Real-Time, Photo-Realistic and Closed-Loop Simulator for Autonomous Driving
- PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
- PPR-2510.04333 RAP: 3D Rasterization Augmented End-to-End Planning
- PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
- FRM-2412.01718 HUGSIM 五层重建(骨架):核心对象是基于 3D 高斯泼溅的重建式照片级闭环仿真器——分解式场景表示(地面多平面约束 + 单轮车正则的动态车 + 3DRealCar 非原生车)、LQR 与运动学自行车模型的闭环、IDM 正常与攻击代价搜索的激进 actor,以及 HD-Score(NC/DAC 门控 × TTC/COM 加权,再乘路线完成度 R_c);公理层含『评估需闭环』『闭环视觉评测需照片级渲染』与『闭环中 EP 不适用』。
- FRM-2502.13144 RAD 五层重建(骨架):核心对象是以 3DGS 构建光真实数字副本、在其上做闭环强化学习的端到端驾驶框架——策略通过大规模试错探索状态空间、学习分布外场景;奖励由动态碰撞、静态碰撞、位置偏离与朝向偏离四项构成(任一触发即终止 episode,因事后 3DGS 渲染的传感数据含噪);训练分感知预训练、规划预训练(IL 初始化以防 RL 冷启动不稳)与强化后训练(RL 引导安全、IL 作正则贴合人类)三阶段。
- DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。
- IDX-001 NAVSIM 规划线