PPR-2605.19771
Paper
Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives
| id | |
|---|---|
| updated | |
| type | paper |
| title | Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives |
| authors | Junli Wang, Zhihua Hua, Xueyi Liu, Zebin Xing, Haochen Tian, Kun Ma |
| venue | arXiv:2605.19771 |
| arxiv | 2605.19771 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2605.19771v1 |
| source-hash | sha256:27248231f4e9f4c86cdde3184e102245590bf3dedaea1c65296e8bde72fdc175 |
| admitted-under | A2-direct-edge |
| admission-note | 被 DA-WAM(PPR-2608.19085)直接引用(wang2026beyonddrive),与 DA-WAM 的“安全关键难负例”监督策略同源。 |
定位
Wang 等(2026)提出 BeyondDrive。论文指出端到端驾驶的模仿学习主要从成功演示学习、以最小化与专家轨迹的几何偏差为目标,隐含假设“空间接近即行为安全”,由此造成关键的目标错配:模仿损失几乎相同的轨迹,安全结果可能截然不同——一条仍可恢复,另一条直接碰撞。为处理这一限制,BeyondDrive 提出失败感知(failure-aware)的模仿学习框架,从成功与失败两种驾驶行为联合学习:先用基于流匹配的负轨迹生成器合成安全关键但贴近专家的轨迹,显式建模安全不对称;再配以多样性感知的采样策略。
与本库的关系
- 准入身份:A2-direct-edge(被 DA-WAM 直接引用)。
- 谱系定位:难负例/安全不对称线。DA-WAM(PPR-2608.19085)的“忠实匹配专家 + 安全关键难负例”监督策略与本卡主张同向,二者在“如何在只有单条专家轨迹的离线日志下界定安全边界”上互为呼应;与 ResAD(PPR-2510.08562)的残差安全建模、DIVER(PPR-2507.04049)的 RL 避撞奖励构成同族问题。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(5)
- PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
- PPR-2510.08562 ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
- PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
- FRM-2605.19771 BeyondDrive 五层重建(骨架):核心对象是让模仿学习显式吸收失败——提出“安全不对称”性质(模仿误差几乎相同的两条轨迹安全性可截然不同,一条可恢复、一条致碰撞),故用流匹配的负轨迹生成器合成“安全关键但贴近专家”的硬负样本、以多样性感知采样提高失败模式覆盖,再用排斥距离损失同时吸引预测靠近专家并推离硬负样本,从而在轨迹空间建立可判别的安全边界。
- IDX-001 NAVSIM 规划线