Research KB 登录

PPR-2506.08052 Paper

ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

id
updated
type paper
title ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
authors Yongkang Li, Kaixin Xiong, Xiangyu Guo, Fang Li, Sixu Yan, Gangwei Xu
venue arXiv:2506.08052
arxiv 2506.08052
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2506.08052v2
source-hash sha256:c07faa34f9d8c0109b9d5f428a4d0a573f9064ac060b151a132254604a242809
admitted-under A2-direct-edge
admission-note 被 DiffusionDriveV2(PPR-2512.07745)引用为 GRPO 进入端到端驾驶的代表(在其引文中与 DIVER 并列),并被 DA-WAM 列入 NAVSIM v1 对照。

定位

Li 等(2025)提出 ReCogDrive。问题设定是:已有研究尝试借视觉语言模型(VLM)的世界知识与认知能力处理端到端驾驶的长尾问题,但常把轨迹规划表述为语言建模任务——物理动作在语言空间输出,导致格式违规、动作不可行与推理慢。ReCogDrive 统一驾驶理解与规划:先以模仿人类驾驶认知顺序的分层数据流水线(生成、精化、质控三阶段)把驾驶认知注入 VLM,以解决语言-动作不匹配,再把 VLM 学得的驾驶先验注入扩散规划器,由后者高效生成连续、可行的轨迹。

与本库的关系

  • 准入身份:A2-direct-edge(被 DiffusionDriveV2、DA-WAM 直接引用)。
  • 谱系定位:VLM/RL 与扩散规划的结合线。与 DIVER(PPR-2507.04049)、DiffusionDriveV2(PPR-2512.07745)同属“用 RL/认知信号纠正模仿式扩散规划”一族;与 AutoVLA 等 VLA 直接输出动作的路线互为对照。评测锚定 BMK-006

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(12)

  • PPR-2506.13757 AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
  • PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
  • PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2409.00588 DPPO 五层重建(骨架):核心对象是“用策略梯度微调扩散策略”的算法框架与最佳实践——把去噪过程视为多步 MDP 并嵌入环境 MDP,构成一个更大的“扩散策略 MDP”,使每步策略似然成为可解析求值的 Gaussian 似然,从而可直接套用任意策略梯度方法(并以 PPO 实例化);论文报告 RL 微调与扩散参数化之间存在协同,带来结构化、on-manifold 的探索、稳定训练与策略鲁棒性。
  • FRM-2502.13144 RAD 五层重建(骨架):核心对象是以 3DGS 构建光真实数字副本、在其上做闭环强化学习的端到端驾驶框架——策略通过大规模试错探索状态空间、学习分布外场景;奖励由动态碰撞、静态碰撞、位置偏离与朝向偏离四项构成(任一触发即终止 episode,因事后 3DGS 渲染的传感数据含噪);训练分感知预训练、规划预训练(IL 初始化以防 RL 冷启动不稳)与强化后训练(RL 引导安全、IL 作正则贴合人类)三阶段。
  • FRM-2504.01941 WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。
  • FRM-2506.08052 ReCogDrive 五层重建(骨架):核心对象是把 VLM 的驾驶认知先验与扩散规划器耦合、并以扩散版 GRPO 做安全后训练的三阶段框架——先用“生成/精炼/质控”三级流水线造出模仿人类认知顺序的驾驶 QA 数据训练 VLM,再把其认知 token 注入扩散规划器生成连续稳定轨迹,最后用 DiffGRPO 以 NAVSIM 仿真器的 PDMS 作奖励做强化;公理层含『把规划当语言建模会产出违格式/不可行动作且推理慢』与『多模专家演示下纯模仿会学出平均轨迹』。
  • FRM-2506.13757 AutoVLA 五层重建(骨架):核心对象是把推理与动作生成统一在单一自回归模型里的驾驶 VLA——把连续轨迹经 K-disk 聚类离散成 2048 个“物理可行”动作 token 直接并入语言词表,用监督微调赋予快思考(仅输出轨迹)与慢思考(CoT 增强)双模式,再以 GRPO 强化微调削掉直白场景中不必要的推理;公理层含『VLA 常见病是物理不可行动作、结构复杂与推理冗长』。
  • FRM-2507.04049 DIVER 五层重建(骨架):核心对象是以强化学习引导扩散生成多模轨迹的框架——策略感知扩散生成器(PADG)以地图元素与周围智能体为条件、由单一真值轨迹与轨迹锚引导生成“多个参考真值”以覆盖不同驾驶风格,再把扩散过程当作随机策略用 GRPO 目标的轨迹级多样性/安全奖励去引导,以破解模仿学习固有的模式坍缩;并针对 L2 类开环指标无法刻画多样性提出多样性度量。
  • FRM-2601.05083 Driving on Registers 五层重建(骨架):核心对象是极简纯 transformer 的端到端驾驶架构——以“相机感知的 register token”(每相机 R 个 register、得 N×R 个场景 token)把多相机特征压成紧凑场景表示、仅用 LoRA 微调预训练 ViT,再由两个轻量 transformer 解码器先生成候选轨迹、再模仿 oracle 打可解释子分数(安全/舒适/效率),从而支持推理期的行为条件驾驶。
  • IDX-001 NAVSIM 规划线