Research KB 登录
清除
类型 Paper 108 Benchmark 4 Dataset 2 Code 4 Formalization 68 Claim 29 Evidence 38 Concept 33 Conflict 1 Verification 19 Synthesis 3 Disambiguation 4 Index 1 Figure 2 Example 1 Lifecycle extracted formalized reconciled Epistemic n/a partially-supported supported unverified 102 命中
PPR-2402.13243 VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning概率式规划:把连续动作空间离散化为大规模规划词表并 token 化,规划 token 与场景 token 交互后输出动作概率分布,用海量演示监督该分布;在 CARLA Town05 闭环上取得当时领先,是大词表候选采样范式的代表。 Paper extracted n/a
PPR-2601.05083 Driving on RegistersDrivoR:基于预训练 ViT 的简洁 Transformer 规划架构——用相机感知寄存器 token 把多相机特征压成紧凑场景表示以大幅降低下游计算,再由两个轻量解码器分别生成与打分候选轨迹;打分解码器模仿 oracle 并预测安全/舒适/效率子分数以支持行为条件驾驶;在 NAVSIM v1/v2 与 HUGSIM 上匹配或超过强基线。 Paper extracted n/a
PPR-2308.01898 UniSim: A Neural Closed-Loop Sensor SimulatorUniSim:把单条传感器采集日志转为真实感闭环多传感器仿真——用神经特征网格重建静态背景与动态智能体并合成,从而在场景配置改变(增删智能体、轨迹与原始日志不同)时仍能渲染闭环所需的传感器数据,支持安全关键场景的闭环评测。 Paper extracted n/a
PPR-2309.17080 GAIA-1: A Generative World Model for Autonomous DrivingGAIA-1:用视频、文本与动作输入生成真实感驾驶场景,并对 ego 行为与场景特征提供细粒度控制——把世界建模表述为无监督序列建模,把输入映射为离散 token 并做下一 token 预测;报告涌现出高层结构/场景动态、上下文意识、泛化与几何理解。 Paper extracted n/a
PPR-2310.12432 CAT: Closed-loop Adversarial Training for Safe End-to-End DrivingCAT:不靠策略层算法设计,而从环境增强入手做闭环对抗训练——用新重采样技术把日志重放的现实驾驶场景经概率分解转为安全关键场景(对抗交通生成建模为标准运动预测子问题的乘积),以此持续提升驾驶智能体安全性并显著降低迭代训练计算成本。 Paper extracted n/a
PPR-2311.16038 OccWorld: Learning a 3D Occupancy World Model for Autonomous DrivingOccWorld:在 3D 占用空间学世界模型,同时预测 ego 运动与周边场景演化——在 3D 占用上训练基于重建的场景 tokenizer 得离散场景 token,再用 GPT 式时空生成 transformer 生成后续场景与 ego token;理由是占用比 3D 框/分割更细粒度、更易获得、且对视觉与 LiDAR 都通用。 Paper extracted n/a
PPR-2311.17918 Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous DrivingDrive-WM:用视图分解做联合时空建模,生成高保真多视角驾驶视频;据生成能力首次展示把世界模型用于安全规划——可基于不同驾驶机动推演多个未来,并按图像式奖励确定最优轨迹。 Paper extracted n/a
PPR-2404.07762 NeuroNCAP: Photorealistic Closed-loop Safety Testing for Autonomous DrivingNeuroNCAP:基于 NeRF 的通用仿真器,面向传感器级真实的闭环评测与安全关键场景构造——从真实驾驶传感器序列学习,支持对未见场景的重配置与渲染;用它测试端到端规划器对 Euro NCAP 式安全场景的反应,发现其开环表现好但闭环安全场景中存在严重缺陷。 Paper extracted n/a
PPR-2405.04390 DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous DrivingDriveWorld:用世界模型对多相机驾驶视频做时空 4D 预训练——记忆状态空间模型含动态记忆库(学时序潜动态以预测未来变化)与静态场景传播(学空间潜静态以提供场景上下文),并用任务提示解耦下游任务特征。 Paper extracted n/a
PPR-2405.17398 Vista: A Generalizable Driving World Model with High Fidelity and Versatile ControllabilityVista:面向可泛化、高保真、可控的驾驶世界模型——用两种新损失促进运动实例与结构信息学习,用潜替换注入历史帧先验以支持长时一致 rollout,并把高层意图(命令、目标点)到低层机动(轨迹、角度、速度)的多类控制经高效学习策略纳入;大规模训练后在未见环境泛化与下游规划上验证。 Paper extracted n/a
PPR-2406.08481 Enhancing End-to-End Autonomous Driving with Latent World ModelLAW:用一个自监督潜世界模型预测未来场景特征(以当前特征与 ego 轨迹为条件),该自监督任务可无缝接入无感知与有感知两种端到端框架,改善场景特征学习与轨迹预测;在 nuScenes 开环、NAVSIM 与 CARLA 闭环多基准上报告领先。 Paper extracted n/a
PPR-2408.00415 DriveArena: A Closed-Loop Generative Simulation Platform for Autonomous DrivingDriveArena:闭环生成式仿真平台——Traffic Manager 在任意全球街道地图上生成真实交通流,World Dreamer 是支持无限自回归的高保真条件生成模型;二者协同让任何能处理真实图像的驾驶智能体在生成环境中导航,模块化架构允许多种实现。 Paper extracted n/a
PPR-2409.00588 Diffusion Policy Policy OptimizationDPPO:用策略梯度对扩散式策略(如 Diffusion Policy)做微调的方法框架与最佳实践,证明其在常见连续控制基准上比面向扩散策略的其他 RL 方法与对策略参数化的 PG 微调更强、更高效,并给出“结构化且在流形上探索、训练稳定、策略稳健”等机制解释。 Paper extracted n/a
PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive TransformersDrivingGPT:基于交错的图像与动作 token 构造多模驾驶语言,用标准下一 token 预测同时学世界建模与规划;在 VQ token 空间首次同时展示动作条件视频生成与端到端规划,并在 nuPlan 与 NAVSIM 上超过强基线。 Paper extracted n/a
PPR-2502.13144 RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement LearningRAD:用 3D 高斯泼溅构建真实物理世界的照片级数字副本,让端到端驾驶策略在其中大规模试错学习、覆盖分布外场景;设计专门奖励引导策略响应安全关键事件并理解因果,并把模仿学习作为正则项纳入 RL 训练;报告相比模仿式方法碰撞率低约 3 倍,并给出未见 3DGS 环境的闭环评测基准。 Paper extracted n/a
PPR-2504.01941 End-to-End Driving with Online Trajectory Evaluation via BEV World ModelWoTE:把 BEV 世界模型用于在线轨迹评估——在世界模型中推演各候选轨迹的未来 BEV 状态并据此评估轨迹,使规划在选择阶段直接使用预测后果;作者群与 LAW 重叠,是“未来潜进打分”的一支。 Paper extracted n/a
PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous DrivingReCogDrive:把 VLM 的驾驶认知与扩散规划器结合——用模仿人类驾驶认知顺序(生成/精化/质控三阶段)的分层数据流水线注入驾驶先验,并把 VLM 学得的先验注入扩散规划器以生成连续可行轨迹,避免把物理动作放在语言空间输出导致的格式违规、不可行与慢推理。 Paper extracted n/a
PPR-2506.09985 V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and PlanningV-JEPA 2:先在百万小时级互联网视频上预训练无动作的联合嵌入预测架构,获得运动理解与人类动作预期能力;再用少量机器人交互轨迹做动作条件后训练,在物理世界做理解、预测与规划,是驾驶 JEPA 系(Drive-JEPA、DA-WAM 等)的骨干来源。 Paper extracted n/a
PPR-2506.13757 AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-TuningAutoVLA:把推理与动作生成统一进单个自回归生成模型——从原始视觉与语言指令直接做语义推理与轨迹规划,把连续轨迹离散化为可行动作 token 以接入语言模型;用监督微调赋予快思考(仅轨迹)与慢思考(含推理)两模式,再用强化微调提升效率。 Paper extracted n/a
PPR-2506.24113 Epona: Autoregressive Diffusion World Model for Autonomous DrivingEpona:自回归扩散世界模型——用解耦的时空分解把时序动态建模与细粒度未来生成分离,用模块化的轨迹与视频预测把运动规划与视觉建模整合进端到端框架,从而支持变长、长时程预测并纳入轨迹规划;配链式前向训练缓解误差累积。 Paper extracted n/a
PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous DrivingDIVER:把扩散式多模轨迹生成与强化学习结合——以地图元素与周围智能体为条件从每条真值参考轨迹生成多条参考轨迹以突破单模模仿限制,并把扩散过程视为随机策略用 GRPO 目标优化轨迹级多样性/安全奖励,直接缓解模式坍缩、提升避撞并鼓励超越专家的探索。 Paper extracted n/a
PPR-2510.08562 ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous DrivingResAD:不直接预测未来轨迹,而预测相对确定性惯性参考的残差偏移——惯性参考作为强物理先验,迫使模型把容量集中在学“必要且由上下文驱动的偏离”(交通规则、障碍),并缓解轨迹数据时空不平衡导致的优化负担与远距预测被过度优先的问题。 Paper extracted n/a
PPR-2510.12796 DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous DrivingDriveVLA-W0:用世界建模(预测未来图像)为视觉-语言-动作模型提供稠密自监督信号,以弥补动作维度低、监督稀疏的“监督赤字”;分别实例化为离散 token 的自回归世界模型与连续特征上的扩散世界模型,并加轻量动作专家以满足实时推理;NAVSIM v1/v2 与 680× 内部数据集上验证。 Paper extracted n/a
PPR-2512.10226 Latent Chain-of-Thought World Modeling for End-to-End DrivingLCDrive:把链式思维(CoT)表达在动作对齐的潜空间而非自然语言——推理时交替产生动作提案 token(与输出动作同词表)与世界模型 token(由潜世界模型接地、表达这些动作的未来后果);先用真值未来 rollout 冷启动监督,再后训练。 Paper extracted n/a
PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End DrivingDrive-JEPA:把视频联合嵌入预测架构(V-JEPA)适配到端到端驾驶——在大规模驾驶视频上预训练 ViT 编码器以产出与轨迹规划对齐的预测表示;再用候选中心规划器蒸馏模拟器生成的多样轨迹与人类轨迹,并配动量感知选择机制促进稳定安全行为。 Paper extracted n/a
PPR-2603.14482 V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised LearningV-JEPA 2.1:在图像与视频上同时学稠密、高质量视觉表示并保留全局场景理解——用遮蔽式稠密预测损失(可见与遮蔽 token 都进训练信号)促进显式时空接地,用深层自监督在多层编码器上分层施加目标,用多模 tokenizer 统一图像与视频训练,并随容量与数据扩展。 Paper extracted n/a
PPR-2605.09701 DriveFuture: Future-Aware Latent World Models for Autonomous DrivingDriveFuture:让当前潜状态建模过程以未来世界状态为条件——训练时先由当前潜状态与 ego 动作预测未来潜世界状态,再用真值未来潜做交叉注意力精化,所得未来感知潜作为扩散轨迹规划器的显式条件;推理时条件换成预测的未来潜。 Paper extracted n/a
PPR-2605.19771 Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard NegativesBeyondDrive:面向失败感知的模仿学习——论证“几何接近即行为安全”的隐含假设造成目标错配:模仿损失几乎相同的轨迹安全结果可能截然不同(一条可恢复、一条碰撞)。用流匹配式负轨迹生成器合成安全关键但贴近专家的轨迹以显式建模安全不对称,配多样性感知采样策略。 Paper extracted n/a
PPR-2605.31476 IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous DrivingIDOL:在 BEV 潜空间做世界模型规划,用逆动力学作为未来预测与轨迹优化之间的桥——先由 BEV 世界模型预测多个未来潜场景状态,再用逆动力学模型从相邻潜状态解码运动含义,以把描述性的未来推理转成可执行的运动更新,弥合“预测了未来但规划未受益”的缺口。 Paper extracted n/a
PPR-2607.29031 Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous DrivingAuto-JEPA:主张规划不必重建完整未来世界,只需关注影响未来 ego 动作的场景特征——用联合嵌入预测学习连续未来驾驶意图嵌入,再用该意图从固定轨迹记忆中检索可执行轨迹并由场景条件选择模块排序;视觉编码器冻结、无感知标注、无学习式轨迹生成器;NAVSIM v1 91.3 PDMS、v2 89.1 EPDMS。 Paper extracted n/a
PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World ModelWorld4Drive:用视觉基础模型构建潜在世界模型,在无感知标注下生成并评估多模规划轨迹——先抽取驾驶意图与含空间语义先验的世界潜表示,再据意图预测多个意图驱动的未来潜状态,最后用世界模型选择器评估并选出最优轨迹。 Paper extracted n/a
PPR-2312.03031 Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?BEV-Planner:诊断 nuScenes 开环端到端评估的两个问题——场景相对简单导致模型过度依赖 ego 状态(速度等)而少用感知信息;现有指标不足以评估规划质量。提出评估轨迹是否沿道路行驶的新指标,并给出一个竞争力强的简单基线。 Paper extracted n/a
PPR-2505.09315 TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving针对扩散式轨迹生成中不同随机噪声经去噪后收敛到相似轨迹(模式坍缩)的问题,研究不依赖预定义轨迹词表或训练集场景先验的解耦多模表示方案,以在未见场景下保持生成多样性。 Paper extracted n/a
PPR-2205.15997 TransFuser: Imitation With Transformer-Based Sensor Fusion for Autonomous DrivingTransFuser:用自注意力在多个分辨率上融合透视视图与鸟瞰视图特征,替代几何式传感器融合;在密集交通长路线的闭环基准与 CARLA 官方榜上取得领先,相比几何融合把平均每公里碰撞率降低 48%。后续 LiDAR-free 版本(Latent-Transfuser/LTF)是 NAVSIM 常用基线。 Paper extracted n/a
PPR-2303.12077 VAD: Vectorized Scene Representation for Efficient Autonomous DrivingVAD:把驾驶场景建模为完全向量化表示(智能体运动 + 地图元素作为显式实例级规划约束),替代稠密栅格化表示;据此提升规划安全并省去计算密集的栅格表示与人工后处理,在 nuScenes 端到端规划上取得领先并大幅加速。 Paper extracted n/a
PPR-2402.11502 GenAD: Generative End-to-End Autonomous Driving把端到端驾驶表述为生成建模:实例中心场景 tokenizer 把场景转为地图感知实例 token,用变分自编码器在结构化潜空间学习未来轨迹分布,再在潜空间做预测与规划;主张能建模自车与周围交通共同演化及结构式轨迹先验。 Paper extracted n/a
PPR-2406.06978 Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation多教师蒸馏 + 多候选打分:学生模型用多头解码器同时学人类演示与规则式教师的规划偏好,把规则教师的非可微后处理内化为端到端学习的环境影响;NAVSIM 挑战赛第一名,是其后续(Hydra-MDP++、DriveSuprim、SparseDriveV2)的共同底座。 Paper extracted n/a
PPR-2408.03601 DRAMA: An Efficient End-to-end Motion Planner for Autonomous Driving with MambaDRAMA:以 Mamba 序列建模替代二次复杂度注意力,融合相机、LiDAR BEV 特征与 ego 状态生成未来自车轨迹;Mamba-Transformer 解码器可通用挂到注意力式模型上,并提出特征状态 dropout,目标是降低复杂度以应对更复杂场景。 Paper extracted n/a
PPR-2503.07656 DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous DrivingDriveTransformer:以任务并行(智能体/地图/规划 query 在每个 block 直接交互)、稀疏表示(任务 query 直接交互原始传感器特征)、流式处理(任务 query 作为历史信息存储传递)为三特征的统一端到端框架,避免感知-预测-规划串行导致的误差累积与训练不稳,并便于扩展。 Paper extracted n/a
PPR-2212.10156 Planning-oriented Autonomous DrivingUniAD:把感知、预测、规划全部任务整合进单一网络,以规划为最终目标重排任务优先级,用统一 query 接口做任务间通信;提出面向规划的框架理念,是端到端自动驾驶后续工作(VAD、SparseDrive、GenAD 等)的共同参照与对照。 Paper extracted n/a
PPR-2507.17596 PRIX: Learning to Plan From Raw Pixels for End-to-End Autonomous Driving仅用相机、无显式 BEV、无需 LiDAR 的高效端到端规划器:视觉特征提取器配生成式规划头直接从原始像素预测安全轨迹,核心模块 CaRT 多层级视觉特征重校准增强规划鲁棒性;报告 NAVSIM v2 与 nuScenes 领先。 Paper extracted n/a
PPR-2503.11650 Centaur: Robust End-to-End Autonomous Driving with Test-Time Training以测试时训练提升规划鲁棒性:提出 Cluster Entropy 这一可解释的不确定性度量,在部署时通过最小化规划决策的不确定性更新规划器行为,不依赖人工规则或代价函数,避免回退层/代价函数法带来的过度保守。 Paper extracted n/a
PPR-2504.19580 ARTEMIS: Autoregressive End-to-End Trajectory Planning With Mixture of Experts for Autonomous Driving自回归式轨迹规划 + 专家混合(MoE):逐点顺序生成轨迹 waypoint 以保留时间依赖,并按场景把 query 动态路由到专门专家网络;配轻量批重分配策略加速 MoE 训练;NAVSIM 报告 86.9 PDMS / 83.1 EPDMS。 Paper extracted n/a
PPR-2505.15111 iPad: Iterative Proposal-Centric End-to-End Autonomous Driving以候选(proposal)为中心:ProFormer 对候选及其关联特征做候选锚定注意力的迭代精化,把未来计划置于特征提取与辅助任务中心,替代直接由稠密 BEV 网格特征生成计划,改善效率与交通规则合规。 Paper extracted n/a
PPR-2603.29163 SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving对 Hydra-MDP 的系统缩放研究:轨迹锚越稠密性能持续提升、在算力约束前未见饱和,据此主张动态候选生成并非必要——只要静态词表足够稠密,打分即足以取得领先 NAVSIM 表现;报告 v1 92.0 PDMS。 Paper extracted n/a
PPR-2405.19620 SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation以全稀疏场景表示替代稠密 BEV:对称稀疏感知模块统一检测/跟踪/在线建图,并配并行运动规划器;针对端到端规划的性能与效率瓶颈(稠密 BEV 计算昂贵、预测与规划设计直白)重审任务设计,报告规划安全与效率改善。 Paper extracted n/a
PPR-2503.05689 GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving用流匹配生成多模轨迹:以一个从场景信息选出的目标点约束生成过程,缓解扩散式轨迹生成的轨迹发散与引导-场景不一致;用高效生成方法替代多步扩散,论文报告 NAVSIM 上高 PDMS 与更好的多模质量。 Paper extracted n/a
PPR-2503.12820 Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-DistillationHydra-MDP 的扩展:教师指标加入红绿灯合规(TL)、车道保持(LK)与扩展舒适(EC)以覆盖旧教师遗漏的不安全行为;轻量 ResNet-34 与放大 V2-99 编码器两档,V2-99 下报告 NAVSIM 91.0 PDMS。 Paper extracted n/a
PPR-2506.06659 DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning选择式规划的精化:用由粗到细的渐进候选过滤、旋转增广提升分布外鲁棒性、自蒸馏稳定训练,解决从大量候选中精确选出最优、区分细微但安全关键差异的优化难题;报告 NAVSIM v1 93.5 PDMS、v2 87.1 EPDMS。 Paper extracted n/a
PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal PlanningGTRS:统一粗、细粒度轨迹评估的端到端多模规划框架——扩散生成器产出细粒度候选 + 词表泛化技术让打分器在超稠密轨迹集上训练,兼得静态词表的粗离散覆盖与动态候选的精细适应;被 DA-WAM 与 CLOVER 引用。 Paper extracted n/a