| FRM-2510.04333 |
RAP 五层重建(骨架):核心对象是“训练端到端规划器不需要光真实”这一主张及其实现——用轻量 3D 栅格化(对标注图元做栅格化)替代昂贵的光真实渲染,构造反事实恢复机动与跨智能体视角合成等增强,并用 Raster-to-Real 特征空间对齐弥合 sim-to-real 差距;公理层含『模仿学习缺恢复数据,闭环下小错误不可纠正并累积』与『驾驶依赖几何与动力学而非纹理光照』。 |
Formalization
|
|
| FRM-2601.05083 |
Driving on Registers 五层重建(骨架):核心对象是极简纯 transformer 的端到端驾驶架构——以“相机感知的 register token”(每相机 R 个 register、得 N×R 个场景 token)把多相机特征压成紧凑场景表示、仅用 LoRA 微调预训练 ViT,再由两个轻量 transformer 解码器先生成候选轨迹、再模仿 oracle 打可解释子分数(安全/舒适/效率),从而支持推理期的行为条件驾驶。 |
Formalization
|
|
| FRM-2605.19771 |
BeyondDrive 五层重建(骨架):核心对象是让模仿学习显式吸收失败——提出“安全不对称”性质(模仿误差几乎相同的两条轨迹安全性可截然不同,一条可恢复、一条致碰撞),故用流匹配的负轨迹生成器合成“安全关键但贴近专家”的硬负样本、以多样性感知采样提高失败模式覆盖,再用排斥距离损失同时吸引预测靠近专家并推离硬负样本,从而在轨迹空间建立可判别的安全边界。 |
Formalization
|
|
| FRM-2504.01941 |
WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。 |
Formalization
|
|
| FRM-2506.13757 |
AutoVLA 五层重建(骨架):核心对象是把推理与动作生成统一在单一自回归模型里的驾驶 VLA——把连续轨迹经 K-disk 聚类离散成 2048 个“物理可行”动作 token 直接并入语言词表,用监督微调赋予快思考(仅输出轨迹)与慢思考(CoT 增强)双模式,再以 GRPO 强化微调削掉直白场景中不必要的推理;公理层含『VLA 常见病是物理不可行动作、结构复杂与推理冗长』。 |
Formalization
|
|
| FRM-2603.14482 |
V-JEPA 2.1 五层重建(骨架):这是 V-JEPA 系列训练配方的改进而非驾驶方法——针对 V-JEPA 2 在需要像素级理解的稠密任务上的严重不足,改用“稠密预测损失”(可见上下文与掩蔽 token 全部参与损失、显式强制时空接地)+“深层自监督”(在多个中间编码器层分层施加自监督目标)+“多模态 tokenizer”(统一图文与视频训练)+ 模型与数据缩放四项要素,在分割/深度/短期动作预判等稠密任务上达最优、同时保持全局视频理解。 |
Formalization
|
|
| FRM-2506.09985 |
V-JEPA 2 五层重建(骨架):这是 FAIR 的通用世界模型工作而非驾驶方法——先在逾 100 万小时互联网视频上做“无动作”联合嵌入预测预训练(得到强运动理解与人类动作预判),再把其与语言模型对齐以做视频问答,最后用不足 62 小时无标注机器人视频后训练出潜动作条件世界模型 V-JEPA 2-AC,并在两个实验室的 Franka 机械臂上零样本做图像目标规划;库内引用它的价值在于它是 Drive-JEPA / Auto-JEPA 的预训练权重来源。 |
Formalization
|
|
| FRM-2502.13144 |
RAD 五层重建(骨架):核心对象是以 3DGS 构建光真实数字副本、在其上做闭环强化学习的端到端驾驶框架——策略通过大规模试错探索状态空间、学习分布外场景;奖励由动态碰撞、静态碰撞、位置偏离与朝向偏离四项构成(任一触发即终止 episode,因事后 3DGS 渲染的传感数据含噪);训练分感知预训练、规划预训练(IL 初始化以防 RL 冷启动不稳)与强化后训练(RL 引导安全、IL 作正则贴合人类)三阶段。 |
Formalization
|
|
| FRM-2310.12432 |
CAT 五层重建(骨架):核心对象是以环境增强视角做安全端到端驾驶的闭环对抗训练——用贝叶斯因式化把“场景为安全关键”的联合分布拆成“交通先验 × ego 估计 × 碰撞似然”三项(前提是 ego 反应单向依赖未来交通流),从而把对抗交通生成归结为标准运动预测子问题的乘积,使物理攻击更可行、迭代学习管线算力成本显著更低;公理层含『仅用真实数据集检索的场景不足以训练/评测,因事故易发事件极罕见』。 |
Formalization
|
|
| FRM-2404.07762 |
NeuroNCAP 五层重建(骨架):核心对象是以 Euro NCAP 为蓝本的安全关键场景闭环评测——用从真实驾驶传感序列学习的神经(NeRF 式)仿真器重构可配置的新场景,按目标 actor 行为分 stationary/frontal/side 三类,把 ego 与目标 actor 初始化到“若维持当前速度与转向约 4 秒后碰撞”,每场景随机抖动后跑 100 次;结果显示 UniAD/VAD 在开环名义场景表现良好,却在闭环安全关键场景下碰撞率高达 98–99%,暴露规划与辅助输出不一致这一设计缺陷。 |
Formalization
|
|