Research KB 登录

PPR-2506.13757 Paper

AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning

id
updated
type paper
title AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
authors Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhou
venue NeurIPS 2025 (arXiv:2506.13757)
arxiv 2506.13757
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2506.13757v3
source-hash sha256:d52c018fc4291d54be4487f4b98b5d52c85cf4edcad0bd16fbdec2630727bc43
admitted-under A2-direct-edge
admission-note 被 DA-WAM(PPR-2608.19085)列入 NAVSIM v1 对照表(NeurIPS'25),被 DiffusionDriveV2 引用(VLA × 规划)。

定位

Zhou 等(NeurIPS 2025,UCLA / 上海交大)提出 AutoVLA。论文指出视觉-语言-动作(VLA)模型在端到端驾驶上有借世界知识与推理的潜力,但既有 VLA 常产出物理上不可行的动作、或结构复杂、或推理冗长。AutoVLA 把推理与动作生成统一在单个自回归生成模型内:直接从原始视觉输入与语言指令做语义推理与轨迹规划;把连续轨迹 token 化为离散、可行的动作以直接接入语言模型。训练上用监督微调赋予模型两种思考模式——快思考(仅轨迹)与慢思考(含推理),再用强化微调提升推理效率。

与本库的关系

  • 准入身份:A2-direct-edge(被 DA-WAM、DiffusionDriveV2 直接引用)。
  • 谱系定位:VLA 直接输出动作线,与 ReCogDrive(PPR-2506.08052)“VLM 认知 + 扩散规划器”、OpenDriveVLA 等把语言与轨迹生成分工的路线互为对照;其“动作 token 化”也是 DrivingGPT(PPR-2412.18607)多模 token 序列思路在 VLA 域的另一实现。评测锚定 BMK-006

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(5)

  • PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
  • PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2506.13757 AutoVLA 五层重建(骨架):核心对象是把推理与动作生成统一在单一自回归模型里的驾驶 VLA——把连续轨迹经 K-disk 聚类离散成 2048 个“物理可行”动作 token 直接并入语言词表,用监督微调赋予快思考(仅输出轨迹)与慢思考(CoT 增强)双模式,再以 GRPO 强化微调削掉直白场景中不必要的推理;公理层含『VLA 常见病是物理不可行动作、结构复杂与推理冗长』。
  • IDX-001 NAVSIM 规划线