PPR-2506.13757
Paper
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
| id | |
|---|---|
| updated | |
| type | paper |
| title | AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning |
| authors | Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhou |
| venue | NeurIPS 2025 (arXiv:2506.13757) |
| arxiv | 2506.13757 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2506.13757v3 |
| source-hash | sha256:d52c018fc4291d54be4487f4b98b5d52c85cf4edcad0bd16fbdec2630727bc43 |
| admitted-under | A2-direct-edge |
| admission-note | 被 DA-WAM(PPR-2608.19085)列入 NAVSIM v1 对照表(NeurIPS'25),被 DiffusionDriveV2 引用(VLA × 规划)。 |
定位
Zhou 等(NeurIPS 2025,UCLA / 上海交大)提出 AutoVLA。论文指出视觉-语言-动作(VLA)模型在端到端驾驶上有借世界知识与推理的潜力,但既有 VLA 常产出物理上不可行的动作、或结构复杂、或推理冗长。AutoVLA 把推理与动作生成统一在单个自回归生成模型内:直接从原始视觉输入与语言指令做语义推理与轨迹规划;把连续轨迹 token 化为离散、可行的动作以直接接入语言模型。训练上用监督微调赋予模型两种思考模式——快思考(仅轨迹)与慢思考(含推理),再用强化微调提升推理效率。
与本库的关系
- 准入身份:A2-direct-edge(被 DA-WAM、DiffusionDriveV2 直接引用)。
- 谱系定位:VLA 直接输出动作线,与 ReCogDrive(PPR-2506.08052)“VLM 认知 + 扩散规划器”、OpenDriveVLA 等把语言与轨迹生成分工的路线互为对照;其“动作 token 化”也是 DrivingGPT(PPR-2412.18607)多模 token 序列思路在 VLA 域的另一实现。评测锚定 BMK-006。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(5)
- PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
- PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2506.13757 AutoVLA 五层重建(骨架):核心对象是把推理与动作生成统一在单一自回归模型里的驾驶 VLA——把连续轨迹经 K-disk 聚类离散成 2048 个“物理可行”动作 token 直接并入语言词表,用监督微调赋予快思考(仅输出轨迹)与慢思考(CoT 增强)双模式,再以 GRPO 强化微调削掉直白场景中不必要的推理;公理层含『VLA 常见病是物理不可行动作、结构复杂与推理冗长』。
- IDX-001 NAVSIM 规划线