Research KB 登录

PPR-2512.10226 Paper

Latent Chain-of-Thought World Modeling for End-to-End Driving

id
updated
type paper
title Latent Chain-of-Thought World Modeling for End-to-End Driving
authors Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang
venue arXiv:2512.10226
arxiv 2512.10226
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2512.10226v3
source-hash sha256:397d90674eff5568e879e83154dcb894d0a3a3b71c88fc5cab3657129cfdcf4e
admitted-under A2-direct-edge
admission-note 被 DA-WAM(PPR-2608.19085)直接引用(tan2026latentcot,用未来潜做潜链式推理)。

定位

Tan 等(2025)提出 Latent-CoT-Drive(LCDrive)。论文关注驾驶 VLA 模型的推理时思考:既有工作多用自然语言表达链式思维(CoT)再产出驾驶动作,但文本可能不是最有效的推理表示。LCDrive 用捕捉所考虑驾驶动作可能后果的潜语言来表达 CoT,把推理与决策统一在同一动作对齐的潜空间:模型以两类 token 交替推理——动作提案 token(与模型输出动作同词表)与世界模型 token(接地于学得的潜世界模型,表达这些动作的未来后果)。训练上先用场景真值未来 rollout 监督动作提案与世界模型 token 做冷启动,再做后训练。

与本库的关系

  • 准入身份:A2-direct-edge(被 DA-WAM 直接引用)。
  • 谱系定位:未来潜用于推理(而非仅打分条件)的一支。与 IDOL(PPR-2605.31476)的逆动力学桥、DriveFuture(PPR-2605.09701)的未来潜条件、DA-WAM(PPR-2608.19085)的每候选未来潜打分共同构成“未来潜如何进入决策”的设计谱系。作者群与 NAVSIM/TransFuser 生态重叠。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(7)

  • PPR-2605.09701 DriveFuture: Future-Aware Latent World Models for Autonomous Driving
  • PPR-2605.31476 IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving
  • PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
  • FRM-2506.08052 ReCogDrive 五层重建(骨架):核心对象是把 VLM 的驾驶认知先验与扩散规划器耦合、并以扩散版 GRPO 做安全后训练的三阶段框架——先用“生成/精炼/质控”三级流水线造出模仿人类认知顺序的驾驶 QA 数据训练 VLM,再把其认知 token 注入扩散规划器生成连续稳定轨迹,最后用 DiffGRPO 以 NAVSIM 仿真器的 PDMS 作奖励做强化;公理层含『把规划当语言建模会产出违格式/不可行动作且推理慢』与『多模专家演示下纯模仿会学出平均轨迹』。
  • FRM-2506.13757 AutoVLA 五层重建(骨架):核心对象是把推理与动作生成统一在单一自回归模型里的驾驶 VLA——把连续轨迹经 K-disk 聚类离散成 2048 个“物理可行”动作 token 直接并入语言词表,用监督微调赋予快思考(仅输出轨迹)与慢思考(CoT 增强)双模式,再以 GRPO 强化微调削掉直白场景中不必要的推理;公理层含『VLA 常见病是物理不可行动作、结构复杂与推理冗长』。
  • FRM-2512.10226 Latent-CoT-Drive 五层重建(骨架):核心对象是把驾驶 VLA 的思维链从自然语言换到“动作对齐的潜语言”——推理轨迹由动作提案 token(与最终输出同一词表、每 10 步构成 1 秒块)与潜世界模型 token(同一 1 秒窗口的 ego 中心世界状态)交错组成,多分支(默认 2)展开成反事实未来并作为最终动作的条件;公理层含『自然语言不适合表达时空几何与多智能体交互』『文本链的生成延迟与动作—文本对齐弱』。
  • IDX-001 NAVSIM 规划线