Research KB 登录

PPR-2301.11902 Paper

Tree-structured Policy Planning with Learned Behavior Models

id
updated
type paper
title Tree-structured Policy Planning with Learned Behavior Models
authors Yuxiao Chen, Peter Karkus, Boris Ivanovic, Xinshuo Weng, Marco Pavone
venue IEEE International Conference on Robotics and Automation (ICRA) 2023
arxiv 2301.11902
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-09
version arXiv:2301.11902v2
source-hash sha256:af9c98362b3af13f3fca89c0144923f0ac76e2662c7886bcf976443c770e7aba
admitted-under A2-direct-edge
admission-note G2DP related work 引用(Chen 2023):SYN-003 支 4『稠密网格表示』——用占据网格但走 tree search 精修,不可微、不入去噪循环,与 HYPE 同列为 G2DP『稠密但不可微』的反面。

定位

Chen 等(ICRA 2023)提出的 Tree Policy Planning(TPP)。问题设定:自动驾驶需要在规划自车运动时推理邻车的多模态行为。许多已有轨迹规划器寻找一条“在所有可能未来下同时表现良好”的单一轨迹,忽略双向交互、导致过度保守。策略规划(policy planning)——自车规划一个对环境多模态行为作出反应的策略——是更有希望的方向,但多数策略规划器无法扩展到真实自动驾驶应用的复杂度:或与当代深度学习预测模型不兼容,或不可解释,或无法生成高质量轨迹。TPP 的做法是把连续优化问题降为可处理的离散马尔可夫决策过程(MDP),通过构造两棵树结构:一棵 ego 轨迹树(自车轨迹选项)与一棵 scenario 树(多模态、以自车为条件的环境预测);两棵树用动态规划求解,得到最优自车运动策略。论文在基于真实 nuScenes 数据的交互式仿真评估中验证,报告其可扩展到真实 AV 场景并显著优于非策略基线。

方法(机制要点)

  • 双树结构 + 动态规划:ego 轨迹树 × scenario 树,把连续优化离散化成 MDP。
  • ego-conditioned 预测:scenario 树由学习到的预测模型生成,且以自车行为为条件,从而建模双向交互。
  • 多阶段计划:生成多阶段运动计划(策略),而非单条轨迹。

与 G2DP 的关系

G2DP(PPR-2606.26017)related work 把 TPP 与 HYPE 同列为“用占据网格但经离散树搜索精修、缺乏可微性”的一类。SYN-003 支 4 把 TPP 记为 G2DP 最直接竞争面的稠密但不可微反面:同样使用占据网格,但通过离散树搜索/精修使用、不进入生成模型的去噪循环;G2DP 的坐标差在于把稠密概率场做成可微能量、直接注入去噪。

承重关系

  • 谱系锚点:引导模态谱系中“稠密网格 + 离散搜索”的实例;SYN-003 支 4 记其角色。
  • provenance:v2 tarball sha256 af9c9836…0e7aba,缓存 cache/sources/2301.11902/

关联(2)

  • PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
  • SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。