PPR-2301.11902
Paper
Tree-structured Policy Planning with Learned Behavior Models
| id | |
|---|---|
| updated | |
| type | paper |
| title | Tree-structured Policy Planning with Learned Behavior Models |
| authors | Yuxiao Chen, Peter Karkus, Boris Ivanovic, Xinshuo Weng, Marco Pavone |
| venue | IEEE International Conference on Robotics and Automation (ICRA) 2023 |
| arxiv | 2301.11902 |
| tier | 0 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-09 |
| version | arXiv:2301.11902v2 |
| source-hash | sha256:af9c98362b3af13f3fca89c0144923f0ac76e2662c7886bcf976443c770e7aba |
| admitted-under | A2-direct-edge |
| admission-note | G2DP related work 引用(Chen 2023):SYN-003 支 4『稠密网格表示』——用占据网格但走 tree search 精修,不可微、不入去噪循环,与 HYPE 同列为 G2DP『稠密但不可微』的反面。 |
定位
Chen 等(ICRA 2023)提出的 Tree Policy Planning(TPP)。问题设定:自动驾驶需要在规划自车运动时推理邻车的多模态行为。许多已有轨迹规划器寻找一条“在所有可能未来下同时表现良好”的单一轨迹,忽略双向交互、导致过度保守。策略规划(policy planning)——自车规划一个对环境多模态行为作出反应的策略——是更有希望的方向,但多数策略规划器无法扩展到真实自动驾驶应用的复杂度:或与当代深度学习预测模型不兼容,或不可解释,或无法生成高质量轨迹。TPP 的做法是把连续优化问题降为可处理的离散马尔可夫决策过程(MDP),通过构造两棵树结构:一棵 ego 轨迹树(自车轨迹选项)与一棵 scenario 树(多模态、以自车为条件的环境预测);两棵树用动态规划求解,得到最优自车运动策略。论文在基于真实 nuScenes 数据的交互式仿真评估中验证,报告其可扩展到真实 AV 场景并显著优于非策略基线。
方法(机制要点)
- 双树结构 + 动态规划:ego 轨迹树 × scenario 树,把连续优化离散化成 MDP。
- ego-conditioned 预测:scenario 树由学习到的预测模型生成,且以自车行为为条件,从而建模双向交互。
- 多阶段计划:生成多阶段运动计划(策略),而非单条轨迹。
与 G2DP 的关系
G2DP(PPR-2606.26017)related work 把 TPP 与 HYPE 同列为“用占据网格但经离散树搜索精修、缺乏可微性”的一类。SYN-003 支 4 把 TPP 记为 G2DP 最直接竞争面的稠密但不可微反面:同样使用占据网格,但通过离散树搜索/精修使用、不进入生成模型的去噪循环;G2DP 的坐标差在于把稠密概率场做成可微能量、直接注入去噪。
承重关系
- 谱系锚点:引导模态谱系中“稠密网格 + 离散搜索”的实例;SYN-003 支 4 记其角色。
- provenance:v2 tarball sha256
af9c9836…0e7aba,缓存cache/sources/2301.11902/。
关联(2)
- PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。