Research KB 登录

PPR-2205.09991 Paper

Planning with Diffusion for Flexible Behavior Synthesis

id
updated
type paper
title Planning with Diffusion for Flexible Behavior Synthesis
authors Michael Janner, Yilun Du, Joshua B. Tenenbaum, Sergey Levine
venue ICML 2022 (arXiv:2205.09991)
arxiv 2205.09991
doi 10.48550/arXiv.2205.09991
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-03
version arXiv:2205.09991v2
source-hash 32bfd4d7900effba3d0585709175d55437dbd6d40aaec1584cdf2612f0f57d0d
admitted-under A2-direct-edge
admission-note G2DP 引用本工作作为扩散规划领域最相近的方法学近亲(Janner et al., ICML 2022)——两者同属『扩散 + 引导』谱系,差异在于 G2DP 的引导能量来自稠密的时空占据/进度 cost volume,而非对少数预测实例的稀疏几何或分类器 logits。
citation-count-s2 1357

定位

提出 Diffuser 的原始论文(ICML 2022,Berkeley)。论文针对的设定是“用学到的模型做规划”:先从数据中学一个环境动力学模型,再让一个轨迹优化器在该模型上搜索使回报最大的动作序列。环境动力学模型是描述环境状态如何随动作演化的转移函数:状态是刻画被建模系统当前状况的物理量向量(如智能体的位置、速度、朝向,或机械系统的关节角与角速度),动作是控制输入,转移函数给出给定二者时的下一状态(\(s_{t+1}=f(s_t,a_t)\))。在基于模型的强化学习里,它不是已知的物理方程,而是从数据拟合出的近似(实践中多为神经网络)。轨迹优化器指以显式动力学模型为前提、用梯度或数值优化求动作序列的一类方法,如 iLQR/iLQG/DDP 类在线轨迹优化与直接配点法。论文举的三个例子是 Tassa 等 2012(PPR-005)、Posa 等 2014(PPR-003)与 Kelly(PPR-004),均已入库。

论文的关键观察是这套组合会失效:模型只是近似,优化器会**利用(exploit)**它的误差,找到在该错误模型下回报很高、在真实环境中却并不好的动作序列,计划因此“更像对抗样本而非最优轨迹”(引 Talvitie 2014、Ke 等 2018)。因此,基于模型的强化学习大多转向模型无关方法,或只保留简单的无梯度轨迹优化例程——如随机打靶(random shooting)或交叉熵方法(cross-entropy method, CEM);两者都属打靶法(CPT-019),只是优化时不使用导数。

Diffuser 的出路是把规划并入生成模型本身——用一个轨迹级扩散概率模型 \(p_\theta(\tau)\) 直接建模状态-动作轨迹分布,使“从模型采样”与“用模型规划”几乎同一。规划的柔性来自扩散模型的迭代去噪对扰动分布 \(\tilde{p}_\theta(\tau)\propto p_\theta(\tau)h(\tau)\) 的天然支持:\(h\) 可编码观测历史、目标或待优化的函数(奖励/代价),从而单个模型在不重训的前提下复用于多任务。

方法(机制要点)

  • 轨迹表示:非自回归预测全部时步,轨迹为二维数组 \(\begin{bmatrix}\mathbf{s}_0..\mathbf{s}_T\\\mathbf{a}_0..\mathbf{a}_T\end{bmatrix}\),状态与动作联合预测(动作即状态增维)。此表示因决策可能是反因果的(当前决策条件于未来,引 control-as-inference 的未来最优性变量)而不能用时序自回归。
  • 架构:U-Net 式残差块,二维空间卷积换成一维时间卷积——预测的时间感受野仅含邻近时步(时间局部性),由多次去噪步把局部一致组合成全局连贯;全卷积使规划时域由输入噪声维度决定,可动态变长。
  • 训练:参数化噪声梯度 \(\epsilon_\theta\)(均值 \(\mu_\theta\) 闭式解),简化 \(\epsilon\)-目标,反向协方差用 cosine 调度(Nichol 2021)。
  • RL 作为引导采样:借 control-as-inference(Levine 2018),以最优性变量 \(O_t\)\(p(O_t{=}1)=\exp(r(s_t,a_t))\)\(h(\tau)=p(O_{1:T}|\tau)\);训练独立回报预测器 \(J_\phi\),其梯度按分类器引导式修改去噪均值(\(\mu+\Sigma g\)),等效于对 \(\nabla J(\mu)\) 采样;首个动作执行后进滚动时域(receding-horizon)环。
  • 目标条件 RL 作为 inpainting:目标/约束 = 二维数组里的“观测像素”,用狄拉克 \(\delta\) 扰动函数,去噪时用约束值替换采样值;所有采样轨迹须条件于当前状态,也走此补全。

实验结果(摘要)

  • 长程多任务规划(Maze2D/Multi2D,D4RL):无 reward shaping 下 inpainting 条件起止点,各迷宫得分>100 超专家参照;多任务无需重训(改条件目标即可),优于 IQL 等 model-free;MPPI 用真实动力学仍劣于 Diffuser。
  • 测试时柔性(block stacking,PDDLStream 演示训 10k 轨迹):无条件/条件堆叠/重排三设定只改扰动函数 \(h\),显著优于 BCQ/CQL。
  • 离线 RL(D4RL locomotion):回报引导 + 状态补全,性能与单任务最优离线算法持平(优于 MOReL/MBOP/Decision Transformer,略逊顶尖单任务离线法);Diffuser 当动力学模型接 MPPI 不工作——证明效力来自耦合建模-规划而非开环预测精度。
  • 热启动:复用上一步计划作部分前向噪声再部分去噪重生成,大幅降规划预算、性能损失有限。

与 G2DP 的关系(PPR-2606.26017

G2DP 引用本工作作为扩散规划领域最相近的方法学近亲:两者同属『扩散 + 引导』谱系——均以扩散模型做轨迹/方案采样、以引导函数注入任务偏好。差异:Diffuser 的引导来自对轨迹样本的稀疏几何/分类器形式信号(回报预测器梯度 \(J_\phi\)、目标/约束 inpainting),而 G2DP 的引导能量来自稠密的时空占据/进度 cost volume(库内 CPT-013,cost grid),对应 G2DP 的“稀疏引导臂”实现来源(见 FRM-2501.15564 §1)。谱系上,库内 Diffusion PlannerPPR-2501.15564,ICLR 2025)是 Diffuser 思想的规划域直系后代:同样扩散采样 + 免训练 classifier guidance,但经 task redefinition 把 ego+邻车联合轨迹重定义为生成任务、以可微能量函数(碰撞/可行驶域/目标速度/舒适度)在推理时引导,并在去噪末段施加 DPS。

承重关系

  • 谱系锚点:扩散规划谱系(Diffuser → Diffusion Planner → G2DP)的源头方法卡;库内 DiT/LDM 谱系(PPR-2212.09748 / PPR-2112.10752)提供其底层扩散机制,本文是其向轨迹/决策域的转移实例。
  • provenance:v2 tarball sha256 32bfd4d7…f57d0d,缓存 cache/sources/2205.09991/

关联(13)

  • PPR-003 A direct method for trajectory optimization of rigid bodies through contact
  • PPR-004 An Introduction to Trajectory Optimization: How to Do Your Own Direct Collocation
  • PPR-005 Synthesis and Stabilization of Complex Behaviors through Online Trajectory Optimization
  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2306.03083 MotionDiffuser: Controllable Multi-Agent Motion Prediction using Diffusion
  • PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
  • PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
  • PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
  • FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
  • CPT-013 spatio-temporal cost volume
  • CPT-019 shooting method
  • SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。