PPR-2205.09991
Paper
Planning with Diffusion for Flexible Behavior Synthesis
| id | |
|---|---|
| updated | |
| type | paper |
| title | Planning with Diffusion for Flexible Behavior Synthesis |
| authors | Michael Janner, Yilun Du, Joshua B. Tenenbaum, Sergey Levine |
| venue | ICML 2022 (arXiv:2205.09991) |
| arxiv | 2205.09991 |
| doi | 10.48550/arXiv.2205.09991 |
| tier | 0 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-03 |
| version | arXiv:2205.09991v2 |
| source-hash | 32bfd4d7900effba3d0585709175d55437dbd6d40aaec1584cdf2612f0f57d0d |
| admitted-under | A2-direct-edge |
| admission-note | G2DP 引用本工作作为扩散规划领域最相近的方法学近亲(Janner et al., ICML 2022)——两者同属『扩散 + 引导』谱系,差异在于 G2DP 的引导能量来自稠密的时空占据/进度 cost volume,而非对少数预测实例的稀疏几何或分类器 logits。 |
| citation-count-s2 | 1357 |
定位
提出 Diffuser 的原始论文(ICML 2022,Berkeley)。论文针对的设定是“用学到的模型做规划”:先从数据中学一个环境动力学模型,再让一个轨迹优化器在该模型上搜索使回报最大的动作序列。环境动力学模型是描述环境状态如何随动作演化的转移函数:状态是刻画被建模系统当前状况的物理量向量(如智能体的位置、速度、朝向,或机械系统的关节角与角速度),动作是控制输入,转移函数给出给定二者时的下一状态(\(s_{t+1}=f(s_t,a_t)\))。在基于模型的强化学习里,它不是已知的物理方程,而是从数据拟合出的近似(实践中多为神经网络)。轨迹优化器指以显式动力学模型为前提、用梯度或数值优化求动作序列的一类方法,如 iLQR/iLQG/DDP 类在线轨迹优化与直接配点法。论文举的三个例子是 Tassa 等 2012(PPR-005)、Posa 等 2014(PPR-003)与 Kelly(PPR-004),均已入库。
论文的关键观察是这套组合会失效:模型只是近似,优化器会**利用(exploit)**它的误差,找到在该错误模型下回报很高、在真实环境中却并不好的动作序列,计划因此“更像对抗样本而非最优轨迹”(引 Talvitie 2014、Ke 等 2018)。因此,基于模型的强化学习大多转向模型无关方法,或只保留简单的无梯度轨迹优化例程——如随机打靶(random shooting)或交叉熵方法(cross-entropy method, CEM);两者都属打靶法(CPT-019),只是优化时不使用导数。
Diffuser 的出路是把规划并入生成模型本身——用一个轨迹级扩散概率模型 \(p_\theta(\tau)\) 直接建模状态-动作轨迹分布,使“从模型采样”与“用模型规划”几乎同一。规划的柔性来自扩散模型的迭代去噪对扰动分布 \(\tilde{p}_\theta(\tau)\propto p_\theta(\tau)h(\tau)\) 的天然支持:\(h\) 可编码观测历史、目标或待优化的函数(奖励/代价),从而单个模型在不重训的前提下复用于多任务。
方法(机制要点)
- 轨迹表示:非自回归预测全部时步,轨迹为二维数组 \(\begin{bmatrix}\mathbf{s}_0..\mathbf{s}_T\\\mathbf{a}_0..\mathbf{a}_T\end{bmatrix}\),状态与动作联合预测(动作即状态增维)。此表示因决策可能是反因果的(当前决策条件于未来,引 control-as-inference 的未来最优性变量)而不能用时序自回归。
- 架构:U-Net 式残差块,二维空间卷积换成一维时间卷积——预测的时间感受野仅含邻近时步(时间局部性),由多次去噪步把局部一致组合成全局连贯;全卷积使规划时域由输入噪声维度决定,可动态变长。
- 训练:参数化噪声梯度 \(\epsilon_\theta\)(均值 \(\mu_\theta\) 闭式解),简化 \(\epsilon\)-目标,反向协方差用 cosine 调度(Nichol 2021)。
- RL 作为引导采样:借 control-as-inference(Levine 2018),以最优性变量 \(O_t\)、\(p(O_t{=}1)=\exp(r(s_t,a_t))\) 置 \(h(\tau)=p(O_{1:T}|\tau)\);训练独立回报预测器 \(J_\phi\),其梯度按分类器引导式修改去噪均值(\(\mu+\Sigma g\)),等效于对 \(\nabla J(\mu)\) 采样;首个动作执行后进滚动时域(receding-horizon)环。
- 目标条件 RL 作为 inpainting:目标/约束 = 二维数组里的“观测像素”,用狄拉克 \(\delta\) 扰动函数,去噪时用约束值替换采样值;所有采样轨迹须条件于当前状态,也走此补全。
实验结果(摘要)
- 长程多任务规划(Maze2D/Multi2D,D4RL):无 reward shaping 下 inpainting 条件起止点,各迷宫得分>100 超专家参照;多任务无需重训(改条件目标即可),优于 IQL 等 model-free;MPPI 用真实动力学仍劣于 Diffuser。
- 测试时柔性(block stacking,PDDLStream 演示训 10k 轨迹):无条件/条件堆叠/重排三设定只改扰动函数 \(h\),显著优于 BCQ/CQL。
- 离线 RL(D4RL locomotion):回报引导 + 状态补全,性能与单任务最优离线算法持平(优于 MOReL/MBOP/Decision Transformer,略逊顶尖单任务离线法);Diffuser 当动力学模型接 MPPI 不工作——证明效力来自耦合建模-规划而非开环预测精度。
- 热启动:复用上一步计划作部分前向噪声再部分去噪重生成,大幅降规划预算、性能损失有限。
与 G2DP 的关系(PPR-2606.26017)
G2DP 引用本工作作为扩散规划领域最相近的方法学近亲:两者同属『扩散 + 引导』谱系——均以扩散模型做轨迹/方案采样、以引导函数注入任务偏好。差异:Diffuser 的引导来自对轨迹样本的稀疏几何/分类器形式信号(回报预测器梯度 \(J_\phi\)、目标/约束 inpainting),而 G2DP 的引导能量来自稠密的时空占据/进度 cost volume(库内 CPT-013,cost grid),对应 G2DP 的“稀疏引导臂”实现来源(见 FRM-2501.15564 §1)。谱系上,库内 Diffusion Planner(PPR-2501.15564,ICLR 2025)是 Diffuser 思想的规划域直系后代:同样扩散采样 + 免训练 classifier guidance,但经 task redefinition 把 ego+邻车联合轨迹重定义为生成任务、以可微能量函数(碰撞/可行驶域/目标速度/舒适度)在推理时引导,并在去噪末段施加 DPS。
承重关系
- 谱系锚点:扩散规划谱系(Diffuser → Diffusion Planner → G2DP)的源头方法卡;库内 DiT/LDM 谱系(PPR-2212.09748 / PPR-2112.10752)提供其底层扩散机制,本文是其向轨迹/决策域的转移实例。
- provenance:v2 tarball sha256
32bfd4d7…f57d0d,缓存cache/sources/2205.09991/。
关联(13)
- PPR-003 A direct method for trajectory optimization of rigid bodies through contact
- PPR-004 An Introduction to Trajectory Optimization: How to Do Your Own Direct Collocation
- PPR-005 Synthesis and Stabilization of Complex Behaviors through Online Trajectory Optimization
- PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- PPR-2306.03083 MotionDiffuser: Controllable Multi-Agent Motion Prediction using Diffusion
- PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
- PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
- PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- CPT-013 spatio-temporal cost volume
- CPT-019 shooting method
- SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。