PPR-2409.00588
Paper
Diffusion Policy Policy Optimization
| id | |
|---|---|
| updated | |
| type | paper |
| title | Diffusion Policy Policy Optimization |
| authors | Allen Z. Ren, Justin Lidard, Lars Ankile, A. Simeonov, Pulkit Agrawal, Anirudha Majumdar |
| venue | ICLR 2025 (arXiv:2409.00588) |
| arxiv | 2409.00588 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2409.00588v3 |
| source-hash | sha256:33a06af5a1e576bc4041b74fe78375778ae9114aaa56d9ebb702e96232f3e406 |
| admitted-under | A2-direct-edge |
| admission-note | 被 DiffusionDriveV2(PPR-2512.07745)间接引用(RL 微调扩散策略的训练机制来源之一);库内作为扩散策略 × RL 的方法学基础。 |
定位
Ren 等(ICLR 2025,MIT / Princeton)提出 DPPO(Diffusion Policy Policy Optimization),一个把基于扩散的策略(如 Diffusion Policy)用策略梯度(RL 中的 PG)方法在连续控制与机器人任务上微调的算法框架与最佳实践集合。论文指出:PG 方法在其他策略参数化下广泛使用,但此前有人猜测它对扩散式策略效率不高;实验反而显示 DPPO 在常见基准上取得最强综合表现与效率,优于面向扩散策略的其他 RL 方法,也优于对其他策略参数化做 PG 微调。论文进一步实验分析其机制:DPPO 利用了 RL 微调与扩散参数化之间的独特协同,产生结构化且在流形上的探索、稳定训练与强策略稳健性;并在含像素输入的仿真机器人任务等真实设定中验证。
与本库的关系
- 准入身份:A2-direct-edge(被 DiffusionDriveV2 引用谱系;扩散策略 × RL 的方法学上游)。
- 谱系定位:DIVER(PPR-2507.04049)、DiffusionDriveV2(PPR-2512.07745)等把 RL 接到扩散规划器的工作,其训练机制依据可上溯到本卡与 GRPO;库内 DiffusionDrive(PPR-2411.15139)的“Diffusion Policy 迁移到驾驶”则是本卡所讨论扩散策略的驾驶域实例。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(5)
- PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
- PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
- PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
- FRM-2409.00588 DPPO 五层重建(骨架):核心对象是“用策略梯度微调扩散策略”的算法框架与最佳实践——把去噪过程视为多步 MDP 并嵌入环境 MDP,构成一个更大的“扩散策略 MDP”,使每步策略似然成为可解析求值的 Gaussian 似然,从而可直接套用任意策略梯度方法(并以 PPO 实例化);论文报告 RL 微调与扩散参数化之间存在协同,带来结构化、on-manifold 的探索、稳定训练与策略鲁棒性。
- IDX-001 NAVSIM 规划线