Research KB 登录

PPR-2409.00588 Paper

Diffusion Policy Policy Optimization

id
updated
type paper
title Diffusion Policy Policy Optimization
authors Allen Z. Ren, Justin Lidard, Lars Ankile, A. Simeonov, Pulkit Agrawal, Anirudha Majumdar
venue ICLR 2025 (arXiv:2409.00588)
arxiv 2409.00588
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2409.00588v3
source-hash sha256:33a06af5a1e576bc4041b74fe78375778ae9114aaa56d9ebb702e96232f3e406
admitted-under A2-direct-edge
admission-note 被 DiffusionDriveV2(PPR-2512.07745)间接引用(RL 微调扩散策略的训练机制来源之一);库内作为扩散策略 × RL 的方法学基础。

定位

Ren 等(ICLR 2025,MIT / Princeton)提出 DPPO(Diffusion Policy Policy Optimization),一个把基于扩散的策略(如 Diffusion Policy)用策略梯度(RL 中的 PG)方法在连续控制与机器人任务上微调的算法框架与最佳实践集合。论文指出:PG 方法在其他策略参数化下广泛使用,但此前有人猜测它对扩散式策略效率不高;实验反而显示 DPPO 在常见基准上取得最强综合表现与效率,优于面向扩散策略的其他 RL 方法,也优于对其他策略参数化做 PG 微调。论文进一步实验分析其机制:DPPO 利用了 RL 微调与扩散参数化之间的独特协同,产生结构化且在流形上的探索、稳定训练与强策略稳健性;并在含像素输入的仿真机器人任务等真实设定中验证。

与本库的关系

  • 准入身份:A2-direct-edge(被 DiffusionDriveV2 引用谱系;扩散策略 × RL 的方法学上游)。
  • 谱系定位:DIVER(PPR-2507.04049)、DiffusionDriveV2(PPR-2512.07745)等把 RL 接到扩散规划器的工作,其训练机制依据可上溯到本卡与 GRPO;库内 DiffusionDrive(PPR-2411.15139)的“Diffusion Policy 迁移到驾驶”则是本卡所讨论扩散策略的驾驶域实例。

Provenance

  • Tier-0 轻量 ingest(S2 元数据):version/source-hash 占位(待补)。

关联(5)

  • PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
  • PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
  • PPR-2512.07745 DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
  • FRM-2409.00588 DPPO 五层重建(骨架):核心对象是“用策略梯度微调扩散策略”的算法框架与最佳实践——把去噪过程视为多步 MDP 并嵌入环境 MDP,构成一个更大的“扩散策略 MDP”,使每步策略似然成为可解析求值的 Gaussian 似然,从而可直接套用任意策略梯度方法(并以 PPO 实例化);论文报告 RL 微调与扩散参数化之间存在协同,带来结构化、on-manifold 的探索、稳定训练与策略鲁棒性。
  • IDX-001 NAVSIM 规划线