Research KB 登录

PPR-005 Paper

Synthesis and Stabilization of Complex Behaviors through Online Trajectory Optimization

id
updated
type paper
title Synthesis and Stabilization of Complex Behaviors through Online Trajectory Optimization
authors Yuval Tassa, Tom Erez, Emanuel Todorov
venue 2012 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
doi 10.1109/IROS.2012.6386025
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-09
version IROS 2012:4906-4913; DOI:10.1109/IROS.2012.6386025
source-hash sha256:d7e503d552d31bf1475c4ca5873b34c4b7dcd6f6a825229286d721f918d9515a
admitted-under U0-user-directive
admission-note 用户指令性准入(2026-09-09,D18 U0):为 PPR-2205.09991 正文『轨迹优化器』一类的举例提供承重锚点(原卡仅引作者名,无库内对象可解析)。

定位

Tassa、Erez 与 Todorov(IROS 2012)提出的在线轨迹优化(online trajectory optimization,即模型预测控制 MPC)方法与软件平台。论文针对复杂人形机器人(humanoid robots)执行困难任务,例如从地面任意姿态起身、以及用灵巧的杂技动作从大扰动中恢复。核心主张是:在线轨迹优化保留了最优控制框架“用简单代价函数指定高层任务目标、自动合成行为与控制律”的优点,同时绕开动态规划的状态空间维度灾难——不在事前为每种情形准备策略,而是把策略设计推迟到运行时。论文报告这些行为在标准 PC 上的计算耗时约为实时的 7 倍(即 7× slower than real time);更简单的问题(acrobot、平面游泳、单腿跳跃)可以实时求解,无需任何预计算。

方法(机制要点)

  • 优化器是 iLQG:Linear Quadratic Gaussian 轨迹优化器,是 Differential Dynamic Programming(DDP)的一个变体;主要差别在于 iLQG 用 Gauss-Newton 近似 Hessian(忽略动力学的二阶导数项),牺牲部分 DDP 的二次收敛性以换取每步更廉价的计算。
  • 正则化与线搜索改进:标准 DDP 在离最优较远时二次模型不准确、步长可能失效;论文引入类 Levenberg-Marquardt 的正则化(控制项与状态项两路)、按期望总代价缩减做线搜索,以及正则化调度,使迭代稳定。
  • 反馈增益:由 LQ 子问题解出时变反馈增益,闭环执行时据此稳定轨迹。
  • 简化接触模型:为让动力学足够平滑(在线优化需要),论文采用一个简化接触动力学模型,在物理精度与平滑性之间取折中。

与本库的关系

本卡因 PPR-2205.09991(Diffuser)正文对“轨迹优化器”的举例而入库:该卡把轨迹优化器定义为“以显式动力学模型为前提、用梯度或数值优化求动作序列的一类方法”,并把 Tassa 等 2012 列为举例之一;本卡为这个举例提供库内可解析的锚点,并给出其具体机制——iLQG/DDP 的打靶/梯度路线,与 Posa 等 2014(PPR-003)的直接转录成 NLP 路线相对。与 G2DP(PPR-2606.26017)无直接引用边,不构成 G2DP 谱系邻居。S2 引用数 988(查询日期 2026-09-09)。

承重关系

  • 谱系定位:Diffuser(PPR-2205.09991)所引“轨迹优化器”方法类的 iLQG/DDP 实例,为该卡的术语定义提供锚点。
  • provenance:作者站点 PDF(roboti.us/lab/papers/TassaIROS12.pdf),sha256 d7e503d5…f918d9515a,缓存 cache/sources/non-arxiv/tassa2012.pdf

关联(4)

  • PPR-003 A direct method for trajectory optimization of rigid bodies through contact
  • PPR-2205.09991 Planning with Diffusion for Flexible Behavior Synthesis
  • PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
  • CPT-019 shooting method