PPR-005
Paper
Synthesis and Stabilization of Complex Behaviors through Online Trajectory Optimization
| id | |
|---|---|
| updated | |
| type | paper |
| title | Synthesis and Stabilization of Complex Behaviors through Online Trajectory Optimization |
| authors | Yuval Tassa, Tom Erez, Emanuel Todorov |
| venue | 2012 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) |
| doi | 10.1109/IROS.2012.6386025 |
| tier | 0 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-09 |
| version | IROS 2012:4906-4913; DOI:10.1109/IROS.2012.6386025 |
| source-hash | sha256:d7e503d552d31bf1475c4ca5873b34c4b7dcd6f6a825229286d721f918d9515a |
| admitted-under | U0-user-directive |
| admission-note | 用户指令性准入(2026-09-09,D18 U0):为 PPR-2205.09991 正文『轨迹优化器』一类的举例提供承重锚点(原卡仅引作者名,无库内对象可解析)。 |
定位
Tassa、Erez 与 Todorov(IROS 2012)提出的在线轨迹优化(online trajectory optimization,即模型预测控制 MPC)方法与软件平台。论文针对复杂人形机器人(humanoid robots)执行困难任务,例如从地面任意姿态起身、以及用灵巧的杂技动作从大扰动中恢复。核心主张是:在线轨迹优化保留了最优控制框架“用简单代价函数指定高层任务目标、自动合成行为与控制律”的优点,同时绕开动态规划的状态空间维度灾难——不在事前为每种情形准备策略,而是把策略设计推迟到运行时。论文报告这些行为在标准 PC 上的计算耗时约为实时的 7 倍(即 7× slower than real time);更简单的问题(acrobot、平面游泳、单腿跳跃)可以实时求解,无需任何预计算。
方法(机制要点)
- 优化器是 iLQG:Linear Quadratic Gaussian 轨迹优化器,是 Differential Dynamic Programming(DDP)的一个变体;主要差别在于 iLQG 用 Gauss-Newton 近似 Hessian(忽略动力学的二阶导数项),牺牲部分 DDP 的二次收敛性以换取每步更廉价的计算。
- 正则化与线搜索改进:标准 DDP 在离最优较远时二次模型不准确、步长可能失效;论文引入类 Levenberg-Marquardt 的正则化(控制项与状态项两路)、按期望总代价缩减做线搜索,以及正则化调度,使迭代稳定。
- 反馈增益:由 LQ 子问题解出时变反馈增益,闭环执行时据此稳定轨迹。
- 简化接触模型:为让动力学足够平滑(在线优化需要),论文采用一个简化接触动力学模型,在物理精度与平滑性之间取折中。
与本库的关系
本卡因 PPR-2205.09991(Diffuser)正文对“轨迹优化器”的举例而入库:该卡把轨迹优化器定义为“以显式动力学模型为前提、用梯度或数值优化求动作序列的一类方法”,并把 Tassa 等 2012 列为举例之一;本卡为这个举例提供库内可解析的锚点,并给出其具体机制——iLQG/DDP 的打靶/梯度路线,与 Posa 等 2014(PPR-003)的直接转录成 NLP 路线相对。与 G2DP(PPR-2606.26017)无直接引用边,不构成 G2DP 谱系邻居。S2 引用数 988(查询日期 2026-09-09)。
承重关系
- 谱系定位:Diffuser(PPR-2205.09991)所引“轨迹优化器”方法类的 iLQG/DDP 实例,为该卡的术语定义提供锚点。
- provenance:作者站点 PDF(roboti.us/lab/papers/TassaIROS12.pdf),sha256
d7e503d5…f918d9515a,缓存cache/sources/non-arxiv/tassa2012.pdf。
关联(4)
- PPR-003 A direct method for trajectory optimization of rigid bodies through contact
- PPR-2205.09991 Planning with Diffusion for Flexible Behavior Synthesis
- PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- CPT-019 shooting method