Research KB 登录

CPT-021 Concept

trajectory optimization

id
updated
type concept
name trajectory optimization
aliases 轨迹优化, 轨迹优化问题, trajectory optimization problem
defined-by PPR-004

Definition

轨迹优化(trajectory optimization)指求解如下泛函优化问题的一类方法:选择控制量作为时间的函数 \(u(t)\)(以及相应的状态轨迹 \(x(t)\)),使系统在满足约束的前提下沿轨迹达到最优。与参数优化最小化 \(J(x)\)(有限维实向量)不同,轨迹优化最小化的是 \(J[f(t)]\)——函数空间远大于实数空间(PPR-004 §9.1)。系统的状态(state)控制(control) 均为时间函数;轨迹(trajectory)即二者随时间的取值(PPR-004 §1)。

一般形式(Bolza 形式,PPR-004 式 1.1):目标由边界项(Mayer 项)路径积分项(Lagrange 项) 组成,

\[\min_{t_0,t_F,x(t),u(t)} J\bigl(t_0,t_F,x(t_0),x(t_F)\bigr) + \int_{t_0}^{t_F} w\bigl(\tau,x(\tau),u(\tau)\bigr)\,d\tau\]

其中 \(w\) 是目标函数的被积函数(integrand)。只有积分项称 Lagrange 形式,只有边界项称 Mayer 形式;PPR-004 的全部算例均为 Lagrange 形式。

决策变量(decision variable) 是求解器实际调整的量:初末时间 \(t_0,t_F\) 与状态、控制轨迹 \(x(t),u(t)\)PPR-004 §1.4)。约束分类(PPR-004 式 1.2–1.9):动力学 \(ẋ(t)=f(t,x(t),u(t))\);路径约束 \(h(t,x(t),u(t))≤0\);边界约束 \(g(t_0,t_F,x(t_0),x(t_F))≤0\);状态/控制的路径界;初末时间与初末状态的界。满足全部约束的解称可行(feasible),对应控制称容许(admissible);在可行解中最小化目标的解称最优(optimal)PPR-004 §1.3)。

求解方法按“离散化在优化之前还是之后”分两支(PPR-004 §1.5、§9.4):直接法先离散化原问题、通常转录(transcription)为非线性规划(CPT-022),再优化;间接法先解析构造最优性的必要/充分条件,再离散化并数值求解。PPR-004 聚焦直接法中的配点法(CPT-020)与打靶法(CPT-019),且限定单相、连续时间问题(§1.4)。

轨迹优化的解是开环解:一串作为时间函数的控制 \(u^*(t)\),把系统从单一初始状态驱动到终态;实际部署需配稳定控制器(CPT-026)。

Disambiguation

  • 与参数优化(parameter optimization)的实质区分:参数优化最小化 \(J(x)\)(实数向量),轨迹优化最小化泛函 \(J[f(t)]\);前者搜索有限维空间,后者搜索函数空间,故后者更难(PPR-004 §9.1)。
  • 与动态规划(dynamic programming)的实质区分:动态规划求最优策略(optimal policy)\(u(x)\)——对状态空间每个点给出最优控制,即闭环解;轨迹优化求单条轨迹的开环解。前者(基本形式)保证全局最优但随维数指数增长(维数灾难),后者可处理高维但只保证局部最优(CPT-026PPR-004 §9.2)。
  • 与“运动规划(motion planning)”区分PPR-004 未使用该术语,本卡不做该对比(避免无锚点外推)。
  • 直接法与间接法是本概念内部的方法分类(离散化时机),不是两个独立概念;其“配点 vs 打靶”的实现差异见 CPT-020 / CPT-019

关联(24)

  • PPR-004 An Introduction to Trajectory Optimization: How to Do Your Own Direct Collocation
  • PPR-2605.31476 IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving
  • FRM-004 Kelly(2017)直接配点轨迹优化教程的五层重建:以“连续问题→多项式样条近似→非线性规划”为主线,规范术语与约束分类(D),列出作者接受的前提(AX),重建从配点构造、插值、误差估计到网格细化与不连续性处理的论证链(AR),并分节记录作者评论与本库评论;Theorems/Evidence 层待 P3 投影回填。
  • FRM-2212.10156 UniAD 五层重建(骨架):核心对象是规划导向的模块化流水线——TrackFormer(检测 + 多目标跟踪,含显式 ego 查询)、MapFormer(地图全景分割)、MotionFormer(场景中心的多模联合预测,含 agent/场景锚与目标点交互)、OccFormer(保留实例身份的占用预测)四模块以统一 query 串联,Planner 以命令嵌入条件化 ego 查询输出轨迹,并在推理期用牛顿法按占用图避碰优化;公理层含『框架应面向规划这一终极目标设计』与『端到端下不可假设真值感知』。
  • FRM-2406.06978 Hydra-MDP 五层重建(骨架):核心对象是三范式对比下的多教师蒸馏——把『多模规划 + 单目标学习 + 不可微后处理』改为『多模规划 + 多目标学习』,在 VADv2 式固定词表上以模仿损失对齐人类、以离线仿真分数经 BCE 蒸馏规则教师,推理期按网格搜索权重组装子分数选轨迹;公理层含『仅模仿不足以关联环境』『不可微后处理基于不完美感知』『固定词表使离线批量仿真可行』。
  • FRM-2503.05689 GoalFlow 五层重建(骨架):核心对象是目标点引导的 rectified-flow 多模轨迹生成——从训练轨迹端点聚类出 4096/8192 目标点词表,用距离分与可行驶区分双分数选点,再以该点为条件经单步 rectified flow 生成轨迹,并用 shadow trajectory 检测不可靠目标点;公理层含『无约束生成易发散』『目标点构成强约束』与『扩散长路径不适合实时』。
  • FRM-2605.31476 IDOL 五层重建(骨架):核心对象是以逆动力学为桥梁的潜 BEV 世界模型规划——先用候选条件的潜 BEV 世界模型滚出多条候选未来潜状态序列,再用逆动力学模型对相邻潜状态解码出“空间动力学图(变化发生在哪)”与“全局动力学特征(整体变什么)”,以双分支融合(空间交叉注意力 + MLN 校准)把想象出的转移转成规划相关的查询更新,并用重锚定防迭代漂移;公理层含『仅预测未来不足以保证更好规划,除非预测演化能转成可执行运动更新』与『纯池化逆动力学特征对规划过粗』。
  • CPT-019 shooting method
  • CPT-020 collocation method
  • CPT-022 non-linear program
  • CPT-023 mesh refinement
  • CPT-024 bang-bang control
  • CPT-026 open-loop vs closed-loop solution
  • DIS-003 术语“闭环”在本库的两个 referent 路由:控制论意义的闭环解/最优策略(CPT-026)与自动驾驶基准的闭环评估口径(BMK-003、BMK-006)。
  • EX-001 直接配点法算例(最小功双积分器):梯形配点 + 松弛变量把问题变成线性规划,N=10→160 网格下目标值 0.7958→0.76405 逼近解析 bang-off-bang 解的 0.763932,状态误差约按 O(h²) 下降,切换时刻收敛到 τ≈0.381966。
  • CPT-019 co-definer shooting method
  • CPT-020 co-definer collocation method
  • CPT-022 co-definer non-linear program
  • CPT-023 co-definer mesh refinement
  • CPT-024 co-definer bang-bang control
  • CPT-025 co-definer consistent function
  • CPT-026 co-definer open-loop vs closed-loop solution
  • CPT-027 co-definer slack variable
  • CPT-028 co-definer Runge-Kutta method