CLM-035
Claim
训练后行为对齐可经 DPS 免训练实现:能量重加权目标 p0 ∝ q0·e^{−E} 下,用 μ_θ 近似后验期望直接过可微能量函数取梯度修正分数,免 classifier 训练;多种能量函数(目标速度/舒适/碰撞/可行驶区)推理期自由组合(案例级证据,无量化消融)。
| id | |
|---|---|
| type | claim |
| source | PPR-2501.15564 |
| scope | inference-time classifier guidance on trained Diffusion Planner (Eq. 8, DPS); differentiable energy functions (collision/drivable/target speed/comfort); guidance composability shown by case studies only |
| epistemic | unverified |
| lifecycle | EXTRACTED |
| updated |
Proposition
在学习到的驾驶行为分布之上,偏好行为可形式化为能量重加权目标分布 \(p_0(\boldsymbol{x}^{(0)}) \propto q_0(\boldsymbol{x}^{(0)})\, e^{-\mathcal{E}(\boldsymbol{x}^{(0)})}\),并经 DPS(diffusion posterior sampling)免训练实现:以 \(\mathcal{E}(\mu_\theta(\boldsymbol{x}^{(t)},t,\boldsymbol{C}))\) 近似中间能量(用训练好的模型输出近似后验期望),其梯度直接修正分数,绕过 classifier 训练及其计算开销。驾驶中的轨迹评估协议(碰撞避免、可行驶区域、目标速度、舒适度)可定义为可微能量函数,且多种能量在推理期自由组合(碰撞引导单独使用会驶离路面避让后车,叠加可行驶区引导后保持路面同时保安全)。组合性的可组合性证据为案例级(Fig. 3/4),施加调度的系统消融本文未做(见 EVI-036 Caveats)。
归属:免训练性由公式推导支撑(TH-1 链);能量函数四示例作者自评 “may not be optimal”;组合性仅有案例级证据。
Evidence refs
- EVI-035(Fig. 3/Fig. 4 引导案例:target speed 遮蔽车道限速对照、comfort 与 collision 叠加、collision+drivable 组合)
- EVI-036(Fig. 7 推理超参网格:引导注入的使用边界面)
Notes
- 骨架定位:AX-2(能量重加权)+ AX-4(可微评估协议)的投影;TH-1(分数可恢复性)是其推导核。
- 与 CLM-032(G2DP)正交性:本卡的引导是实例级稀疏能量函数的 DPS;G2DP 是稠密 cost volume(CPT-013)+ Top-K 聚合——同谱系(能量重加权 + 推理期注入)不同实现,验证时逐点核对。
- 论文明示该法需预定义可微能量函数,这是方法限制而非缺陷。
Notes(erratum 联动)
- 2026-09-07:原指针 CLM-036(末段施加=必要条件)因来源状态 erratum 删除——其依据段在已发表正文不存在(TeX 注释块,见 FRM-2501.15564 Review Log)。施加调度的系统证据本文未提供。
关联(14)
- PPR-2105.05233 Diffusion Models Beat GANs on Image Synthesis
- PPR-2209.14687 Diffusion Posterior Sampling for General Noisy Inverse Problems
- PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- CLM-032 稠密网格引导是纯推理期模块:占据预测器与生成骨干分开训练、仅在推理耦合,不重训不改骨干即可注入解析梯度,且部分替代事后规则精修(作者推断)。
- EVI-025 Table 4:Grid +3.35 score/+3.59 collision/+4.94 TTC;Sparse(Oracle) −1.96 score/−10.13 comfort/+0.64 collision。稀疏臂按 PPR-2501.15564 附录 C 式 10 的实例级有向距离能量实现,与稠密臂在信号形态与信息内容两轴同时不同(评注已补)。
- EVI-035 引导案例:遮蔽车道限速后仅靠 target-speed 引导即可贴合 10–14 m/s 目标区间且速度过渡平滑;comfort 叠加 collision 可并用;collision-only 驶离路面避让、叠加 drivable 后保路面且保安全。
- EVI-036 Fig. 7:低温度采样增强轨迹稳定性、步数在 DPM-Solver++(CPT-030)下稳健;w/ refine. 用更低温度(0.1 vs 0.5)以利精修判断——方法使用边界面,非引导窗口消融。
- CPT-013 spatio-temporal cost volume
- SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。
- CLM-033 co-source 闭环 diffusion 规划的质量瓶颈在结构设计(联合生成/起点约束/导航 adaLN 专门架构)而非 diffusion 范式本身:专门设计免精修达学习型类内最好成绩,且大幅优于套壳 diffusion 方法;对规则/混合类整体优势仅经 w/ refine. 变体成立(作者主张)。
- CLM-034 co-source 把规划与预测统一重定义为 future trajectory generation(ego 与 M 辆邻车同一扩散损失联合生成)后,协同行为由联合分布建模自然涌现,无需额外损失函数或专用子模块——从架构推导+定性案例+M 消融旁证,非严格归因(作者推断)。
- CLM-037 co-source 数据管线各件是独立承重件:数据增强、未来轨迹插值、z-score 归一化各自剔除均显著降分;ego 当前状态含速度/加速度会诱发 shortcut 而损害规划,直接剔除优于 state-dropout 缓解——shortcut 机制解释是作者叙述,非消融隔离的结论。
- CLM-038 co-source 无基准特化组件的规划器跨驾驶风格迁移保持:配送车(保守风格、非机动车道、密集交互)数据集上重训后取得最高闭环分,而含 nuPlan 特化设计(参考线、crosswalk 适配)的基线(PDM/GameFormer/PLUTO)掉分——迁移优势归因依赖作者解释,未经消融隔离。