Research KB 登录

FRM-2501.15564 Formalization

Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。

id
type formalization
formalizes PPR-2501.15564
updated

0. Overview

Diffusion Planner(PPR-2501.15564,Tsinghua / CASIA / CUHK / SJTU / HAOMO.AI,ICLR 2025)针对的问题是:学习型闭环规划器(behavior cloning 系)对多模态驾驶行为缺乏拟合保证、OOD 场景下依赖规则精修或规则筛选、辅助损失引入多目标冲突且训练后难以按需调整行为。方案由三件事构成:(i) task redefinition——把闭环规划与运动预测统一重定义为“未来轨迹生成”任务,ego 与最近 \(M\) 辆邻车的未来轨迹在同一 DiT 解码器中用同一扩散损失联合生成(Eq. 5/6);(ii) 免规则精修直接输出轨迹,在 nuPlan 学习型基线中达 SOTA(Table 1);(iii) DPS(diffusion posterior sampling)免训练 classifier guidance——用训练好的 \(\mu_\theta\) 近似后验期望、以可微能量函数(collision / drivable area / target speed / comfort)的梯度在推理时对齐驾驶行为(Eq. 8),且只在去噪末段施加(早段 DPS 近似误差导致异常轨迹)。重建范围为正文 §1–6 与附录 C/D/F 的全部主张;版本锚定 arXiv:2501.15564v2。本源同时是 G2DP(PPR-2606.26017FRM-2606.26017)的共享生成管线来源与 AX-6 基线:G2DP 的稀疏引导臂按本方案实现。

1. Definitions

已入库概念的复用:

  • Diffusion Transformer (DiT)CPT-001 / PPR-2212.09748(生成骨干:本论文以 DiT 为解码器生成 ego+邻车联合轨迹 token,而非图像;输入信息融合走 cross-attention(DIS-001,本处为 MHCA 接口)+ adaLN(CPT-007)注入导航与扩散时间步条件)。
  • adaLNCPT-007adaLN-ZeroCPT-002(论文 §4.2 采用的是 vanilla adaLN 形式(CPT-007):导航表征 \(\boldsymbol{Q}_n\) 加到扩散时间步条件 \(\boldsymbol{Q}_t\) 后经 adaptive layer norm block 全局调制所有 token;未使用 zero-initialized 变体,与 CPT-002 的区分见该卡 Disambiguation)。
  • cost volume / grid guidanceCPT-013:本论文不使用稠密 cost volume——其引导能量是实例级稀疏距离函数(逐邻车 signed distance,附录 C Eq. 10),这正是 FRM-2606.26017 AX-6 / CLM-025 中“稀疏引导臂”的实现来源。列出仅为跨源对照,非本源概念。

未入库的论文内概念(CANDIDATE,先引用不新建 CPT;是否达到 CPT 粒度待 Part 9 裁决):

  • task redefinition / future trajectory generation(§4.1):把“规划=ego 单体决策”重定义为“给定条件 \(\boldsymbol{C}\)(当前状态、历史、车道、导航),联合生成 ego 与 \(M\) 辆最近邻车的 \(\tau\) 步未来轨迹”;状态参数化为 \((x, y, \cos\theta, \sin\theta)\),下游只需 LQR。候选 CPT。
  • classifier guidance(§3.2 Eq. 3,Dhariwal 2021):\(\tilde{\boldsymbol{s}}_\theta(\boldsymbol{x}^{(t)}, t) = \boldsymbol{s}_\theta(\boldsymbol{x}^{(t)}, t) -\nabla_{\boldsymbol{x}^{(t)}} \mathcal{E}_\phi(\boldsymbol{x}^{(t)},t)\)——用分类器分数梯度修正原扩散分数。候选 CPT(本库尚无 classifier guidance 卡,与 CPT-003 CFG 的两两区分届时在 CPT 内联 Disambiguation 展开)。
  • diffusion posterior sampling (DPS)(§4.3 Eq. 8,chung2022diffusion):免 classifier 训练的引导——以 \(\mathcal{E}(\mu_\theta(\boldsymbol{x}^{(t)},t,\boldsymbol{C}))\) 近似中间能量,即用模型输出近似后验期望 \(\mathbb{E}_{q_{0t}}[\boldsymbol{x}^{(0)}]\) 后直接过能量函数。候选 CPT。
  • energy-based 解释(§4.3):目标行为 \(p_0(\boldsymbol{x}^{(0)}) \propto q_0(\boldsymbol{x}^{(0)})\, e^{-\mathcal{E}(\boldsymbol{x}^{(0)})}\)——diffusion 与 EBM 的亲近关系使偏好可经能量重加权注入。候选 CPT(与 FRM-2606.26017 AX-1 同一解释框架,跨源共享)。
  • low-temperature sampling(§4.4,ajay2022conditional):推理时降低采样温度增强轨迹确定性;论文实测 w/ refine. 时用更低温度(0.1 vs 0.5)以利精修模块判断。候选 CPT。

论文明确定义但不足 CPT 粒度(FRM 内记录):邻车/车道/静态物的向量表征与 MLP-Mixer 编码(Eq. 7);ego 当前状态与噪声轨迹拼接作为生成起点约束;ego 状态剔除速度/加速度(防 shortcut,消融 Table 7 支撑)。

附录 C 引导能量函数库(P3 回填 2026-09-10,供跨源引用)

四个能量函数都是手工设计(hand-designed)、以实体索引的可微函数(与 G2DP 的学习场式 CPT-013 相对照;本库外部引用方为 EVI-025):

  • 碰撞避免(Eq. 10):对每个邻车 \(M\) 与每个未来时刻 \(\tau\) 计算 ego 与邻车的有向距离 \(\mathbf D_M^\tau\)(包围盒重叠时取最小间隔距离,\(\mathbf D<0\);否则取最近点距离,\(\mathbf D>0\)),能量为两张按有效点对数归一化的求和之和:
\[\mathcal{E}_\mathrm{collision}=\frac{1}{\omega_c}\frac{\sum_{M,\tau}\mathbb 1_{\mathbf D_M^\tau>0}\,\Psi\!\bigl(\omega_c\max(1-\mathbf D_M^\tau/r,0)\bigr)}{\sum_{M,\tau}\mathbb 1_{\mathbf D_M^\tau>0}+\mathrm{eps}} +\frac{1}{\omega_c}\frac{\sum_{M,\tau}\mathbb 1_{\mathbf D_M^\tau<0}\,\Psi\!\bigl(\omega_c\max(1-\mathbf D_M^\tau/r,0)\bigr)}{\sum_{M,\tau}\mathbb 1_{\mathbf D_M^\tau<0}+\mathrm{eps}}\]

其中 \(\Psi(x):=e^x-x\)\(r\) 为碰撞敏感距离(梯度支撑半径:超出 \(r\)\(\max(\cdot,0)\) 截断、梯度消失),\(\mathrm{eps}\) 保数值稳定;正负 \(\mathbf D\) 分开归一化是“梯度幅值一致”经验(下述第 ④ 条)的实现。

  • 目标速度维持(Eq. 11):
\[\mathcal E_\mathrm{target\_speed}= \max(\overline{\dot x^\tau}-v_\mathrm{low},0)^2 + \max(v_\mathrm{high}-\overline{\dot x^\tau},0)^2\]
  • 舒适度(Eq. 12,以纵向 jerk 为例):
\[\mathcal E_\mathrm{comfort}= \mathbb E\bigl[\max\bigl((j_{\max}-|\dddot x^\tau|)\Delta\tau^3,0\bigr)^2\bigr]\]

疑似笔误:此符号顺序使能量在 jerk 低于限值时非零,与紧邻正文“ignoring cases where the comfort requirements are met”相反;应为 \(|\dddot x^\tau|-j_{\max}\)。已登记 Review Log,未擅改原文。)

  • 可行驶区域(Eq. 13):对欧氏有符号距离场代价图 \(\mathbf M\)(并行计算构造)做同类归一化求和:
\[\mathcal E_\mathrm{drivable}=\frac{1}{\omega_d}\frac{\sum_\tau\Psi(\omega_d\mathbf M(x^\tau_\mathrm{ego}))}{\sum_\tau\mathbb 1_{\mathbf M(x^\tau_\mathrm{ego})>0}+\mathrm{eps}}\]

四条设计经验(附录 C 末段,即 AX-3 的操作标准):① 梯度平滑连续;② 梯度稀疏(只在接近潜在碰撞等特定情形产生);③ 高阶状态导数走间接引导(要控速度就引导轨迹长度);④ 梯度幅值在不同条件下大致一致(对贡献点数取平均)。

2. Axioms(作者公理:论文接受而未证明的前提)

  • AX-1(任务重定义公理) 闭环规划与运动预测可联合建模为单一 future trajectory generation 任务:ego 与邻车的未来轨迹由同一扩散损失(Eq. 6)在同一架构内监督,协同行为由联合分布建模自然涌现而无需额外损失函数或专用子模块。这是设计决断——“协同行为无需额外损失”的可观测后果(T2)由消融与定性结果事后支撑,其充分性未被先验证明。
  • AX-2(能量重加权公理) 在学习到的驾驶行为分布 \(q_0\) 之上,偏好行为可形式化为能量重加权目标分布 \(p_0(\boldsymbol{x}^{(0)}) \propto q_0(\boldsymbol{x}^{(0)})\, e^{-\mathcal{E}(\boldsymbol{x}^{(0)})}\),且该重加权经中间能量的梯度修正分数实现(classifier guidance 的 EBM 解释适用于本设定)。近似误差的量化不在论文范围内(末段施加是其回避手段,见 AX-3)。
  • AX-3(可微评估协议公理) 驾驶中的轨迹评估协议(碰撞避免、可行驶区域、目标速度、舒适度)皆可定义为可微能量函数 \(\mathcal{E}(\cdot)\),其梯度经 DPS 注入采样过程;可微性 + 平滑梯度 + 梯度稀疏性(附录 C 的四条设计经验)是能量函数可用的操作标准。这是可行性公理——论文承认其四个示例实现“may not be optimal”。
  • AX-4(评估协议) 闭环质量由 nuPlan 模拟器在 Val14 / Test14 / Test14-hard 三基准 × NR/R 两模式下的平均分(0–100)度量;迁移性以 200h 配送车数据集(改造入 nuPlan 框架、同度量、基线重训)闭环评估;hybrid 类对照经“现成精修模块、零调参挂接”构造(Diffusion Planner w/ refine.)。

3. Theorems(作者可推导命题;薄层是常态)

  • TH-1(分数可恢复性 → 免训练引导) 在 Eq. 6 的 \(\mu_\theta\) 参数化下,分数函数可恢复为 \(\boldsymbol{s}_\theta=(\alpha_t \mu_\theta-\boldsymbol{x}^{(t)})/\sigma_t^2\),结合 Eq. 8 的 DPS 近似,引导注入无需任何额外训练的分类器/网络。→ CLM-035(论证角色:T3 “flexible guidance” 机制的推导核)。

除此之外无实质性可推导命题——本文是实证论文,论证重心在 Evidence 层(元方法 failure mode 1/2:不虚构定理)。

4. Evidence(实证 → CLM/EVI 映射)

  • EV-1 CLM-033 / EVI-032 — Table 1(nuPlan 三基准 × NR/R 主表;“learning-based 类内 SOTA、免精修”;T1 的主结果)
  • EV-2 CLM-033 / EVI-032 — Table 1(w/ refine. 变体超 hybrid/规则类,“超人类 Log-replay 部分 split”;T1 的加固面)
  • EV-3 CLM-038 / EVI-038 — Table 2(200h 配送车数据集迁移;T5)
  • EV-4 CLM-037 / EVI-037 — Table 7(训练设计消融:augmentation / interpolation / z-score / ego 状态 / SDE;T4)
  • EV-5 CLM-034 / EVI-034 — Fig. 5(\(M\) 消融:预测邻车数过多引噪)+ Fig. 4(定性)
  • EV-6 CLM-035 / EVI-036 — Fig. 7(去噪步数 × 低温度网格搜索;推理超参证据面)
  • EV-7 CLM-033 / EVI-033 — Appendix B Table 8(对 diffusion-based planner:Diffusion-es / STR-16M / STR2-CPKS-800M 的分数与推理时间对比;T1 的“专门设计 vs 套壳”对照面)
  • EV-8 CLM-035 / EVI-035 — Fig. 3 / Fig. 4 / Fig. 9 / Appendix A,C 案例(引导类型与可组合性的定性证据:target speed / comfort / collision / drivable 及其联合)

5. Argument(论证结构)

  • AR-1(T1 主链:task redefinition → 联合扩散 → 免精修 SOTA) 中心命题“diffusion 可被 fully harness 于闭环规划、免规则精修”的论证结构是:现有 diffusion-for-planning 工作“only apply diffusion loss to existing frameworks … heavily reliant on post-processing”(§2),故质量瓶颈在结构设计而非 diffusion 本身;本文以专门架构(DiT + 联合生成 + 起点约束 + 导航 adaLN)直接输出高质量轨迹,Table 1 学习型类内免精修 SOTA 为其可观测结果,Appendix B 对“套壳”diffusion 方法的对比(EV-7)补上同谱系对照面。注意该论证的对照类是学习型/diffusion 方法——对规则类仅经 w/ refine. 变体胜出(EV-2),“pioneers/fully harness” 的普适强度须按此口径读。
  • AR-2(T2:联合建模 → 免额外损失的协同) AX-1 的统一损失使 ego 与邻车轨迹在同一分布中相互条件化;支撑面为 Fig. 4 定性结果(预测准确 + ego 平滑让速)与 EV-5 的 \(M\) 消融(邻车数的选择体现联合建模的取舍),而非独立控制变量实验——“without the need for additional loss functions”是从架构推导 + 消融旁证的命题,非严格归因。
  • AR-3(T3:DPS 免训练引导链) AX-2(能量重加权)→ classifier guidance(Eq. 3)→ DPS 免 classifier 训练(Eq. 8,AX-3 限定末段)→ 可微能量函数库(AX-4,附录 C)→ 推理时自由组合(Fig. 3 collision+drivable 组合案例)。链上每环分别由公式推导、案例与 EV-6 的调度扫描支撑;组合性仅案例级证据(无量化消融)。
  • AR-4(DPS 近似误差论证——erratum 修正后) 早期草稿曾以“DPS 梯度近似在 \(t\) 大时失效 → 只在末段施加”论证调度约束(TeX 注释块 L382/L413–415),但该段未进入已发表正文(已对照 arXiv v2 编译 PDF 核实):已发表主张止于 Eq. 8 方法本身与可微能量函数库(AX-3)。因此对 G2DP 末段注入(steps 8–9,FRM-2606.26017 AX-4/EV-5)而言,本源不构成文献级独立印证——印证降级为“单源实验 + 本源作者草稿叙述”的暗示性一致。见 Commentary 本库评论与 Review Log erratum。
  • AR-5(T5:迁移论证) 对照基线(PDM / GameFormer / PLUTO)含 nuPlan-tailored 设计(参考线、crosswalk 等基准适配),在配送车场景掉分;本方案无此类基准特化组件、经同一管线重训后保持最高分(EV-3)——迁移优势的归因依赖“基线掉分源于基准特化”这一作者解释,未经消融隔离。
  • AR-6(T4:训练细节承重链) Table 7 消融隔离数据管线各件:w/o augmentation −12.66、w/o interpolation −5.41、w/o z-score −4.17、w/ ego state(含速度/加速度)−10.54(对 base 89.19)——shortcut 假设(速度/加速度泄漏)由“w/ SDE 部分缓解、直接剔除更优”的梯度支撑,机制解释是作者叙述。

6. Commentary

作者评论

  • 自评措辞的归属:“pioneers the use of diffusion models … without any rule-based refinement”(§1 贡献 i)与“fully harness”(§1/§2/§6 反复出现)是作者在 related-work 条件下的优先权与设计判断,属 Commentary 层而非命题——其可检验内核(免精修下学习型类内 SOTA、对套壳 diffusion 方法的优势)归 Evidence 层;优先权断言本身不可由本文自证。
  • 局限(自述,Appendix F):(i) 依赖向量化地图与邻车检测结果,相较端到端管线有信息损失、需数据处理模块(未来:图像输入的端到端);(ii) 横向灵活性差——大幅换道/避让能力弱于规则法,归因于数据集以直行为主 + 只输出轨迹不输出控制信号导致的规划-控制鸿沟(数据增强仅部分缓解);(iii) 采样效率——扩散多次前向的代价,经 DPM-Solver 缓解(8s 轨迹 0.05s 内完成、20 Hz 单卡),未来用 consistency model / 蒸馏。
  • 能量函数设计自评(Appendix C):四示例“made primarily to validate … may not be optimal”;沉淀四条经验——平滑连续梯度、梯度稀疏性(仅临界不安全区出梯度,性能上限不受规则封顶)、高阶量经位置/航向间接引导、梯度量级一致性(按贡献点数平均)。
  • 开放问题:换道行为习得(RL 奖励或更有效引导机制);encoder 架构与端到端管线(被注释掉的 pretrain 方案暗示 encoder 部分未做专门设计)。

本库评论

  • TeX 源含注释掉的占位摘要:源文件中被注释的 placeholder 段(planning query token / 单向 attention mask / discriminator)非论文正式内容,正式摘要与 §4 方法节一致(cross-attention + adaLN)。引用架构细节一律以 §4 为准;该占位段是作者草稿残留,不作作者主张处理(G1 核查确认,监工修正 agent 初稿的误读)。
  • “免精修”的口径:headline 声称 “without any rule-based refinement”,但最优分数多来自 w/ refine. 变体(Test14-hard NR 上 78.87 反低于 PLUTO 的 80.08,靠 R 模式 82.00 拿高亮)——“免精修 SOTA”严格限于学习型类内逐 split 读数,跨类主张须挂 w/ refine. 前提。
  • 与 G2DP 的引导谱系对照:本方案引导 = 逐邻车 signed distance 的实例级稀疏能量(CPT-013 的对立面),DPS 近似 + 末段施加;G2DP = 稠密 cost volume + Top-K 聚合 + 同样末段注入。末段约束两次独立成立(AR-4)强化 CLM-032 的调度敏感性;引导模态差异则是 CLM-025 的验证轴。
  • 单种子/多种子未见报告;nuPlan 分数对模拟器实现(NR/R 邻车重演语义)敏感,与 FRM-2606.26017 本库评论同款保留。
  • 摘要与贡献列表中 “first / pioneering” 是文献优先权断言,本库不立为命题(A5 scope 纪律)。
  • DPS 近似的 \(\sigma_t\) 条件与末段施加(本库注记,非作者公理):DPS 以点估计 \(\mathcal{E}(\mu_\theta)\) 替代后验期望能量,其梯度近似质量随 \(\sigma_t\) 增大而退化——这是估计量的数学性质(KB 侧注记),且论文 TeX 注释块(草稿残留)显示作者曾据此只注末段。已发表正文无此主张,故本库不据此立 axiom/claim;G2DP 末段注入的跨源印证地位相应降级(见 AR-4)。

7. Traceability

论文坐标 元素
§1 摘要/贡献列表 0/6 T1–T5 论题草稿来源;“pioneers/fully harness” 归属处理
§2 Related work 5 AR-1 的对照面(“only apply diffusion loss …”)
§3.2 Eq. (1)(2) 1 扩散 preliminaries(VP 轨迹空间,非 latent——CPT-006 不适用)
§3.2 Eq. (3) 1/2 classifier guidance 定义 → Definitions(CANDIDATE);AX-2 前件
§4.1 Eq. (5)(6) 2/5 AX-1(task redefinition + 统一损失);AR-2
§4.2 1 DiT/CPT-001、MHCA/DIS-001、adaLN/CPT-007 复用;MLP-Mixer encoder(FRM 内记录)
§4.3 Eq. (8) 2/3/5 AX-2(能量重加权);TH-1;AR-3;AR-4(erratum)
§4.3 能量函数列表 2 AX-4(可微评估协议)
§4.4 1/4 low-temperature sampling、DPM-Solver++(CPT-030,基座 CPT-029)、20 Hz(CANDIDATE 术语)
§5.1 Table 1 4 EV-1、EV-2(T1);基线协议 → AX-5
§5.1 Table 2 4 EV-3(T5);AR-5
§5.1 Fig. 4 / §5.2 Fig. 3,4 4 EV-8(定性);AR-2 旁证
§5.3 Table 7 4 EV-4(T4);AR-6
§5.3 Fig. 5 4 EV-5(\(M\) 消融)
§5.3 Fig. 7 4 EV-6(推理超参网格;AX-3 边界面)
Appendix B Table 8 4 EV-7(diffusion-based 对照;AR-1)
Appendix C Eq. (10)–(13) 2/4 AX-4 的四个实现;能量函数设计经验 → 作者评论
Appendix F 6 三项自述局限;横向灵活性归因

Review Log

  • 2026-09-07 G1 审核签发(监工):骨架与原文论证结构一致——AX-1..AX-5 逐条核对 §4.1/§4.3/附录 C/F 原文;AR-1..AR-6 复现作者论证且归属层处理正确(优先权断言不入命题、免精修口径限定保留、迁移归因 hedge 保留);TH-1 为唯一实质推导,无虚构定理;DPS 末段限制(AX-3/AR-4)与 G2DP AX-4 的独立印证关系成立。修正一处:agent 初稿误把 TeX 注释占位摘要当作正式摘要(已改为占位残留说明)。通过。签发:监工。

  • 2026-09-10 P3 回填(用户指令):正文公式化附录 C 的四个引导能量函数(Eq. 10–13)与四条设计经验,供跨源引用(引用方 EVI-025 用于 G2DP 稀疏对比臂的构造描述)。两处疑似笔误登记为候选 erratum,未擅改原文:① Eq. 12 舒适度的符号顺序与紧邻正文语义相反;② Eq. 11 下方释文把上界 \(v_\mathrm{high}\) 误写为 \(v_\mathrm{low}\)。本 FRM 的 G1 已于 2026-09-07 签发;本次回填仅补充定义层,不改动 AX/AR 结构。

  • 2026-09-07 erratum(监工,投影阶段触发):初版 AX-3(DPS 近似有效性 + 末段施加)依据的正文段实在 arXiv v2 TeX 中位于注释块(L382/L413–415),已对照编译 PDF 核实已发表正文无此主张。处置:AX-3 删除(原 AX-4/5 重编号为 AX-3/4),\(\sigma_t\) 条件降级为本库 Commentary 注记,AR-4 重写,“末段施加=必要条件”投影卡删除(卡面 Notes 与 EVI-036 留 erratum 记载)、EVI-036 改挂 CLM-035。G1 初签依据部分失效,本次修正后维持“通过”——修正记录本条为证。签发:监工。

关联(30)

  • PPR-2205.09991 Planning with Diffusion for Flexible Behavior Synthesis
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
  • PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
  • BMK-003 “nuPlan closed-loop planning benchmark (Val14 / Test14 / Test14-hard)”
  • FRM-2606.26017 G2DP 五层重建:核心对象是 CPT-013 时空代价体(占据概率栅格 × 路线进度图融合)在推理期的可微引导;公理层为能量重加权目标分布、Top-K 车体聚合与末段注入等六个作者前提;论证主干是 Table 4 在同一 DiT 骨干下隔离『稠密网格 vs 稀疏实例』的引导模态消融(稀疏臂按 PPR-2501.15564 附录 C 实现、以 oracle 邻车供给)。
  • CLM-025 同一 diffusion 骨干下,稠密概率性 cost 网格引导促成平滑、预见性的避障;稀疏实例级引导即使供给 oracle 邻车轨迹仍诱发末期突变机动并损害舒适度——避障行为质量由引导信息形态决定。
  • CLM-032 稠密网格引导是纯推理期模块:占据预测器与生成骨干分开训练、仅在推理耦合,不重训不改骨干即可注入解析梯度,且部分替代事后规则精修(作者推断)。
  • CLM-033 闭环 diffusion 规划的质量瓶颈在结构设计(联合生成/起点约束/导航 adaLN 专门架构)而非 diffusion 范式本身:专门设计免精修达学习型类内最好成绩,且大幅优于套壳 diffusion 方法;对规则/混合类整体优势仅经 w/ refine. 变体成立(作者主张)。
  • CLM-034 把规划与预测统一重定义为 future trajectory generation(ego 与 M 辆邻车同一扩散损失联合生成)后,协同行为由联合分布建模自然涌现,无需额外损失函数或专用子模块——从架构推导+定性案例+M 消融旁证,非严格归因(作者推断)。
  • CLM-035 训练后行为对齐可经 DPS 免训练实现:能量重加权目标 p0 ∝ q0·e^{−E} 下,用 μ_θ 近似后验期望直接过可微能量函数取梯度修正分数,免 classifier 训练;多种能量函数(目标速度/舒适/碰撞/可行驶区)推理期自由组合(案例级证据,无量化消融)。
  • CLM-037 数据管线各件是独立承重件:数据增强、未来轨迹插值、z-score 归一化各自剔除均显著降分;ego 当前状态含速度/加速度会诱发 shortcut 而损害规划,直接剔除优于 state-dropout 缓解——shortcut 机制解释是作者叙述,非消融隔离的结论。
  • CLM-038 无基准特化组件的规划器跨驾驶风格迁移保持:配送车(保守风格、非机动车道、密集交互)数据集上重训后取得最高闭环分,而含 nuPlan 特化设计(参考线、crosswalk 适配)的基线(PDM/GameFormer/PLUTO)掉分——迁移优势归因依赖作者解释,未经消融隔离。
  • EVI-025 Table 4:Grid +3.35 score/+3.59 collision/+4.94 TTC;Sparse(Oracle) −1.96 score/−10.13 comfort/+0.64 collision。稀疏臂按 PPR-2501.15564 附录 C 式 10 的实例级有向距离能量实现,与稠密臂在信号形态与信息内容两轴同时不同(评注已补)。
  • EVI-032 Table 1:免精修在学习型类内 6 列中 5 列最高(Test14 NR 除外);w/ refine. 在 Val14/Test14 双模式超规则/混合类并部分超 Log-replay,唯 Test14-hard NR 78.87 低于 PLUTO 80.08。
  • EVI-033 Table 8:套壳 diffusion 方法脱精修即大跌(Diffusion-es w/o LLM ~50 vs w/ LLM 92;STR2 w/o refine. 65.16 且推理 >11s),Diffusion Planner 89.87/75.99/89.19、推理 0.04s。
  • EVI-034 Fig. 4:邻车预测准确 + ego 平滑让速,对比基线轨迹不平滑/候选多数低质量;Fig. 5:联合预测邻车过多引入噪声降分,但多数 M 取值仍优于 PlanTF。
  • EVI-035 引导案例:遮蔽车道限速后仅靠 target-speed 引导即可贴合 10–14 m/s 目标区间且速度过渡平滑;comfort 叠加 collision 可并用;collision-only 驶离路面避让、叠加 drivable 后保路面且保安全。
  • EVI-036 Fig. 7:低温度采样增强轨迹稳定性、步数在 DPM-Solver++(CPT-030)下稳健;w/ refine. 用更低温度(0.1 vs 0.5)以利精修判断——方法使用边界面,非引导窗口消融。
  • EVI-037 Table 7:base 89.19;w/o augmentation 76.53(−12.66)、w/o interpolation 83.78(−5.41)、w/o z-score 85.02(−4.17);ego 状态 w/ ego state 78.65、w/ SDE 82.90、w/o current state 81.11。
  • EVI-038 Table 2:配送车数据集上 Diffusion Planner 92.08 全场最高(PlanTF 90.89、PLUTO 83.49、PDM-Closed 80.95、GameFormer w/o refine. 22.41);nuPlan-tailored 基线掉分、本方案保持。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-002 adaLN-Zero
  • CPT-003 classifier-free guidance
  • CPT-006 Latent Diffusion Model
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-013 spatio-temporal cost volume
  • CPT-029 DPM-Solver
  • CPT-030 DPM-Solver++
  • DIS-001 术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。