PPR-2505.09315
Paper
TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving |
| authors | Xuefeng Jiang, Yuan Ma, Pengxiang Li, Leimeng Xu, Xin Wen, Kun Zhan |
| venue | arXiv:2505.09315 |
| arxiv | 2505.09315 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2505.09315v2 |
| source-hash | sha256:fff73fbf7b73d8a1542e92f877e9126117621c3bf8d10d75e98378c78bd7d695 |
| admitted-under | A2-direct-edge |
| admission-note | 被 DiffusionDriveV2(PPR-2512.07745)直接引用,作为“是否需要锚点先验”这一设计分歧的另一立场(不假设预定义词表/场景先验)。 |
定位
Jiang 等(2025)提出 TransDiffuser。论文的问题是:扩散模型迁移到端到端驾驶的轨迹生成时,不同随机噪声经去噪后常收敛到相似轨迹(模式坍缩);为缓解坍缩,当时多数方法依赖预定义轨迹词表或训练集中的场景先验作为归纳偏置,但这些偏置在真实部署中并不可得,遇到未见场景时受挑战。TransDiffuser 研究在不假设预定义轨迹词表、不依赖预计算场景先验的前提下处理模式坍缩,用解耦的多模表示来保持生成多样性。
与本库的关系
- 准入身份:A2-direct-edge(被 DiffusionDriveV2 直接引用)。
- 谱系定位:与 DiffusionDrive(PPR-2411.15139)的锚定高斯先验构成直接设计分歧:后者把先验模式嵌入生成分布,前者试图不依赖预定义先验。该分歧与 GTRS(PPR-2506.06664)对 SparseDriveV2(PPR-2603.29163)的“动态 vs 静态”之争同属多模生成的设计空间,可作为后续 SYN/CFL 的组织素材。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(7)
- PPR-2411.15139 DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
- PPR-2506.06664 Generalized Trajectory Scoring for End-to-end Multimodal Planning
- PPR-2603.29163 SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
- FRM-2505.09315 TransDiffuser 五层重建(骨架):核心对象是在不用任何轨迹锚点或场景先验的前提下解决扩散式规划的模式坍缩——把场景编码器(冻结的 Transfuser 骨干)与动作/ego 状态嵌入作为多模态条件输入去噪解码器,并在去噪过程中加批级多模态表示去相关正则(惩罚表示相关矩阵的非对角项、逼近对角形);公理层含『既有扩散规划器靠预定义词表或场景先验缓解坍缩,而这些归纳偏置在部署中不可得』与『规划性能取决于多模态表示质量』。
- FRM-2507.00603 World4Drive 五层重建(骨架):核心对象是免感知标注的意图感知物理潜世界模型——意图编码器把轨迹词表端点聚成 3 命令 × 6 意图,物理世界潜编码器用视觉基础模型(Grounded-SAM 伪语义 + 度量深度前向投影)注入空间语义先验,世界模型按各意图预测未来潜状态并由选择器以潜距离选模、ScoreNet 打分;训练全靠与真实未来观测的潜空间自监督对齐,公理层含『既有方法直接取相机特征作潜表示而缺空间语义理解』。
- FRM-2507.04049 DIVER 五层重建(骨架):核心对象是以强化学习引导扩散生成多模轨迹的框架——策略感知扩散生成器(PADG)以地图元素与周围智能体为条件、由单一真值轨迹与轨迹锚引导生成“多个参考真值”以覆盖不同驾驶风格,再把扩散过程当作随机策略用 GRPO 目标的轨迹级多样性/安全奖励去引导,以破解模仿学习固有的模式坍缩;并针对 L2 类开环指标无法刻画多样性提出多样性度量。
- IDX-001 NAVSIM 规划线