PPR-2311.16038
Paper
OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
| id | |
|---|---|
| updated | |
| type | paper |
| title | OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving |
| authors | Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Borui Zhang, Yueqi Duan, Jiwen Lu |
| venue | ECCV 2024 (arXiv:2311.16038) |
| arxiv | 2311.16038 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-10 |
| version | arXiv:2311.16038v1 |
| source-hash | sha256:e007151603351b6664b8d9387cc4674c67d79dd13d3da2d68f419fc95dc6b4d9 |
| admitted-under | A2-direct-edge |
| admission-note | 被 Latent-WAM、DA-WAM 谱系直接引用为占用空间世界模型代表。 |
定位
Zheng 等(ECCV 2024)提出 OccWorld。论文的出发点是:理解 3D 场景如何演化对自动驾驶决策至关重要,而既有方法多通过预测物体框的运动来达到,无法捕捉更细粒度场景信息。OccWorld 在 3D 占用空间学世界模型,同时预测 ego 运动与周边场景演化。选占用的三条理由:表达力(占用能描述更细的 3D 结构)、效率(可从稀疏 LiDAR 点等更经济地获得)、通用性(可适配视觉与 LiDAR)。为便于建模世界演化,先在 3D 占用上训练基于重建的场景 tokenizer 得离散场景 token,再用类 GPT 的时空生成 transformer 生成后续场景与 ego token。
与本库的关系
- 准入身份:A2-direct-edge(被 Latent-WAM、DA-WAM 谱系引用)。
- 谱系定位:世界模型表示空间的一支(占用 vs 视频 vs 隐潜)。Latent-WAM(PPR-2603.24581)与 DA-WAM(PPR-2608.19085)选择紧凑潜表示而非占用/视频,本卡是其表示选择讨论的对照坐标之一。
Provenance
- Tier-0 轻量 ingest(S2 元数据):
version/source-hash占位(待补)。
关联(8)
- PPR-2309.17080 GAIA-1: A Generative World Model for Autonomous Driving
- PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
- PPR-2603.24581 Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
- PPR-2608.19085 DA-WAM: Decision-Aligned Future Latents for Driving World Models
- FRM-2311.16038 OccWorld 五层重建(骨架):核心对象是在 3D 占据空间里做世界建模——以 VQ-VAE 式自监督场景 tokenizer 把 3D 占据压成离散高层 token(BEV 化 + 类别嵌入 + 码本),再以 GPT 式但“一次预测一组 token”的空间-时序生成 transformer(空间自注意力 + 2×2 窗口层次化下采样 K 次 + 各尺度子世界模型)同时生成未来占据与 ego 轨迹;公理层含『物体框预测无法捕捉更细粒度场景信息』与『占据只给低层级理解、需自监督 token 化』。
- FRM-2405.04390 DriveWorld 五层重建(骨架):核心对象是面向 4D 场景理解的驾驶世界模型预训练——记忆状态空间模型把沿时间传达的信息拆成时序感知的潜动态(动态记忆库:后验/先验状态分布匹配 + 运动感知层归一化)与空间感知的潜静态(静态场景传播:取某帧 BEV 特征作潜结构、不做形变对齐),以 3D/4D 占据预测为 pretext,并用 LLM 文本产生的任务提示解耦各下游任务的表示;公理层含『既有视觉预训练多为 2D/3D pretext 忽略时序』与『占据比深度/2D 重建给出更完备几何先验』。
- FRM-2504.01941 WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。
- IDX-001 NAVSIM 规划线