PPR-2211.15654
Paper
OpenScene: 3D Scene Understanding with Open Vocabularies
| id | |
|---|---|
| updated | |
| type | paper |
| title | OpenScene: 3D Scene Understanding with Open Vocabularies |
| authors | Songyou Peng, Kyle Genova, Chiyu \"Max\" Jiang, Andrea Tagliasacchi, Marc Pollefeys, Thomas Funkhouser |
| venue | CVPR 2023 (arXiv:2211.15654) |
| arxiv | 2211.15654 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-07 |
| version | arXiv:2211.15654v2 |
| source-hash | d226079b77154809b2037489cf91be557a34162fc1318441ab6ee6ace19cee96 |
| admitted-under | U0-user-directive |
| admission-note | 用户指令性准入(2026-09-07,Tier-1 全管线):OpenScene 数据集(DAT-001)的配套论文;入库目的=论文方法的形式化重建(2D-3D 特征蒸馏与 ensemble 机制),数据 provenance 权威在 DAT-001,不在本卡。 |
定位
提出 OpenScene 方法的原始论文(CVPR 2023)。任务:给定 3D 网格/点云与带位姿 RGB 图像,对每个 3D 点回答任意文本查询(语义、材质、可供性、房间类型、功能、物理属性)。核心机制:不训 3D 标注,而是把 3D 点特征蒸馏进 CLIP 文本-图像共嵌入空间——2D 端用冻结的开放词表分割模型(OpenSeg/LSeg)逐像素提特征,经 2D-3D 投影配对与多视图平均池化得 f2D;3D 端以余弦一致性损失把 f2D 蒸馏进 MinkowskiNet(f3D,纯点云输入);推理时以 prompt 相似度 max 在 f2D/f3D 间逐点 集成(ensemble)。
本库准入身份:OpenScene 数据集(DAT-001,OpenDriveLab repo)的配套论文——数据 provenance 权威在 DAT-001(repo 锚定),论文与数据血缘正交(DAT-001 配套论文节);本卡承载论文方法的形式化重建(FRM-2211.15654,Tier-1)。
与本库的关系
- 数据集侧翼:OpenScene 数据集工件以 DAT-001 立(repo 为
provenance 权威),它是对 nuPlan v1.1 原生分发(DAT-002)的紧凑再分发,血缘双方均经 nuPlan 论文(PPR-2106.11810)的
data-from边表达;NAVSIM(BMK-006)消费 DAT-001。本论文是该项目的配套论文,与数据工件是同一项目的两个发布面。 - 方法谱系:2D 开放词表分割上游为 OpenSeg(Ghiasi 2022)/LSeg(Li 2022),蒸馏目标空间为 CLIP(Radford 2021);3D 蒸馏范式与 Rozenberszki 2022(OpenScene 引为其 3D 预训练近亲,后者仍需 3D 标注 finetune)的区分是论文优先权主张的一部分。
关联(7)
- PPR-2103.00020 Learning Transferable Visual Models From Natural Language Supervision
- PPR-2106.11810 nuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- DAT-001 OpenScene — nuPlan 传感器数据的紧凑再分发(OpenDriveLab)
- DAT-002 nuPlan v1.1 原生数据分发(nuscenes.org,20Hz .db)
- FRM-2103.00020 CLIP 五层重建:对称 InfoNCE 双塔对比预训练(WIT 400M)+ 零样本分类的 hypernetwork 归约 + prompt/ensemble 修饰层;断言投影待 G1 签发后进行。
- FRM-2211.15654 OpenScene 五层重建:CLIP 共嵌入不变量下的三级特征构造(多视图融合 f2D → 余弦蒸馏 f3D → prompt-相似度 ensemble f2D3D)与零样本推理;断言投影待 G1 签发后进行。