Research KB 登录

PPR-2211.15654 Paper

OpenScene: 3D Scene Understanding with Open Vocabularies

id
updated
type paper
title OpenScene: 3D Scene Understanding with Open Vocabularies
authors Songyou Peng, Kyle Genova, Chiyu \"Max\" Jiang, Andrea Tagliasacchi, Marc Pollefeys, Thomas Funkhouser
venue CVPR 2023 (arXiv:2211.15654)
arxiv 2211.15654
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-07
version arXiv:2211.15654v2
source-hash d226079b77154809b2037489cf91be557a34162fc1318441ab6ee6ace19cee96
admitted-under U0-user-directive
admission-note 用户指令性准入(2026-09-07,Tier-1 全管线):OpenScene 数据集(DAT-001)的配套论文;入库目的=论文方法的形式化重建(2D-3D 特征蒸馏与 ensemble 机制),数据 provenance 权威在 DAT-001,不在本卡。

定位

提出 OpenScene 方法的原始论文(CVPR 2023)。任务:给定 3D 网格/点云与带位姿 RGB 图像,对每个 3D 点回答任意文本查询(语义、材质、可供性、房间类型、功能、物理属性)。核心机制:不训 3D 标注,而是把 3D 点特征蒸馏进 CLIP 文本-图像共嵌入空间——2D 端用冻结的开放词表分割模型(OpenSeg/LSeg)逐像素提特征,经 2D-3D 投影配对与多视图平均池化得 f2D;3D 端以余弦一致性损失把 f2D 蒸馏进 MinkowskiNet(f3D,纯点云输入);推理时以 prompt 相似度 max 在 f2D/f3D 间逐点 集成(ensemble)。

本库准入身份:OpenScene 数据集(DAT-001,OpenDriveLab repo)的配套论文——数据 provenance 权威在 DAT-001(repo 锚定),论文与数据血缘正交(DAT-001 配套论文节);本卡承载论文方法的形式化重建(FRM-2211.15654,Tier-1)。

与本库的关系

  • 数据集侧翼:OpenScene 数据集工件以 DAT-001 立(repo 为 provenance 权威),它是对 nuPlan v1.1 原生分发(DAT-002)的紧凑再分发,血缘双方均经 nuPlan 论文(PPR-2106.11810)的 data-from 边表达;NAVSIM(BMK-006)消费 DAT-001。本论文是该项目的配套论文,与数据工件是同一项目的两个发布面。
  • 方法谱系:2D 开放词表分割上游为 OpenSeg(Ghiasi 2022)/LSeg(Li 2022),蒸馏目标空间为 CLIP(Radford 2021);3D 蒸馏范式与 Rozenberszki 2022(OpenScene 引为其 3D 预训练近亲,后者仍需 3D 标注 finetune)的区分是论文优先权主张的一部分。

关联(7)

  • PPR-2103.00020 Learning Transferable Visual Models From Natural Language Supervision
  • PPR-2106.11810 nuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • DAT-001 OpenScene — nuPlan 传感器数据的紧凑再分发(OpenDriveLab)
  • DAT-002 nuPlan v1.1 原生数据分发(nuscenes.org,20Hz .db)
  • FRM-2103.00020 CLIP 五层重建:对称 InfoNCE 双塔对比预训练(WIT 400M)+ 零样本分类的 hypernetwork 归约 + prompt/ensemble 修饰层;断言投影待 G1 签发后进行。
  • FRM-2211.15654 OpenScene 五层重建:CLIP 共嵌入不变量下的三级特征构造(多视图融合 f2D → 余弦蒸馏 f3D → prompt-相似度 ensemble f2D3D)与零样本推理;断言投影待 G1 签发后进行。