PPR-2103.00020
Paper
Learning Transferable Visual Models From Natural Language Supervision
| id | |
|---|---|
| updated | |
| type | paper |
| title | Learning Transferable Visual Models From Natural Language Supervision |
| alias | CLIP |
| authors | Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever |
| venue | ICML 2021 (arXiv:2103.00020) |
| arxiv | 2103.00020 |
| tier | 1 |
| lifecycle | EXTRACTED |
| epistemic | n/a |
| ingested | 2026-09-08 |
| version | arXiv:2103.00020v1 |
| source-hash | 3654458fb40bfa2b027a3f8d2118e1ae47eb29926d3974ea38128cdaa2013b93 |
| admitted-under | U0-user-directive |
| admission-note | 用户指令性准入(2026-09-08,Tier-1 全管线至 P2):CLIP 共嵌入空间是 OpenScene(PPR-2211.15654)AX-1 的上游假设与本库多个零样本/开放词表对象的词汇源头,按方法做五层重建。 |
定位
提出 CLIP 的原始论文(ICML 2021,OpenAI)。核心主张:自然语言监督可以替代封闭标注集训练视觉表征——在自建 400M(image, text)对数据集 WIT 上,用对称对比目标(batch 内 N×N 配对判别,InfoNCE 系)联合训练图像编码器(ResNet 系/ViT)与文本编码器(Transformer),学到与文本共嵌的多模态空间;零样本分类 = 以类名文本经文本编码器生成线性分类器权重超网络(hypernetwork)解释,图像侧 argmax 余弦相似度。附带贡献:提示工程(prompt engineering)/ensembling(模板 + 多上下文 prompt 嵌入平均,≈+5%)、自然分布偏移下 零样本(zero-shot) 的 effective robustness 优势、数据重叠分析、局限自陈(细粒度/计数/真 OOD 弱、验证集反复查询非真零样本、社会偏见)。
本库准入身份:用户指令性 Tier-1 重建。接入点:CLIP 共嵌入空间是 OpenScene(PPR-2211.15654)AX-1 的上游假设——OpenScene 的全部管线建立在“2D 分割模型嵌入与 CLIP 文本嵌入共空间”之上,CLIP 卡是该假设的形式化源头;本库零样本类 claim 的 scope 词汇(零样本、开放词表)也以此文为锚。
与本库的关系
- 下游消费者:PPR-2211.15654(OpenScene)蒸馏目标空间即本文训练的对比空间;其 AX-1 引用本文 §2.3 的共嵌入性质。BMK-006/NAVSIM 谱系经 OpenScene 间接相连,无直接引用边。
- 方法谱系:对比目标承继 InfoNCE(Oord 2018)与 N-pair loss(Sohn 2016),零样本分类形式承继 Lei 2015 / Elhoseiny 2013;生成式 caption 基线(VirTex 系)被本文以 4×/12× 效率数据否定(§2.2,Figure 3),该效率论证是方法选择的关键 EVI 候选。
关联(3)
- PPR-2211.15654 OpenScene: 3D Scene Understanding with Open Vocabularies
- BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
- FRM-2103.00020 CLIP 五层重建:对称 InfoNCE 双塔对比预训练(WIT 400M)+ 零样本分类的 hypernetwork 归约 + prompt/ensemble 修饰层;断言投影待 G1 签发后进行。