Research KB 登录

PPR-2103.00020 Paper

Learning Transferable Visual Models From Natural Language Supervision

id
updated
type paper
title Learning Transferable Visual Models From Natural Language Supervision
alias CLIP
authors Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever
venue ICML 2021 (arXiv:2103.00020)
arxiv 2103.00020
tier 1
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-08
version arXiv:2103.00020v1
source-hash 3654458fb40bfa2b027a3f8d2118e1ae47eb29926d3974ea38128cdaa2013b93
admitted-under U0-user-directive
admission-note 用户指令性准入(2026-09-08,Tier-1 全管线至 P2):CLIP 共嵌入空间是 OpenScene(PPR-2211.15654)AX-1 的上游假设与本库多个零样本/开放词表对象的词汇源头,按方法做五层重建。

定位

提出 CLIP 的原始论文(ICML 2021,OpenAI)。核心主张:自然语言监督可以替代封闭标注集训练视觉表征——在自建 400M(image, text)对数据集 WIT 上,用对称对比目标(batch 内 N×N 配对判别,InfoNCE 系)联合训练图像编码器(ResNet 系/ViT)与文本编码器(Transformer),学到与文本共嵌的多模态空间;零样本分类 = 以类名文本经文本编码器生成线性分类器权重超网络(hypernetwork)解释,图像侧 argmax 余弦相似度。附带贡献:提示工程(prompt engineering)/ensembling(模板 + 多上下文 prompt 嵌入平均,≈+5%)、自然分布偏移下 零样本(zero-shot) 的 effective robustness 优势、数据重叠分析、局限自陈(细粒度/计数/真 OOD 弱、验证集反复查询非真零样本、社会偏见)。

本库准入身份:用户指令性 Tier-1 重建。接入点:CLIP 共嵌入空间是 OpenScene(PPR-2211.15654)AX-1 的上游假设——OpenScene 的全部管线建立在“2D 分割模型嵌入与 CLIP 文本嵌入共空间”之上,CLIP 卡是该假设的形式化源头;本库零样本类 claim 的 scope 词汇(零样本、开放词表)也以此文为锚。

与本库的关系

  • 下游消费者:PPR-2211.15654(OpenScene)蒸馏目标空间即本文训练的对比空间;其 AX-1 引用本文 §2.3 的共嵌入性质。BMK-006/NAVSIM 谱系经 OpenScene 间接相连,无直接引用边。
  • 方法谱系:对比目标承继 InfoNCE(Oord 2018)与 N-pair loss(Sohn 2016),零样本分类形式承继 Lei 2015 / Elhoseiny 2013;生成式 caption 基线(VirTex 系)被本文以 4×/12× 效率数据否定(§2.2,Figure 3),该效率论证是方法选择的关键 EVI 候选。

关联(3)

  • PPR-2211.15654 OpenScene: 3D Scene Understanding with Open Vocabularies
  • BMK-006 NAVSIM non-reactive planning benchmark (v1 PDMS / v2 EPDMS two-stage)
  • FRM-2103.00020 CLIP 五层重建:对称 InfoNCE 双塔对比预训练(WIT 400M)+ 零样本分类的 hypernetwork 归约 + prompt/ensemble 修饰层;断言投影待 G1 签发后进行。