FRM-2103.00020
Formalization
CLIP 五层重建:对称 InfoNCE 双塔对比预训练(WIT 400M)+ 零样本分类的 hypernetwork 归约 + prompt/ensemble 修饰层;断言投影待 G1 签发后进行。
| id | |
|---|---|
| type | formalization |
| formalizes | PPR-2103.00020 |
| updated |
0. Overview
CLIP(PPR-2103.00020,Radford et al.,OpenAI,ICML 2021)针对的问题是:NLP 领域的任务无关预训练(GPT 系)在 零样本(zero-shot) 迁移上已展示容量优势,而视觉主流仍是封闭标注集 × 单任务监督,迁移靠线性探头微调;现有图文对数据集(MS-COCO/Visual Genome ~10⁵、YFCC100M 过滤后 15M)不足以支撑语言监督的规模假设。方案:(i) 数据——自建 WIT(WebImageText),500,000 查询词表(Wikipedia 高频词 + 高 PMI bigram + 高检索量文章名 + WordNet synsets)构造,每查询上限 20,000 对、近似类平衡,共 400M (image, text) 对(§2.2);(ii) 目标——从“逐词预测 caption”(生成式,VirTex/Bag-of-Words 基线)换为“判别 batch 内配对”(对比式):给定 batch 内 N 对,预测 N×N 可能配对中真实发生的 N 个,最大化真对余弦相似度、最小化 N²−N 假对相似度,对称交叉熵(InfoNCE/N-pair 系,§2.3)——换目标的动机是效率:对比目标在零样本 ImageNet 迁移速率上比逐词预测再快 4×,比生成式累计快 12×(Figure 3);(iii) 架构——图像塔 ResNet-D + blur pool + attention pooling 或 ViT,文本塔 63M 12 层 Transformer(BPE 49k 词表,[EOS] 位表征),双塔各经线性投影入共嵌空间(去掉非线性投影头,未观察到效率差异),温度 τ 为可训练 log 参数(§2.4);(iv) 零样本用法——类名经文本编码器 + prompt 工程生成分类器权重,图像特征 softmax argmax(§3.1.1)。重建范围为正文 §1–6(§2 方法与 §3 实验、§5 数据重叠、§6 Limitations 为承重核心);版本锚定 arXiv:2103.00020v1(首版即终版,无修订)。本源与本库的接入点:OpenScene(PPR-2211.15654)AX-1 的上游——其蒸馏目标空间由本文的对比训练程序制造。
1. Definitions
已入库概念的复用:
- 零样本:OpenScene 候选 CPT(FRM-2211.15654 §1)——本文是该词在本库语义的更强源头(“目标任务零标注迁移”),两源的定义一致(不使用目标数据集任何标注训练),若建 CPT 以本文为 defined-by 首选、OpenScene 为复用方。裁决留 Part 9。
未入库的论文内概念(CANDIDATE,先引用不新建 CPT;是否达到 CPT 粒度待 Part 9 裁决):
- CLIP 对比目标(对称 InfoNCE)(§2.3,Figure 4 伪码):batch 内 N 真对 vs N²−N 假对的对称交叉熵;线性投影头、无非线性 projection head、无文本变换、增强仅随机方裁剪、τ 可训练。候选 CPT(承重——OpenScene AX-1 与一切下游共嵌性 claim 的机制锚)。
- 零样本分类 = 超网络(hypernetwork)(§3.1.1):文本编码器按自然语言类描述生成线性分类器权重(L2 归一输入/权重、无偏置、温度 softmax);预训练每步可视作优化一个“32,768 类、每类 1 例”的代理分类任务。候选 CPT(承重——OpenScene 的 prompt 查询是此归约的直接复用)。
- 提示工程(prompt engineering)与集成(ensembling)(§3.1.1):模板填充消除 polysemy 与分布差(“A photo of a {label}.”,ImageNet +1.3%);多上下文 prompt 的嵌入空间平均(非概率空间,可缓存,ImageNet 80 prompts 再 +3.5%)。候选 CPT 或并入上一条(粒度裁决 Part 9)。
- effective robustness(§3.3,Taori 2020 定义):分布偏移精度超出“由 in-distribution 精度线性预测的份额”的部分;本文实证 零样本 CLIP 大幅提升(gap 缩至多 75%),而 ImageNet 微调 +9.2% 精度几乎不增偏移精度。候选 CPT(跨源复用价值:分布偏移类 claim 的度量词汇)。
- WIT(WebImageText)(§2.2):400M 对自建数据集,未开源。倾向 FRM 内记录不建 CPT(数据工件事实,非机制概念)。
论文明确定义但不足 CPT 粒度(FRM 内记录):图像塔两族架构及其等比缩放规则(宽/深/分辨率均摊,文本塔只放大宽度);批构造即任务(每 batch = 32,768 类 1-shot 代理任务的世界观);数据重叠分析(§5,10% 重叠、去重后零样本与 4-shot 差距保持)。
2. Axioms(作者公理:论文接受而未证明的前提)
- AX-1(规模-容量公理) 自然语言监督的潜力与监督数据规模一同增长,且互联网规模的图文对是可获取的监督来源——现有小数据集上的负结果(§1 VirTex/ConVIRT 线)只证明规模不足,不证明方向不可行。这是论文的动机公理:WIT 400M 的构造与“create a sufficient dataset” 整节都以其为前提;“多少才算 sufficient”未先验回答(实验后估 1000× 算力才达 SOTA,§6)。
- AX-2(判别目标公理) “预测哪段文本与哪张图配对”(判别)是比“预测文本的词”(生成)更易的代理任务,且在零样本迁移效率上严格更优——继承 Tian 2019(对比优于预测)与 Chen 2020(生成需一个数量级以上更多算力)的结论并外推到图文对设定。这是方法选择公理:Figure 3 的 4×/12× 是事后支撑,“判别偏置对迁移更优”的一般性未证明。
- AX-3(共嵌公理) 对比训练使图像嵌入与文本嵌入落入同一度量空间,其中余弦相似度是语义相似度的有效度量;类名文本的嵌入可充当分类器权重(超网络 解释)。这是全部零样本用法的可行性公理——OpenScene AX-1 直接继承本公理(其“2D 分割嵌入与 CLIP 文本共空间”= 本公理 + 上游模型以 CLIP 空间为训练目标)。注意:本公理的适用范围以“概念可由文本指定”为边界(§6 自陈计数/距离类任务近随机)。
- AX-4(评估协议) 零样本迁移以 27+ 数据集套件度量(ImageNet 及分布变体、细粒度、OCR、动作识别等);prompt/集成 消融在 36 数据集平均;鲁棒性按 effective/relative robustness(Taori 2020)分轴;表征质量以线性探头与 kNN 度量;人类对照用 5 名志愿者写 零样本 prompt(§4)。已知偏差自陈:验证集反复查询(非真零样本)、27 数据集与 CLIP 能力共适应(§6)。
- AX-5(数据独立性公理) 预训练数据与评测基准的分布重叠不足以解释零样本性能(§5:重叠分析 + 去重后与 4-shot 的差距保持)。这是结论稳健性公理——但仅对“精确/近重复”可操作化定义的重叠成立,语义级重叠不可测。
3. Theorems(作者可推导命题;薄层是常态)
- TH-1(零样本 = 最近邻分类的归约) 在 AX-3 下,温度 softmax 的零样本预测等价于一个权重由文本编码器在线生成的 L2 归一线性分类器(§3.1.1 明示此解读);由对称 InfoNCE 的训练形式(其分类分支即 N-way 配对判别)到推理形式的映射是结构同一而非近似。论证角色:§3.1.1 推理合法性的推导核,也是 OpenScene prompt 查询机制的上游形式。→ 投影候选(G1 后挂 CLM)。
- TH-2(prompt 的缓存不变性) 多 prompt 集成 在嵌入空间平均(对 L2 归一化嵌入的均值再归一)与在概率空间 集成相比,前者可在推理前缓存单一文本嵌入集,使 集成 的摊销计算成本与单分类器相同(§3.1.1);这是 OpenScene “候选 prompt 集可离线预计算”做法(FRM-2211.15654 §1 集成 条目)的直接依据。论证角色:效率声明,非精度声明。→ 投影候选。
4. Evidence(实证 → CLM/EVI 映射)
投影未开始(G1 未签发)。骨架阶段先登记论文内承重观察的位置:
- Figure 3(目标函数效率):对比 vs 生成 vs 预测式,零样本 ImageNet 迁移速率 4×/12×——AX-2 的核心支撑。
- Table 1(ImageNet 零样本):零样本 CLIP 76.2% vs Visual N-Grams 11.5%;ResNet-50 线性探头全监督 76.2% 持平(§3.1.1 叙述)。
- Figure 6 + 正文(提示工程/ensembling):36 数据集平均近 +5%;ImageNet 单模板 +1.3%、80-prompt 集成 再 +3.5%。
- Figure 7(零样本 性能分析):数据集线性可分(每数据集性能可由其类名可描述性预测),方向性差距(对 VQA/细粒度弱)。
- Figure 8/线性探头(§3.2):linear probe 上 CLIP 以更少数据达同等性能、计算效率高一个量级级。
- Figure 13-15(鲁棒性):零样本 effective robustness 大幅提升,gap 缩至多 75%;ImageNet 微调 +9.2% 不增偏移精度(Figure 14)。
- Table 5(人类对照):零样本 CLIP 与人类 prompt 后性能对比及任务分布差异。
- §5 数据重叠:10% 中心重叠率、去重后零样本与 4-shot 差距保持——AX-5 支撑。
- §6/§3.1.1 反例证据:MNIST 88%(raw 像素逻辑回归可胜)、计数/最近车距近随机——AX-3 边界的负向支撑。
5. Argument(论证结构)
- AR-1(动机构造) NLP 预训练范式成功 + 视觉标注瓶颈 → 语言监督值得按互联网规模重试(§1)。归 Commentary 侧领域判断;其中“现有数据集低估潜力”是 AX-1 的表述形式。
- AR-2(效率驱动的目标选择) 生成式基线按算力外推不可达(Figure 3 的 4×/12×)→ 判别式对比目标(AX-2)。这是方法论文的承重论证:目标选择不是偏好而是效率测量结果。
- AR-3(架构与数据的联合缩放) WIT 400M × 对比目标 × 双塔架构缩放(宽/深/分辨率均摊)共同构成可扩展系统;零样本性能随模型算力平滑增长(Figure 8)——“scaling works”是结果性主张,其外推(1000× 达 SOTA)是估计非测量。
- AR-4(零样本作为协议) 超网络 归约(TH-1)把分类任务重述为“文本生成权重”,从而迁移成本从“标注 + 微调”降为“写类名”——提示工程 是该协议的经验修正层(AR-4a:polysemy/分布差的修补,非机制核心)。
- AR-5(鲁棒性归因) 零样本 未在评测分布上训练 → 不能利用该分布的伪相关 → effective robustness 提升由不训练解释(§3.3 推测性论证,作者自陈无确定答案,脚注保留“预训练- 评测共享伪相关”的保留)。归因强度弱,投影时 hedge 保留。
- AR-6(局限自陈) §6 九条:细粒度/计数/真 OOD 弱、有限类别选择(无生成灵活性)、数据效率低(12.8B 图 × 32 epoch)、验证集反复查询、基准共适应、社会偏见、few-shot 反直觉下降等。投影时构成 CLM 的 scope 边界素材。
6. Commentary
- 与 OpenScene 的枢纽关系:本文是 FRM-2211.15654 AX-1 的上游——OpenScene 假设的“像素嵌入与 CLIP 文本共空间”由本文 AX-3 的训练程序制造,但 OpenSeg/LSeg 的具体训练使其嵌入对 CLIP 原生空间的保真度成为第二个未量化误差源;两个误差源(对比训练的共嵌质量、上游模型的空间保持度)在两篇论文中均未分离测量,是库内零样本链上最长的未验证段。
- 与 DiT/LDM 谱系的对照:CLIP 的对比空间与扩散模型的 latent 空间同为“预训练表征空间”,但信息流方向相反——CLIP 把监督信号(类名)压入推理时的权重生成,LDM 把数据分布压入训练时的潜空间;开放词表生成(CLIP 引导扩散、LSeg/OpenSeg 作 OpenScene 教师)是两条线的交汇面。不建关系边,Part 9 后视 CLM 粒度决定是否进 SYN。
- 数据伦理与库内口径:WIT 未开源、未过滤 → 社会偏见(§7 FairFace 实验);本库引用 CLIP 性能数字时 scope 须带“WIT 400M 未公开数据训练”限定,复现性弱于 DiT/LDM(数据可得性上)。
- 优先权口径:作者自陈 batch 配对判别目标承继 Sohn 2016 / Oord 2018 / Zhang 2020,本文贡献是规模 + 数据构造 + 零样本协议的系统化,非目标函数发明——投影 CLM 时不得把 InfoNCE 本身记为本文主张。
7. Traceability
- 骨架依据:arXiv:2103.00020v1(tarball sha256 3654458fb40bfa2b027a3f8d2118e1ae47eb29926d3974ea38128cdaa2013b93),正文 §1–7;linear-probe-table.tex / 零样本-table.tex 为附录表格源。v1 即唯一版本(2021-02-26 提交,无修订)。
- 未重建部分:§8 Broader Impacts 的偏见/监控量化细节(伦理内容,非方法承重)、附录 D/E(人类实验设计、数据重叠方法细节按 §5 正文口径记录)。
- 候选 CPT 清单见 §1;CLM/EVI 投影清单见 §4,待 G1。
Review Log
- 2026-09-08 骨架起草(agent:程慧桢)。待 G1 审核:AX-1..AX-5 对照 §1/§2.2–2.4/§3.1/§3.3/§5/§6 原文,AR-1..AR-6 复现论证结构(AR-5 归因 hedge 是否保留为重点核查项),TH-1/TH-2 为结构性归约而非经验主张。签发待监工/人工。
关联(3)
- PPR-2103.00020 Learning Transferable Visual Models From Natural Language Supervision
- PPR-2211.15654 OpenScene: 3D Scene Understanding with Open Vocabularies
- FRM-2211.15654 OpenScene 五层重建:CLIP 共嵌入不变量下的三级特征构造(多视图融合 f2D → 余弦蒸馏 f3D → prompt-相似度 ensemble f2D3D)与零样本推理;断言投影待 G1 签发后进行。