论文精读

CLIP:用自然语言监督学习可迁移的视觉模型

OpenAI 提出的对比语言-图像预训练方法,在 4 亿图文对上训练后实现零样本视觉识别,在 30+ 数据集上媲美甚至超越专用监督模型。

· 约 3 分钟阅读

CLIP:用自然语言监督学习可迁移的视觉模型

一篇重新定义“什么是视觉表征学习”的开创性工作——不需要人工标注的类别标签,只需要网上随处可见的“图片 + 配文”。

它解决什么

传统视觉模型的预训练依赖 ImageNet 等人工标注数据集,类别固定、标注成本高、泛化受限。CLIP 的核心洞察是:互联网上天然存在海量的图文配对数据(图片及其 alt 文本、标题、描述),这些数据蕴含的语义信息远超任何人工标注的数据集规模。

方法要点

  • 对比学习目标:给定一个 batch 的 (图像, 文本) 对,让模型学会把正确的图文对拉近、把错误的推开——本质上是在做“图文匹配”的多分类任务。
  • 双编码器架构:图像编码器(ResNet 或 ViT)和文本编码器(Transformer)各自输出特征,通过点积计算相似度,结构简洁、推理灵活。
  • 零样本迁移:预训练完成后,用文本描述定义新类别(如“a photo of a dog”),无需任何微调即可在新任务上做分类。
  • 海量数据:从互联网收集 4 亿图文对,这是 CLIP 强迁移能力的根本来源。

结果

  • 在 30+ 个计算机视觉基准数据集上,CLIP 的零样本性能媲美或超越全监督训练的专用模型
  • 自然语言监督的信息密度被证明可以超过 ImageNet 这种传统人工标注数据集——这意味着“更多弱监督数据 > 更少强监督数据”。
  • CLIP 开启了后续一系列工作的基础架构(BiomedCLIP、RadBIRAD、Quilt-1B 等),成为多模态模型的基石之一。

对我的启发

  • CLIP 的“图文对齐”思路直接催生了医学领域的 BiomedCLIP、RadBIRAD 等变体——医学影像 + 报告文本天然就是高质量的图文对,这个范式在医疗 AI 中特别适用。
  • 零样本能力在实际部署中极具价值:医院上新设备/新病种时,不需要重新采集标注数据,只需写好文本提示词就能用。
  • 对比学习的 scale law 很明显——数据量越大、模型越大,效果越好。这解释了为什么后续 FLIP、SigLIP 等工作持续在这个方向上加码。

继续阅读