JA EN
体系VLM・マルチモーダル
·★ 会員·論文·9分で読めます

論文解説: CLIP — 言葉と画像を同じ地図に置く

CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。

対象imagetextタスクmultimodal

Learning Transferable Visual Models From Natural Language Supervision

一次資料 — この記事の根拠

論文の発表 2021-02-26この解説の公開 2026-08-065年5か月後

Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy ほか · 2021-02-26 · v1arXiv:2103.00020論文ページ·PDF
原文の要旨(Abstract)を読む

State-of-the-art computer vision systems are trained to predict a fixed set of predetermined object categories. This restricted form of supervision limits their generality and usability since additional labeled data is needed to specify any other visual concept. Learning directly from raw text about images is a promising alternative which leverages a much broader source of supervision. We demonstrate that the simple pre-training task of predicting which caption goes with which image is an efficient and scalable way to learn SOTA image representations from scratch on a dataset of 400 million (image, text) pairs collected from the internet. After pre-training, natural language is used to reference learned visual concepts (or describe new ones) enabling zero-shot transfer of the model to downstream tasks. We study the performance of this approach by benchmarking on over 30 different existing computer vision datasets, spanning tasks such as OCR, action recognition in videos, geo-localization, and many types of fine-grained object classification. The model transfers non-trivially to most tasks and is often competitive with a fully supervised baseline without the need for any dataset specific training. For instance, we match the accuracy of the original ResNet-50 on ImageNet zero-shot without needing to use any of the 1.28 million training examples it was trained on. We release our code and pre-trained model weights at https://github.com/OpenAI/CLIP.


1000個の箱に入らないものは、見えない

最先端の画像認識は、あらかじめ決められた固定のカテゴリ集合を予測するよう学習される。この形の教師信号は汎用性を制限する。別の視覚概念を指定したければ、そのぶんラベル付きデータを追加するしかないからだ——論文はここから始まります(Abstract)。

弱教師あり学習の先行研究も同じ檻の中にいました。論文は、それらが教師信号を1000クラス、あるいは18291クラスへと設計の過程で自ら制限していると指摘します。加えて予測は静的なsoftmax分類器で行われるため、出力を動的に変える仕組みがない。これが柔軟性を大きく削ぎ、ゼロショット能力を制限している(§1)。一方で自然言語から直接学ぶ試みは性能が低く、Visual N-GramsのImageNetゼロショット精度は11.5%でした(§1)。

そこで論文はインターネット上の公開情報から4億組の(画像, テキスト)を集めます。50万件のクエリ語(英語版Wikipediaに100回以上現れる語やWordNetの同義語集合など)のいずれかを含むテキストを探し、1クエリあたり最大2万組でクラスバランスを取る。これがWIT(WebImageText)です(§2.2)。

キャプションを当てるのは、遠回りだった

最初のアプローチは画像のキャプションを予測する共同学習でした。しかし効率が上がらない。図2の実測では、6300万パラメータのTransformer言語モデル(画像側のResNet-50の2倍の計算量を使う)は、同じテキストをbag-of-wordsに符号化して当てる単純なベースラインより3倍遅くImageNetのクラスを覚えていきました(§2.3)。

原因は課題設定にあります。どちらも「画像に付随するテキストの正確な語」を当てようとしている。画像に併走する説明・コメント・関連文の多様さを考えれば、これは難しすぎる。そこで論文は、語ではなくどのテキスト全体がどの画像と対になっているかだけを当てるという代理課題に切り替えます。同じベースラインの目的関数を対照的なものへ差し替えると、ゼロショット転移の学習効率がさらに4倍改善しました(§2.3)。

内積が、そのまま「近さ」になる

仕組みは単純です。NN 組の(画像, テキスト)を含むバッチが来たら、N×NN\times N 通りの組み合わせのうち実際に対になっていたのはどれかを当てる。画像エンコーダとテキストエンコーダを同時に学習し、本物の NN 組の埋め込みのコサイン類似度を最大化し、間違った N2NN^{2}-N 組を最小化する。この類似度スコアに対称的な交差エントロピー損失を最適化します(§2.3)。埋め込みは各エンコーダの表現から線形射影1つで作られ、非線形射影は使いません。

FIG 12本のベクトルの向きが揃うほど内積は大きくなる。長さを1に揃えれば内積がそのままコサイン類似度になり、CLIPはこの値ひとつで画像と文の近さを測る

つまり学習が終わったあと、画像も文も同じ空間の単位ベクトルになっていて、近さは内積ひとつで決まる。「同じ地図に置く」とはこの意味です。実際のバッチサイズは32,768と非常に大きく、温度パラメータ τ\tau は学習中に直接最適化されます(§2.5)。

ゼロショット分類は、この事前学習能力の再利用にすぎません。データセットの全クラス名を候補テキストとして用意し、画像の埋め込みとのコサイン類似度を温度で調整してsoftmaxで確率にする(§3.1.2)。式に起こすと( はL2正規化済みの埋め込み):

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.. (2021-02-26) Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020論文ページ·PDF

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です