JA EN

#clip

2 記事

01 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか Learning Transferable Visual Models From Natural Language Supervision 画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。 02 ·VLM・マルチモーダル·★ 会員·論文·9分で読めます 論文解説: CLIP — 言葉と画像を同じ地図に置く Learning Transferable Visual Models From Natural Language Supervision CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。