PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#clip
2 記事
01
2026-08-13
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか
Learning Transferable Visual Models From Natural Language Supervision
画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。
02
2026-08-06
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
9分で読めます
論文解説: CLIP — 言葉と画像を同じ地図に置く
Learning Transferable Visual Models From Natural Language Supervision
CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。