PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#projection
1 記事
01
2026-08-13
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか
Learning Transferable Visual Models From Natural Language Supervision
画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。