JA EN

#projection

1 記事

01 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか Learning Transferable Visual Models From Natural Language Supervision 画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。