JA EN
体系 › AI

VLM・マルチモーダル

CLIP・ViT・画像と言語を同じ空間に置く技術

01 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます 論文解説: ViT — 画像を単語のように扱う An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale ViT原論文(Dosovitskiy et al., 2020/2021)を本文だけを根拠に読む。16×16のパッチを単語として扱うという一手、位置埋め込みのアブレーション、CNNの帰納バイアスを捨てた代償、そして「大規模データでCNNを超える」という条件付きの主張の中身。 02 ·VLM・マルチモーダル·★ 会員·論文·9分で読めます 論文解説: CLIP — 言葉と画像を同じ地図に置く Learning Transferable Visual Models From Natural Language Supervision CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。 03 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか Learning Transferable Visual Models From Natural Language Supervision 画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。 04 ·VLM・マルチモーダル·★ 会員·論文·11分で読めます BEV表現を1から — 複数カメラを俯瞰図に統合する Lift 自動運転車が6台のカメラ映像を1枚の「上から見た地図」に変換する仕組みを、透視投影の復習から解説。深度を確率分布で押し出すLSSと、BEV側から問い合わせるTransformer系(BEVFormer)の設計思想の違いまで、前提知識ゼロから追う。 05 ·VLM・マルチモーダル·★ 会員·論文·11分で読めます 文書理解とOCRのいま — 帳票をLLMが読むまで LayoutLM: Pre-training of Text and Layout for Document Image Understanding 請求書やスキャンPDFを機械が読むまでを1から。テキスト検出とCTC、誤りの測り方(CER)から、レイアウトを座標ごと埋め込むLayoutLM系、OCRを丸ごと捨てるDonut系、そして画像をそのままLLMに渡す現在までを、表・手書き・幻覚という実務の壁とあわせて解説する。 06 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます 動画理解を1から — フレームの束から時間の理解へ Is Space-Time Attention All You Need for Video Understanding? (TimeSformer) 動画は「画像がたくさん」ではない。何枚をどう選ぶか(サンプリング)、フレーム同士をどう混ぜるか(時間注意)、長い動画をどう縮めるか(圧縮)の3つの問いに分けて、前提知識ゼロから式・動く図・コードで解説する。