PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
体系
› AI
VLM・マルチモーダル
CLIP・ViT・画像と言語を同じ空間に置く技術
01
2026-08-06
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
論文解説: ViT — 画像を単語のように扱う
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
ViT原論文(Dosovitskiy et al., 2020/2021)を本文だけを根拠に読む。16×16のパッチを単語として扱うという一手、位置埋め込みのアブレーション、CNNの帰納バイアスを捨てた代償、そして「大規模データでCNNを超える」という条件付きの主張の中身。
02
2026-08-06
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
9分で読めます
論文解説: CLIP — 言葉と画像を同じ地図に置く
Learning Transferable Visual Models From Natural Language Supervision
CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。
03
2026-08-13
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか
Learning Transferable Visual Models From Natural Language Supervision
画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。
04
2026-08-12
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
11分で読めます
BEV表現を1から — 複数カメラを俯瞰図に統合する
Lift
自動運転車が6台のカメラ映像を1枚の「上から見た地図」に変換する仕組みを、透視投影の復習から解説。深度を確率分布で押し出すLSSと、BEV側から問い合わせるTransformer系(BEVFormer)の設計思想の違いまで、前提知識ゼロから追う。
05
2026-08-26
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
11分で読めます
文書理解とOCRのいま — 帳票をLLMが読むまで
LayoutLM: Pre-training of Text and Layout for Document Image Understanding
請求書やスキャンPDFを機械が読むまでを1から。テキスト検出とCTC、誤りの測り方(CER)から、レイアウトを座標ごと埋め込むLayoutLM系、OCRを丸ごと捨てるDonut系、そして画像をそのままLLMに渡す現在までを、表・手書き・幻覚という実務の壁とあわせて解説する。
06
2026-08-27
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
動画理解を1から — フレームの束から時間の理解へ
Is Space-Time Attention All You Need for Video Understanding? (TimeSformer)
動画は「画像がたくさん」ではない。何枚をどう選ぶか(サンプリング)、フレーム同士をどう混ぜるか(時間注意)、長い動画をどう縮めるか(圧縮)の3つの問いに分けて、前提知識ゼロから式・動く図・コードで解説する。