PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#vit
1 記事
01
2026-08-06
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
論文解説: ViT — 画像を単語のように扱う
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
ViT原論文(Dosovitskiy et al., 2020/2021)を本文だけを根拠に読む。16×16のパッチを単語として扱うという一手、位置埋め込みのアブレーション、CNNの帰納バイアスを捨てた代償、そして「大規模データでCNNを超える」という条件付きの主張の中身。