JA EN

#vit

1 記事

01 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます 論文解説: ViT — 画像を単語のように扱う An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale ViT原論文(Dosovitskiy et al., 2020/2021)を本文だけを根拠に読む。16×16のパッチを単語として扱うという一手、位置埋め込みのアブレーション、CNNの帰納バイアスを捨てた代償、そして「大規模データでCNNを超える」という条件付きの主張の中身。