JA EN

#image-classification

2 記事

01 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます 論文解説: ViT — 画像を単語のように扱う An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale ViT原論文(Dosovitskiy et al., 2020/2021)を本文だけを根拠に読む。16×16のパッチを単語として扱うという一手、位置埋め込みのアブレーション、CNNの帰納バイアスを捨てた代償、そして「大規模データでCNNを超える」という条件付きの主張の中身。 02 ·CNN・画像認識·無料·10分で読めます 画像分類を1から理解する — 畳み込みという発明 写真をそのまま全結合層に流すと、パラメータが1億個を超え、しかも猫が数画素ずれただけで別物になります。畳み込みはこの2つを「小さな窓を滑らせる」という1つのアイデアで同時に解きました。カーネル・ストライド・パディング・プーリングを式と手触りで押さえ、最後はsoftmaxで確率にするところまで。