PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#image-classification
2 記事
01
2026-08-06
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
論文解説: ViT — 画像を単語のように扱う
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
ViT原論文(Dosovitskiy et al., 2020/2021)を本文だけを根拠に読む。16×16のパッチを単語として扱うという一手、位置埋め込みのアブレーション、CNNの帰納バイアスを捨てた代償、そして「大規模データでCNNを超える」という条件付きの主張の中身。
02
2026-08-05
·
CNN・画像認識
·
無料
·
10分で読めます
画像分類を1から理解する — 畳み込みという発明
写真をそのまま全結合層に流すと、パラメータが1億個を超え、しかも猫が数画素ずれただけで別物になります。畳み込みはこの2つを「小さな窓を滑らせる」という1つのアイデアで同時に解きました。カーネル・ストライド・パディング・プーリングを式と手触りで押さえ、最後はsoftmaxで確率にするところまで。