JA EN

#deep-learning

12 記事

01 ·CNN・画像認識·無料·論文·12分で読めます ImageNetの瞬間 — 深層学習が勝った日 ImageNet Large Scale Visual Recognition Challenge 2012年、画像認識のコンテストで誤り26%の壁が15%まで一気に落ちた。ニューラルネットは30年前からあったのに、なぜその年だったのか。データ・計算・手法という3条件が揃った瞬間を、技術の中身まで下りて解き直します。 02 ·数値計算·★ 会員·18分で読めます 【実装】自動微分を自作する — 100行のミニPyTorch Valueクラス1つから始めて、演算子オーバーロード・トポロジカル順序・勾配の加算までを組み上げ、その上にニューラルネットを載せて学習させます。設計の理由を辿ると、zero_grad() や retain_graph が仕様の暗記ではなく必然に変わります。 03 ·数値計算·無料·14分で読めます 自動微分の仕組み — PyTorchの魔法を1から loss.backward() と書くだけで何百万個ものパラメータの微分が出てくるのはなぜか。計算グラフ・連鎖律・前進モードと後退モードを前提知識ゼロから解き、40行のミニautogradまで自作します。 04 ·深層学習の基礎·無料·論文·15分で読めます 活性化関数を1から — なぜ非線形が必要なのか Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification 層を何段積んでも、活性化関数がなければ1段と同じことしかできない——その一行の証明から始めて、sigmoidが捨てられReLUが勝ち、いまのLLMがSiLU/SwiGLUに落ち着くまでを、傾きを実際に触れる動く図とともに辿ります。 05 ·生成モデル·無料·13分で読めます VAEを1から — 「圧縮して戻す」に確率を混ぜると生成になる 圧縮して元に戻すだけのオートエンコーダは、なぜ新しいデータを作れないのか。そこに確率を一滴混ぜると生成モデルに変わる理屈を、ELBO・再パラメータ化・潜在空間の補間まで前提知識ゼロから解説します。 06 ·深層学習の基礎·★ 会員·論文·13分で読めます 正規化レイヤー全史 — BatchNormからRMSNormまで Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift 深層学習を「実際に深くできるもの」に変えた正規化レイヤーを前提知識ゼロから辿る。BatchNormが効く理由をめぐる内部共変量シフト論争、LayerNormがバッチ軸を捨てた理由、そしてLLMが一様にRMSNormへ行き着いた理由まで。 07 ·微分と最適化の数学·★ 会員·論文·10分で読めます 凸性と最適化 — なぜ深層学習は「凸でない」のに動くのか Identifying and attacking the saddle point problem in high-dimensional non-convex optimization 最適化理論の教科書は「凸なら解ける、凸でないなら保証なし」と教える。では損失面が凸でない深層学習はなぜ動くのか。凸集合・凸関数の定義から、局所解より恐い鞍点、汎化と結びつく平坦な最小値まで、地形の言葉で一気につなぐ。 08 ·CNN・画像認識·★ 会員·論文·10分で読めます CNNアーキテクチャの系譜 — AlexNetからResNet・EfficientNetまで Very Deep Convolutional Networks for Large-Scale Image Recognition 画像認識を塗り替えたCNNの10年を「深さの戦い」と「軽量化の戦い」の2幕で辿る。ReLU・残差接続・複合スケーリングという各時代の決定打を、比喩と動く図とコードで1から解説する。 09 ·時系列データ系·無料·13分で読めます RNNとLSTMを1から理解する — Transformer時代になぜ学ぶのか 系列を「状態を持って1つずつ読む」という発想から出発し、同じ行列を何度も掛けることがなぜ勾配を消すのか、LSTMの3つのゲートが何を解いたのかを式と動く図で追います。Transformerに置き換わった理由と、それでもこの再帰の考え方が生き残る場所まで。 10 ·深層学習の基礎·無料·9分で読めます ニューラルネットワークを1から理解する — 1個のニューロンから多層まで ニューロン1個の中身から多層ネットワークまでを、比喩→式→動く図→numpyコードの順で。「なぜ活性化関数が必要なのか」を、線形の合成が線形にしかならないという一行の証明から腹落ちさせます。 11 ·深層学習の基礎·★ 会員·12分で読めます 誤差逆伝播を1から解説 — 連鎖律だけで全部わかる 1000万個のパラメータの勾配を、なぜ順伝播1回ぶんの手間で全部求められるのか。連鎖律の復習から計算グラフ、2層ネットの手計算1ステップ、そして勾配消失が起きる理由までを、記号を1つずつ説明しながら追います。 12 ·Transformerの仕組み·無料·10分で読めます Attention機構を1から理解する — Transformerの心臓部を絵解きで ChatGPTの中核technology「自己注意機構」を、前提知識ゼロから比喩→直感→行列計算→numpyコードの順で解説。数式アレルギーでも読める入門記事。