JA EN

#math

48 記事

01 ·蒸留と圧縮·無料·論文·11分で読めます 蒸留の数学 — なぜ「柔らかい答え」から学べるのか Distilling the Knowledge in a Neural Network 蒸留の損失はなぜ KL(教師||生徒) なのか、温度Tは何をしているのか、そして実装で必ず出てくる T² 倍は何の補正なのか。ソフトラベルが正解ラベルより多くを語る理由を、式の導出と動く図で1から追います。 02 ·確率・統計·★ 会員·論文·16分で読めます 統計学習理論 — なぜ学習は汎化するのか Understanding Deep Learning Requires Rethinking Generalization 有限個の例しか見ていないのに、なぜ未知のデータに答えられるのか。Hoeffdingの不等式からVC次元・PAC学習まで汎化の保証を1から組み立て、それが深層学習の前で破れた経緯と、評価設計での使いどころまでを解説する。 03 ·確率・統計·★ 会員·論文·15分で読めます 最適輸送 — 分布を運ぶ数学 Sinkhorn Distances: Lightspeed Computation of Optimal Transport 2つの確率分布の距離を「砂を運ぶ最小コスト」として測るのが最適輸送。Wasserstein距離の定義から、実用の主役であるSinkhornアルゴリズム、WGAN・FID・Flow Matchingへの接続、そして現場で踏む落とし穴までを比喩とnumpyコードで積み上げる。 04 ·確率・統計·★ 会員·12分で読めます モンテカルロ法を1から — 積分をサイコロで解く 解けない積分は、乱数を降らせて平均を取れば近似できます。大数の法則がなぜ 1/√N の遅さを生むのか、重点サンプリングで何が救えるのか、そして正規化定数が分からない分布をMCMCがどう扱うのかを、前提知識ゼロから積み上げます。 05 ·確率・統計·★ 会員·12分で読めます モンテカルロ法を1から — 積分をサイコロで解く 解けない積分は、乱数を降らせて平均を取れば近似できます。大数の法則がなぜ 1/√N の遅さを生むのか、重点サンプリングで何が救えるのか、そして正規化定数が分からない分布をMCMCがどう扱うのかを、前提知識ゼロから積み上げます。 06 ·確率・統計·★ 会員·論文·15分で読めます カーネル法とガウス過程 — NN以前の王者 Practical Bayesian Optimization of Machine Learning Algorithms 深層学習が来る前、分類の王座に座っていたのはSVMとカーネル法だった。高次元へ持ち上げるコストをタダにする「カーネルトリック」から、関数そのものに確率を置くガウス過程、そして不確実性を武器にするベイズ最適化までを、前提知識ゼロで組み立てる。 07 ·微分と最適化の数学·★ 会員·15分で読めます ヤコビアンとヘッセ行列 — 多変数の微分を図で ヤコビアンは「その場の拡大鏡」、ヘッセ行列は「その場の曲がり具合」。局所線形化から、固有値による地形の分類、ニュートン法が理論上は速いのに使われない理由、そして10億次元でも計算できるヘッセ行列ベクトル積までを一本につなぎます。 08 ·微分と最適化の数学·★ 会員·15分で読めます ヤコビアンとヘッセ行列 — 多変数の微分を図で ヤコビアンは「その場の拡大鏡」、ヘッセ行列は「その場の曲がり具合」。局所線形化から、固有値による地形の分類、ニュートン法が理論上は速いのに使われない理由、そして10億次元でも計算できるヘッセ行列ベクトル積までを一本につなぎます。 09 ·線形代数·★ 会員·論文·12分で読めます 対称性と等変性 — 群論がネットワーク設計に効く Group Equivariant Convolutional Networks 「ずらしても猫は猫」をネットワークの構造そのものに焼き込む考え方を、群の4条件から等変性の定義式、CNNのパラメータ共有、AlphaFoldのフレームまで一本につなぎます。対称性を課すのが逆効果になる場面も含めて。 10 ·線形代数·★ 会員·論文·12分で読めます 対称性と等変性 — 群論がネットワーク設計に効く Group Equivariant Convolutional Networks 「ずらしても猫は猫」をネットワークの構造そのものに焼き込む考え方を、群の4条件から等変性の定義式、CNNのパラメータ共有、AlphaFoldのフレームまで一本につなぎます。対称性を課すのが逆効果になる場面も含めて。 11 ·情報理論·★ 会員·論文·14分で読めます 圧縮=予測=知能 — 情報理論から見るLLM Language Modeling Is Compression 次のトークンを当てる訓練は、そのままファイルを縮める訓練でもあります。算術符号化を経由すると「確率モデル」と「符号」が同じものだと分かり、交差エントロピー損失が圧縮後のバイト数そのものになる。Hutter Prizeが圧縮率を知能の指標に据えた理由まで、1から積み上げます。 12 ·微分と最適化の数学·★ 会員·17分で読めます 変分法 — 「関数を微分する」とはどういうことか 探しているのが「数」ではなく「形」のとき、微分はどう姿を変えるのか。汎関数と第一変分、オイラー=ラグランジュ方程式、最速降下線がサイクロイドになる理由、そして機械学習でいちばん使われる変分問題であるELBOまでを一本につなぎます。 13 ·微分と最適化の数学·★ 会員·17分で読めます 変分法 — 「関数を微分する」とはどういうことか 探しているのが「数」ではなく「形」のとき、微分はどう姿を変えるのか。汎関数と第一変分、オイラー=ラグランジュ方程式、最速降下線がサイクロイドになる理由、そして機械学習でいちばん使われる変分問題であるELBOまでを一本につなぎます。 14 ·確率・統計·★ 会員·13分で読めます 統計的検定とABテスト — p値の使い方と誤用 同じ画面を2つ並べても数字は必ずずれます。そのズレを「偶然のブレ何個分か」に換算するのが検定であり、p値です。帰無仮説の作法から、検出力・逐次検定・多重比較という3つの事故まで、前提知識ゼロから積み上げます。 15 ·確率・統計·★ 会員·13分で読めます 統計的検定とABテスト — p値の使い方と誤用 同じ画面を2つ並べても数字は必ずずれます。そのズレを「偶然のブレ何個分か」に換算するのが検定であり、p値です。帰無仮説の作法から、検出力・逐次検定・多重比較という3つの事故まで、前提知識ゼロから積み上げます。 16 ·線形代数·無料·14分で読めます テンソルと形状操作 — einsumが読めれば論文が読める 論文の Σ_j A_ij B_jk と、コードの x.transpose(1,2) は同じことを言っています。その橋渡しをするのが einsum 記法です。軸・ブロードキャスト・縮約という3つの道具だけで、Attentionの実装が1行で書けるところまで。 17 ·線形代数·無料·14分で読めます テンソルと形状操作 — einsumが読めれば論文が読める 論文の Σ_j A_ij B_jk と、コードの x.transpose(1,2) は同じことを言っています。その橋渡しをするのが einsum 記法です。軸・ブロードキャスト・縮約という3つの道具だけで、Attentionの実装が1行で書けるところまで。 18 ·確率・統計·無料·16分で読めます 確率分布図鑑 — 正規・ポアソン・指数族はどこから来るか 正規分布もポアソン分布も、暗記すべき公式ではなく「ある状況から必然的に出てくる形」です。足し算・希少な出来事・最大エントロピーという3つの物語をたどると、教科書に並ぶ分布たちが指数族という1本の川に合流し、sigmoidとsoftmaxがなぜあの形をしているのかまで見えてきます。 19 ·確率・統計·無料·16分で読めます 確率分布図鑑 — 正規・ポアソン・指数族はどこから来るか 正規分布もポアソン分布も、暗記すべき公式ではなく「ある状況から必然的に出てくる形」です。足し算・希少な出来事・最大エントロピーという3つの物語をたどると、教科書に並ぶ分布たちが指数族という1本の川に合流し、sigmoidとsoftmaxがなぜあの形をしているのかまで見えてきます。 20 ·情報理論·★ 会員·論文·14分で読めます 相互情報量 — 「知っている」を測る Representation Learning with Contrastive Predictive Coding 片方を知ると、もう片方の迷いがどれだけ減るか。それを1つの数字にしたのが相互情報量です。エントロピーの引き算という定義から、条件付き相互情報量・データ処理不等式・推定の難しさを経て、対照学習のInfoNCEがなぜ「相互情報量の下限」と呼ばれるのかまでをつなげます。 21 ·情報理論·★ 会員·論文·14分で読めます 相互情報量 — 「知っている」を測る Representation Learning with Contrastive Predictive Coding 片方を知ると、もう片方の迷いがどれだけ減るか。それを1つの数字にしたのが相互情報量です。エントロピーの引き算という定義から、条件付き相互情報量・データ処理不等式・推定の難しさを経て、対照学習のInfoNCEがなぜ「相互情報量の下限」と呼ばれるのかまでをつなげます。 22 ·微分と最適化の数学·★ 会員·16分で読めます 行列微分を1から — 逆伝播の数式を自分で導く ∂L/∂W = XᵀG の Xᵀ はどこから来たのか。行列微分は公式集の暗記ではなく、「トレースの中で dX を右端に回す」という1つの型です。分母レイアウトの形合わせから、線形層とsoftmax+交差エントロピーの勾配導出、倍精度での数値勾配チェックまで。 23 ·微分と最適化の数学·★ 会員·16分で読めます 行列微分を1から — 逆伝播の数式を自分で導く ∂L/∂W = XᵀG の Xᵀ はどこから来たのか。行列微分は公式集の暗記ではなく、「トレースの中で dX を右端に回す」という1つの型です。分母レイアウトの形合わせから、線形層とsoftmax+交差エントロピーの勾配導出、倍精度での数値勾配チェックまで。 24 ·微分と最適化の数学·★ 会員·論文·16分で読めます SGDの先へ — Adam・二次法・制約付き最適化 Adam: A Method for Stochastic Optimization モーメンタムは何を溜めているのか、Adamの4行は各行で何をしているのか、AdamWは何を直したのか、理論上もっと速いはずの二次法がなぜLLMで使われないのか。勾配クリッピングまで含めて、比喩→式→動く図→コード→現場の順で前提知識なしに解きほぐします。 25 ·微分と最適化の数学·★ 会員·論文·16分で読めます SGDの先へ — Adam・二次法・制約付き最適化 Adam: A Method for Stochastic Optimization モーメンタムは何を溜めているのか、Adamの4行は各行で何をしているのか、AdamWは何を直したのか、理論上もっと速いはずの二次法がなぜLLMで使われないのか。勾配クリッピングまで含めて、比喩→式→動く図→コード→現場の順で前提知識なしに解きほぐします。 26 ·線形代数·★ 会員·17分で読めます 行列分解ツアー — LU・QR・コレスキー・SVDの使い分け 行列分解は「同じ変形を、扱いやすい部品の掛け算に書き直す」操作です。解く(LU)・半額で解く(コレスキー)・直交化して最小二乗(QR)・壊れた行列でも扱う(SVD)の4つを、なぜ逆行列を作ってはいけないのかから始めて、選び方の一枚表とnumpyの実装まで一気につなぎます。 27 ·線形代数·★ 会員·17分で読めます 行列分解ツアー — LU・QR・コレスキー・SVDの使い分け 行列分解は「同じ変形を、扱いやすい部品の掛け算に書き直す」操作です。解く(LU)・半額で解く(コレスキー)・直交化して最小二乗(QR)・壊れた行列でも扱う(SVD)の4つを、なぜ逆行列を作ってはいけないのかから始めて、選び方の一枚表とnumpyの実装まで一気につなぎます。 28 ·確率・統計·★ 会員·12分で読めます マルコフ連鎖を1から — 「今だけ見る」確率過程 次に何が起きるかは、今どこにいるかだけで決まる — この割り切りがマルコフ連鎖です。遷移行列と定常分布から、PageRankがなぜ固有ベクトルなのか、MCMCがなぜ正規化定数を無視できるのかまでを、前提知識ゼロから積み上げます。 29 ·確率・統計·★ 会員·12分で読めます マルコフ連鎖を1から — 「今だけ見る」確率過程 次に何が起きるかは、今どこにいるかだけで決まる — この割り切りがマルコフ連鎖です。遷移行列と定常分布から、PageRankがなぜ固有ベクトルなのか、MCMCがなぜ正規化定数を無視できるのかまでを、前提知識ゼロから積み上げます。 30 ·情報理論·無料·12分で読めます エントロピーと交差エントロピー — 損失関数の出どころ 分類モデルで必ず出てくる交差エントロピー損失は、天下り式に決められたものではありません。「驚きの量」から出発して、エントロピー → 交差エントロピー → あの見慣れた損失式へと一本道でたどり、なぜ二乗誤差ではダメなのかまで説明します。 31 ·情報理論·無料·12分で読めます エントロピーと交差エントロピー — 損失関数の出どころ 分類モデルで必ず出てくる交差エントロピー損失は、天下り式に決められたものではありません。「驚きの量」から出発して、エントロピー → 交差エントロピー → あの見慣れた損失式へと一本道でたどり、なぜ二乗誤差ではダメなのかまで説明します。 32 ·確率・統計·★ 会員·13分で読めます ベイズ的に考える — 事前・尤度・事後の実務感覚 ベイズ更新は「事後を次の事前として継ぎ足す」操作です。共役事前を使えば更新は疑似カウントの足し算に退化し、A/Bテストは『勝つ確率』と『期待損失』の2枚看板で読めるようになります。停止規則と事前の選び方の落とし穴まで、前提知識ゼロから。 33 ·線形代数·無料·10分で読めます LoRAとRAGを支える線形代数 — 固有値・低ランク・ベクトル検索を、動かして掴む 行列は空間の変形、固有ベクトルは変形しても向きが変わらない方向、SVDはその一般化、内積は「似ている」の定義。LoRAのΔW=BAとRAGのベクトル検索がどちらも同じ線形代数の上に建っていることを、4つの動く図と数式で確かめる。読むだけでなく、スライダーとドラッグで手を動かすためのコラム。 34 ·線形代数·無料·10分で読めます LoRAとRAGを支える線形代数 — 固有値・低ランク・ベクトル検索を、動かして掴む 行列は空間の変形、固有ベクトルは変形しても向きが変わらない方向、SVDはその一般化、内積は「似ている」の定義。LoRAのΔW=BAとRAGのベクトル検索がどちらも同じ線形代数の上に建っていることを、4つの動く図と数式で確かめる。読むだけでなく、スライダーとドラッグで手を動かすためのコラム。 35 ·線形代数·★ 会員·論文·13分で読めます 特異値分解と低ランク近似 — LoRAの数学的な下地 LoRA: Low-Rank Adaptation of Large Language Models 特異値分解(SVD)を「回す・伸ばす・回す」の比喩から出発し、行列がrank-1の層の重ね合わせであること、実データでは少数の層だけで十分なこと(低ランク近似)までを前提知識ゼロから解説。LoRAが巨大モデルを0.4%のパラメータで微調整できる理由の、数学的な土台を作る。 36 ·線形代数·★ 会員·論文·13分で読めます 特異値分解と低ランク近似 — LoRAの数学的な下地 LoRA: Low-Rank Adaptation of Large Language Models 特異値分解(SVD)を「回す・伸ばす・回す」の比喩から出発し、行列がrank-1の層の重ね合わせであること、実データでは少数の層だけで十分なこと(低ランク近似)までを前提知識ゼロから解説。LoRAが巨大モデルを0.4%のパラメータで微調整できる理由の、数学的な土台を作る。 37 ·情報理論·★ 会員·論文·12分で読めます KL情報量を1から — 2つの分布の「ズレ」を測る Training language models to follow instructions with human feedback 2つの確率分布の「ズレ」を測るKL情報量を、圧縮の無駄払いという比喩から定義・非対称性・numpy実装へと積み上げる。後半はVAEの正則化項とRLHFのKLペナルティという2大応用で、この量が現代のAIをどう支えているかまでつなげる。 38 ·微分と最適化の数学·★ 会員·論文·10分で読めます 凸性と最適化 — なぜ深層学習は「凸でない」のに動くのか Identifying and attacking the saddle point problem in high-dimensional non-convex optimization 最適化理論の教科書は「凸なら解ける、凸でないなら保証なし」と教える。では損失面が凸でない深層学習はなぜ動くのか。凸集合・凸関数の定義から、局所解より恐い鞍点、汎化と結びつく平坦な最小値まで、地形の言葉で一気につなぐ。 39 ·微分と最適化の数学·★ 会員·論文·10分で読めます 凸性と最適化 — なぜ深層学習は「凸でない」のに動くのか Identifying and attacking the saddle point problem in high-dimensional non-convex optimization 最適化理論の教科書は「凸なら解ける、凸でないなら保証なし」と教える。では損失面が凸でない深層学習はなぜ動くのか。凸集合・凸関数の定義から、局所解より恐い鞍点、汎化と結びつく平坦な最小値まで、地形の言葉で一気につなぐ。 40 ·確率・統計·★ 会員·論文·11分で読めます ベイズの定理をAIで使う — 事前分布・事後分布・不確実性 On Calibration of Modern Neural Networks たった1行のベイズの定理が、AIの現場では「確率の校正」「能動学習」「ベイズ最適化」という3つの実務ツールに化ける。検査の陽性から始めて、事前分布・事後分布・不確実性を前提知識ゼロで解説する。 41 ·確率・統計·★ 会員·10分で読めます AIのための確率・統計 — モデルの出力は確率である 分類モデルもLLMも、返しているのは答えではなく確率分布です。分布・期待値・条件付き確率・ベイズの定理を記号から説明し、山場として「最尤推定がなぜ損失関数になるのか」を導きます。交差エントロピーもMSEも、発明されたのではなく出てきたものです。 42 ·確率・統計·★ 会員·10分で読めます AIのための確率・統計 — モデルの出力は確率である 分類モデルもLLMも、返しているのは答えではなく確率分布です。分布・期待値・条件付き確率・ベイズの定理を記号から説明し、山場として「最尤推定がなぜ損失関数になるのか」を導きます。交差エントロピーもMSEも、発明されたのではなく出てきたものです。 43 ·線形代数·無料·9分で読めます AIのための線形代数 — ベクトルと行列が何をしているのか 行列式もクラメルの公式も要りません。AIの論文に本当に出てくるのは、ベクトル=意味を置く座標と、行列=その座標を運ぶ変換、この2つだけです。内積がなぜ「意味の近さ」になるのかから、Attentionの式を記号ごとに読み下すところまで。 44 ·線形代数·無料·9分で読めます AIのための線形代数 — ベクトルと行列が何をしているのか 行列式もクラメルの公式も要りません。AIの論文に本当に出てくるのは、ベクトル=意味を置く座標と、行列=その座標を運ぶ変換、この2つだけです。内積がなぜ「意味の近さ」になるのかから、Attentionの式を記号ごとに読み下すところまで。 45 ·情報理論·★ 会員·11分で読めます 情報理論とAI — 交差エントロピー損失はどこから来たのか 情報量は驚きの大きさ、エントロピーは平均の驚き、KL情報量は2つの分布のズレ。この3つを積み上げると、分類でいつも使っているあの損失関数が必然として出てきます。なぜ対数なのか、なぜあの形なのか、そしてperplexityが何を数えているのかまで。 46 ·情報理論·★ 会員·11分で読めます 情報理論とAI — 交差エントロピー損失はどこから来たのか 情報量は驚きの大きさ、エントロピーは平均の驚き、KL情報量は2つの分布のズレ。この3つを積み上げると、分類でいつも使っているあの損失関数が必然として出てきます。なぜ対数なのか、なぜあの形なのか、そしてperplexityが何を数えているのかまで。 47 ·微分と最適化の数学·無料·9分で読めます AIのための微分 — 勾配は「どちらに動けば良くなるか」の矢印 極限の厳密な定義も、置換積分も要りません。学習の全体は「傾きを測って逆向きに進む」だけです。微分=倍率、勾配=傾きを並べたベクトル、連鎖律=倍率の掛け算。ヤコビアンとヘッセ行列は「何を表すか」だけを押さえ、論文の更新式を読み下します。 48 ·微分と最適化の数学·無料·9分で読めます AIのための微分 — 勾配は「どちらに動けば良くなるか」の矢印 極限の厳密な定義も、置換積分も要りません。学習の全体は「傾きを測って逆向きに進む」だけです。微分=倍率、勾配=傾きを並べたベクトル、連鎖律=倍率の掛け算。ヤコビアンとヘッセ行列は「何を表すか」だけを押さえ、論文の更新式を読み下します。