JA EN
体系 › AI

機械学習の基礎

学習とは何か・損失関数・過学習・評価まで、すべての土台

01 ·機械学習の基礎·無料·7分で読めます 機械学習とは何か — 「学習」を数式なしで理解する 「プログラムを書く」と「学習させる」は何が違うのか。ルールベースとの対比、丸暗記と汎化の差、教師あり・教師なし・強化学習の地図までを、数式をほぼ使わずに整理する入門記事。 02 ·機械学習の基礎·無料·9分で読めます 損失関数と最適化 — モデルはどうやって「間違いから学ぶ」のか MSEと交差エントロピーはなぜあの形なのか。勾配とは何を指す矢印なのか。勾配降下法の1ステップを、式・動く図・10行のコードで分解します。学習率を上げすぎたときの発散も手元で体感できます。 03 ·機械学習の基礎·★ 会員·9分で読めます 過学習と評価設計 — 精度99%を疑え 訓練データに合わせすぎたモデルはなぜ現場で壊れるのか。train/validation/testの役割分担、交差検証、実務で最も多い失敗であるデータリーク、不均衡データで精度が嘘をつく仕組みと、適合率・再現率・F1の使い分けまで。 04 ·機械学習の基礎·無料·論文·14分で読めます 決定木と勾配ブースティング — 表データ最強の座は今も XGBoost: A Scalable Tree Boosting System 行と列でできた「表」のデータでは、いまも決定木を束ねた勾配ブースティングが第一候補です。分岐の直感からアンサンブル、XGBoost/LightGBMの中身、そしてニューラルネットが表データで勝ちきれない理由までを、前提知識ゼロから積み上げます。 05 ·機械学習の基礎·★ 会員·論文·14分で読めます 教師なし学習を1から — クラスタリングと次元削減 UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction 正解ラベルが1つも無いデータから構造を取り出す方法を、前提知識ゼロから。k-means・階層・DBSCANの向き不向き、PCAが何を最大化しているのか、そしてt-SNE/UMAPの図でやってはいけない3つの誤読までを、比喩→式→動く図→コードの順で解説する。 06 ·機械学習の基礎·★ 会員·論文·14分で読めます 自己教師あり学習 — ラベルなしデータが宝になった日 A Simple Framework for Contrastive Learning of Visual Representations 人がラベルを貼らなくても、データは自分で問題を作れる。マスク予測と対照学習という2つの流派を、比喩→InfoNCEの式→動く図→PyTorchコードの順に前提知識ゼロから解説し、LLMの事前学習がなぜ「最大の自己教師あり学習」なのかまでつなげます。 07 ·機械学習の基礎·★ 会員·14分で読めます データリークと実験管理 — 精度が高すぎたら疑うこと モデルの数字が思ったより良いとき、喜ぶ前に疑うべきものがあります。予測時点では手に入らない情報が学習や選択に混ざる「リーク」を、結果由来の列・前処理・時間・重複・テストの擦り切れの5種類に分けて解説し、ラベルシャッフルなどの検知手順と、原因を後から特定できる実験記録の作り方までを前提知識ゼロから積み上げます。 08 ·機械学習の基礎·★ 会員·14分で読めます 不均衡データの実務 — 99%が正常のとき何を最適化するか 陽性が1%しかないデータでは正解率が嘘をつく。混同行列からPR曲線、重み付け・サンプリング・確率の較正、そして期待コストから閾値を逆算するところまでを、前提知識なしで積み上げる。 09 ·機械学習の基礎·★ 会員·11分で読めます MLシステム設計 — モデルの外側の9割 ノートブックで出た精度は、本番では約束になりません。特徴量の定義、学習と推論のズレ(スキュー)、劣化に気づく監視、そして再学習の輪。モデルの外側にある「9割」を、前提知識ゼロから設計の順番に並べ直します。