JA EN
体系確率・統計
·★ 会員·論文·11分で読めます

ベイズの定理をAIで使う — 事前分布・事後分布・不確実性

たった1行のベイズの定理が、AIの現場では「確率の校正」「能動学習」「ベイズ最適化」という3つの実務ツールに化ける。検査の陽性から始めて、事前分布・事後分布・不確実性を前提知識ゼロで解説する。

対象textタスクmath

On Calibration of Modern Neural Networks

一次資料 — この記事の根拠

この解説の公開 2026-08-13

On Calibration of Modern Neural NetworksarXiv:1706.04599論文ページ·PDF
Practical Bayesian Optimization of Machine Learning AlgorithmsarXiv:1206.2944論文ページ·PDF

検査で「陽性」と言われたら、どれくらい心配すべきか

1000人に1人がかかる病気の検査を受けて「陽性」が出たとします。この検査は、病気の人を99%正しく陽性と判定し、健康な人を誤って陽性にする確率は1%です。さて、あなたが本当に病気である確率はいくつでしょう。

直感は「99%くらい」と答えたくなりますが、正解は約9%です。10万人で数えてみると分かります。病気の人は100人いて、そのうち99人が陽性。健康な人は99,900人いて、その1%=999人が誤って陽性。陽性の紙を受け取るのは合計1,098人ですが、本当に病気なのは99人だけ。99 ÷ 1,098 ≈ 9%です。

なぜ直感が外れたのか。「そもそも病気の人がめったにいない」という事前の情報を、直感は無視してしまうからです。この「事前の情報」と「目の前の証拠」を正しい配合で混ぜる公式が、ベイズの定理です。そしてAIの世界では、この1行の公式が「モデルの自信は信用できるか」「次にどのデータをラベル付けすべきか」「高価な実験をどこに割り振るか」という、きわめて実務的な問いに答える道具になります。

直感: ベイズの定理は「信念の更新ルール」

ベイズの定理を一言でいうと、証拠を見る前の信念(事前分布)を、証拠の説明力(尤度)で重み付けして、証拠を見た後の信念(事後分布)に更新するルールです。

刑事ドラマに例えます。捜査開始の時点で、刑事は容疑者ごとに「怪しさ」の見積もりを持っています。これが事前分布です。そこに新しい証拠 — 現場に残った足跡 — が見つかる。各容疑者について「その人が犯人だとしたら、この足跡はどれくらい自然か」を考える。これが尤度です。事前の怪しさと足跡の説明力を掛け合わせ、全体で辻褄が合うように割り算して出てくる新しい見積もりが事後分布。捜査が進むたびにこの更新を繰り返し、分布はだんだん尖っていきます。

大事なのは、答えが「犯人はAだ」という断定ではなく、確率の分布として出てくることです。分布が尖っていれば確信が強く、平らなら「まだ分からない」。この不確実性を数値として持ち歩けることが、ベイズ的な考え方の最大の武器です。

仕組み: 式はたった1行

P(HD)=P(DH)P(H)P(D)P(H \mid D) = \frac{P(D \mid H)\,P(H)}{P(D)}
(1)

読み方はこうです。HH は仮説(病気である、この画像は猫である)、DD は観測データ(陽性だった、この画素の並びだった)。P(H)P(H)事前確率=データを見る前の信念、P(DH)P(D \mid H)尤度=仮説が正しいときにそのデータが出る確率、P(D)P(D)証拠=どの仮説かによらずそのデータが出る確率(全仮説にわたる合計で、答えを確率として合計1に揃える正規化係数)。左辺の P(HD)P(H \mid D) が求めたい事後確率=データを見た後の信念です。

記号を日常語に置き換えると、この1行はこう読めます。いま信じるべき度合い = その仮説が目の前の出来事をどれだけうまく言い当てたか × もともとどれだけありそうだったか ÷ その出来事がどれだけありふれているか。最後の割り算が冒頭の例の勘所です。「陽性」という結果そのものはめずらしくなく、10万人のうち1,098人が受け取る — この大きな P(D)P(D) が、答えを9%まで引き戻しています。

分母は正規化のためだけにあるので、実務では比例関係で覚えるのが便利です。

P(HD)P(DH)P(H)P(H \mid D) \propto P(D \mid H)\,P(H)

つまり「事後 ∝ 尤度 × 事前」。事後の信念は、証拠の説明力と事前の信念の掛け算に比例する — 冒頭の検査の計算も、刑事の捜査も、やっていることはこの掛け算です。

分類器の出力も同じ形をしています。モデルが吐く「猫: 0.92、犬: 0.08」は、クラスにわたる一種の事後分布です。分布がどれくらい尖っているかは、下の図の温度スライダーで体感できます。温度を下げると1点に集中(強い確信)、上げると平ら(何も分かっていない)になります。

FIG 1分布の「尖り」が確信度。温度を下げると1つの答えに賭け、上げると「分からない」に近づく。後半で出てくる確率の校正は、まさにこの温度つまみを検証データで調整する操作

仮説 をモデルのパラメータ (重みの集まり)に置き換えると、学習は「データ を見た後、もっともらしいパラメータはどれか」という問いになります。事後確率を最大にする を選ぶのがMAP推定(最大事後確率推定)。対数を取ると積が和になり、次の形になります。

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. On Calibration of Modern Neural Networks. arXiv:1706.04599論文ページ·PDF
  2. Practical Bayesian Optimization of Machine Learning Algorithms. arXiv:1206.2944論文ページ·PDF

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です