MathLabs

確率と統計

ベイズ統計学

新しいデータが得られるたびに事前の信念を事後の信念へと更新していく統計学のアプローチ。

直観証拠が得られるたびに信念を更新する

あるコインを渡されて「これは公平か?」と尋ねられたとしよう。一度も投げていない段階では、おそらく公平に近いだろうと思うかもしれないが、確信はない——これをあなたの事前信念と呼ぶ。今、10回投げて8回表が出たとする。そのデータは、それ以前に信じていたことを完全に捨て去ることなく、「おそらく表寄りに偏っている」という方向へあなたの信念を動かすはずである。ベイズ統計学とは、事前信念を新しいデータと組み合わせて、更新された事後信念を得るための精密な仕組みである。

中心より右にピークがずれた下に凸の山。観測データによって対称な事前分布から引き寄せられた事後分布を模式的に表す。
ベイズ Beta–Binomial 更新:nn 回の試行で k≈npk \approx np 回の成功を観測すると、平坦な灰色の事前分布 Beta(2,2)\mathrm{Beta}(2,2) が pp 付近に鋭く集中した紫の事後分布へと更新される。

大学ベイズ更新:事前分布から事後分布へ

定義: 事前分布・尤度・事後分布

未知パラメータ θ\theta に対して、事前分布 π(θ)\pi(\theta) はデータ xx を見る前の θ\theta についての信念を表す。尤度 L(x∣θ)L(x\mid\theta) は、θ\theta の各値に対して観測データがどれほど起こりやすいかを表す。ベイズの定理はこれらを組み合わせて事後分布を与える:π(θ∣x)∝L(x∣θ) π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta)——事後分布は尤度と事前分布の積に比例する。

π(θ∣x)∝L(x∣θ) π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta)

比例記号は正規化定数 m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta'(周辺尤度あるいはエビデンスと呼ばれる)を隠している。これは θ\theta に依存せず、単に積 L(x∣θ)π(θ)L(x\mid\theta)\pi(\theta) を再スケールして、他のあらゆる確率密度と同じように π(θ∣x)\pi(\theta\mid x) が θ\theta 全体で積分して 11 になるようにするだけである。

π(θ∣x)=L(x∣θ)π(θ)∫L(x∣θ′)π(θ′) dθ′\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{\int L(x\mid\theta')\pi(\theta')\,d\theta'}

θ\theta が事前密度 π(θ)\pi(\theta) を持ち、データ xx が尤度 L(x∣θ)L(x\mid\theta) を持つとき、xx を与えたときの θ\theta の事後密度は π(θ∣x)=L(x∣θ)π(θ)m(x)\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)} である。ここで m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta'。同値に π(θ∣x)∝L(x∣θ)π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\pi(\theta) とも書ける。

なぜ正しいのか?

これは θ\theta と xx に同時に適用した条件付き密度の定義に他ならない:事後分布は (θ,x)(\theta,x) の同時密度を xx だけの周辺密度で割ったものであり、同時密度は事前分布と尤度の積に分解される。

証明

(θ,x)(\theta,x) の同時密度は二通りに分解できる:π(θ)L(x∣θ)\pi(\theta)L(x\mid\theta)(尤度を θ\theta を与えたときの xx の条件付き密度と定義することによる、事前分布と尤度の積)と、π(θ∣x)m(x)\pi(\theta\mid x)m(x)(事後分布を xx を与えたときの θ\theta の条件付き密度と定義することによる、事後分布と xx の周辺密度の積)である。両方の式は同じ同時密度に等しいので、π(θ)L(x∣θ)=π(θ∣x)m(x)\pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x)。

π(θ∣x)\pi(\theta\mid x) について解くと、m(x)>0m(x)>0 である限り π(θ∣x)=L(x∣θ)π(θ)m(x)\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)} が得られる。

残るは m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta' がまさに正しい正規化定数であることの確認である:分解 π(θ)L(x∣θ)=π(θ∣x)m(x)\pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x) の両辺を θ\theta について積分すると、左辺は定義により ∫π(θ)L(x∣θ) dθ=m(x)\int \pi(\theta)L(x\mid\theta)\,d\theta=m(x) となり、右辺は π(⋅∣x)\pi(\cdot\mid x) が確率密度であることから m(x)∫π(θ∣x) dθ=m(x)×1m(x)\int\pi(\theta\mid x)\,d\theta=m(x)\times1 となる。両辺が一致することから m(x)m(x) の整合性が確かめられ、π(θ∣x)\pi(\theta\mid x) が密度として要求される通り積分して 11 になることが確認される。

大学共役事前分布:ベータ・二項モデル

定義: 共役事前分布

事前分布の族が尤度に対して共役であるとは、事後分布がパラメータを更新しただけで同じ族にとどまることをいう。これにより、ベイズ更新は積分(すなわち m(x)m(x) の計算)から、その族のパラメータに対する単純な算術へと変わる——これが、現代的な計算手法が登場する以前、共役事前分布がベイズ統計学の主力であった理由である。

π(θ)=θα−1(1−θ)β−1B(α,β),0<θ<1\pi(\theta)=\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)},\qquad 0<\theta<1

θ∼Beta(α,β)\theta\sim\mathrm{Beta}(\alpha,\beta) を事前分布とし、θ\theta を与えたとき nn 回の独立試行で kk 回の成功が観測される場合(すなわち k∣θ∼Binomial(n,θ)k\mid\theta\sim\mathrm{Binomial}(n,\theta))、事後分布は θ∣k∼Beta(α+k, β+n−k)\theta\mid k\sim\mathrm{Beta}(\alpha+k,\ \beta+n-k) である。

なぜ正しいのか?

二項尤度は因子 θk(1−θ)n−k\theta^k(1-\theta)^{n-k} を与え、ベータ事前分布は θα−1(1−θ)β−1\theta^{\alpha-1}(1-\theta)^{\beta-1} を与える。これらを掛け合わせると指数が単に足し合わされ、ちょうど別のベータ密度の形になる。

証明

θ\theta を与えたとき nn 回中 kk 回の成功を観測する尤度は L(k∣θ)=(nk)θk(1−θ)n−kL(k\mid\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k} である。上の事後分布比例定理により、π(θ∣k)∝L(k∣θ)π(θ)=(nk)θk(1−θ)n−k⋅θα−1(1−θ)β−1B(α,β)\pi(\theta\mid k)\propto L(k\mid\theta)\pi(\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k}\cdot\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)}。

因子 (nk)\binom{n}{k} と B(α,β)B(\alpha,\beta) は θ\theta に依存しないので、比例定数に吸収できる:π(θ∣k)∝θk(1−θ)n−k⋅θα−1(1−θ)β−1=θ(α+k)−1(1−θ)(β+n−k)−1\pi(\theta\mid k)\propto\theta^{k}(1-\theta)^{n-k}\cdot\theta^{\alpha-1}(1-\theta)^{\beta-1}=\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1}。

この最後の式は、まさに Beta(α+k,β+n−k)\mathrm{Beta}(\alpha+k,\beta+n-k) 密度のカーネル(θ\theta に依存する部分)である。このカーネルを持つ (0,1)(0,1) 上の確率密度は一意の正規化定数(すなわちベータ関数の定義による 1/B(α+k,β+n−k)1/B(\alpha+k,\beta+n-k))を持つので、事後分布は必ず π(θ∣k)=θ(α+k)−1(1−θ)(β+n−k)−1B(α+k,β+n−k)\pi(\theta\mid k)=\dfrac{\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1}}{B(\alpha+k,\beta+n-k)}、すなわち θ∣k∼Beta(α+k,β+n−k)\theta\mid k\sim\mathrm{Beta}(\alpha+k,\beta+n-k) となる。

例: ウェブサイトのクリック率をA/Bテストする

実験を行う前に、あるアナリストがボタンの真のクリック率 θ\theta に弱い情報を持つ Beta(2,2)\mathrm{Beta}(2,2) 事前分布を置いた(0.5を中心とするが、あまり確信は強くない)。n=20n=20 人の訪問者にボタンを表示したところ、k=7k=7 人がクリックした。事後分布とその平均を求めよ。

解答

ベータ・二項共役性により、事後分布は Beta(α+k, β+n−k)=Beta(2+7, 2+13)=Beta(9,15)\mathrm{Beta}(\alpha+k,\ \beta+n-k)=\mathrm{Beta}(2+7,\ 2+13)=\mathrm{Beta}(9,15) である。

Beta(a,b)\mathrm{Beta}(a,b) 分布の平均は a/(a+b)a/(a+b) なので、事後平均は 9/(9+15)=9/24=0.3759/(9+15)=9/24=0.375 となる:データを見た後、アナリストのクリック率に対する最良の点推定値は、事前平均の 0.50.5 から 0.3750.375 へと動いたが、生のサンプル比率 7/20=0.357/20=0.35 と等しくはならず、それに引き寄せられるにとどまる。これは事前分布が依然としていくらかの重みを持つためである。

大学信用区間と信頼区間

定義: 信用区間

θ\theta に対する (1−α)(1-\alpha) 信用区間とは、∫LUπ(θ∣x) dθ=1−α\int_L^U \pi(\theta\mid x)\,d\theta=1-\alpha を満たす任意の区間 [L,U][L,U] のことである:これは、データ xx がすでに観測された後に事後分布から計算される、θ\theta についての直接的な確率の主張である。

これは頻度論的な信頼区間とは本質的に異なる対象である。信頼区間は、多くの仮想的な標本に適用した場合に、真の(固定された)θ\theta を既知の割合で捉えるような手続きから構成される。手元の具体的なデータから具体的な区間が一度計算されてしまえば、θ\theta はその中にあるかないかのどちらかであり、もはや語るべき確率は残っていない。これに対し信用区間は θ\theta 自体が分布を持つものとして扱うため、「θ\theta が [L,U][L,U] に入る確率」は常に意味を持つ主張である。

信用区間と信頼区間の比較
観点ベイズ信用区間頻度論的信頼区間
何がランダムかθ\theta は事後分布を持つランダムな量として扱われ、データが観測されれば区間は固定されるθ\theta は固定された未知の定数であり、標本ごとに変わるランダムな対象は区間そのものである
解釈観測データが与えられたとき、θ\theta がその区間に入る確率は 1−α1-\alpha である繰り返し標本抽出を行った場合、この方法で構成された区間のうち 1−α1-\alpha の割合が真の θ\theta を含む
事前分布に依存するかはい——事前分布 π(θ)\pi(\theta) が事後分布に直接入り込むいいえ——尤度と標本分布のみから計算される

発展共役を超えて:事後分布からのサンプリング

共役事前分布は美しいが、現実的なモデルの多く——多数のパラメータ、階層構造、非標準的な尤度——は共役形を持たないため、正規化定数 m(x)m(x) には閉じた形の積分が存在しない。マルコフ連鎖モンテカルロ(MCMC)法はこの積分を完全に回避する:事後分布 π(θ∣x)\pi(\theta\mid x) をちょうど定常分布とするマルコフ連鎖を構成し、その連鎖をシミュレーションして、得られた標本上の単純な平均によって事後分布の任意の量(平均、信用区間、その他何でも)を近似する。その際 m(x)m(x) を計算することは一切ない。

大学実世界での応用と具体例

ベイズ更新は、雑音を含む証拠に照らして信念を改める必要があるあらゆる場面に現れる:診断検査を解釈する医師、メールを分類するスパムフィルタ、どこを捜索すべきか更新する捜索救助チーム、センサー情報を統合する宇宙船の航法システム——これらはすべて「事後分布 ∝\propto 尤度 ×\times 事前分布」の何らかのバージョンを実行している。

例: 陽性の検査結果が病気の証明にならない理由

ある希少疾患は人口の 1%1\% に見られる(P(D)=0.01P(D)=0.01)。ある検査の感度は 99%99\%(P(+∣D)=0.99P(+\mid D)=0.99)、偽陽性率は 5%5\%(P(+∣¬D)=0.05P(+\mid \lnot D)=0.05)である。ランダムに選んだ人が陽性反応を示した。P(D∣+)P(D\mid +) を求めよ。

解答

全確率の公式より、P(+)=P(+∣D)P(D)+P(+∣¬D)P(¬D)=0.99×0.01+0.05×0.99=0.0099+0.0495=0.0594P(+)=P(+\mid D)P(D)+P(+\mid\lnot D)P(\lnot D)=0.99\times0.01+0.05\times0.99=0.0099+0.0495=0.0594。

ベイズの定理より P(D∣+)=P(+∣D)P(D)P(+)=0.00990.0594≈0.167P(D\mid +)=\dfrac{P(+\mid D)P(D)}{P(+)}=\dfrac{0.0099}{0.0594}\approx0.167 となる。

非常に精度が高く見える検査(感度99%、偽陽性率わずか5%)であっても、陽性結果が意味するのは実際に病気である確率がおよそ 16.7%16.7\% にすぎない——病気が稀であるため、健康な大集団からの偽陽性が、ごく小さな罹患集団からの真陽性を数の上で上回るからである。これはまさにベイズ更新が働いている例である:低い事前確率 P(D)=0.01P(D)=0.01 が、検査自体の精度の数字よりもはるかに低いところへ事後確率を引き下げている。

例: フラットな事前分布から歪んだ事後分布へ

コインの偏り θ\theta を推定するため、懐疑的な人がまったく情報を持たない Beta(1,1)\mathrm{Beta}(1,1) 事前分布(区間 (0,1)(0,1) 上の一様分布)から始めるとする。コインを10回投げて8回表が出た後、事後分布とその平均・最頻値を求めよ。

解答

α=β=1\alpha=\beta=1、n=10n=10、k=8k=8 でのベータ・二項共役性により、事後分布は Beta(1+8, 1+2)=Beta(9,3)\mathrm{Beta}(1+8,\ 1+2)=\mathrm{Beta}(9,3) となる。

事後平均は 9/(9+3)=9/12=0.759/(9+3)=9/12=0.75。a,b>1a,b>1 の Beta(a,b)\mathrm{Beta}(a,b) 分布の最頻値は (a−1)/(a+b−2)(a-1)/(a+b-2) であり、ここでは 8/10=0.88/10=0.8 となる。

事前分布は特定の値に偏らない、平坦で対称な山であった。事後分布は 0.80.8 付近にピークを持つ明確に非対称な山であり、これはこのページ冒頭のウィジェットが模式的に示していた「対称な事前分布からのピークのずれ」そのものである——10回中8回表という結果は、標本数が少ないにもかかわらず、信念を確かに偏ったコインの方向へ引き寄せている。

Beta(2,3)\mathrm{Beta}(2,3) 事前分布のもとで、n=10n=10 回中 k=4k=4 回の成功を観測した後の事後分布は何か?

このページの医療検査の例では、陽性結果は事後確率にしてわずか約 16.7%16.7\% の病気の可能性しか与えず、検査の感度 99%99\% よりはるかに低かった。これは何を示しているか?

95%95\% ベイズ信用区間について、95%95\% 頻度論的信頼区間と対比して正しく述べているのはどれか?

Beta(9,3)\mathrm{Beta}(9,3) 事後分布に対して、事後平均 E[θ]E[\theta] はいくらか?

参考文献

  1. Andrew Gelman, John B. Carlin, Hal S. Stern, David B. Dunson, Aki Vehtari, Donald B. Rubin (2013). Bayesian Data Analysis (3rd ed.)
  2. Matthew D. Hoffman, Andrew Gelman (2014). The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo · arXiv:1111.4246