MathLabs

12年生

条件付き確率とベイズの定理

他の事象が起こったことがわかったときに、ある事象の確率がどう変わるか。

直観直感:新しい情報が確率を変える

公平な6面のサイコロを2個振り、2つのサイコロの目の和が 88 になる事象を AA とすると、通常は P(A)=536P(A) = \frac{5}{36} である。なぜなら、同様に確からしい 3636 通りの組のうち、ちょうど五つの組 (2,6),(3,5),(4,4),(5,3),(6,2)(2,6), (3,5), (4,4), (5,3), (6,2) がその和を与えるからである。さて、誰かが1つ目のサイコロをのぞき見て、それが 55 の目であると教えてくれたとしよう。これを事象 BB と呼ぶ。BB を知ることで、標本空間は全 3636 通りの組から、1つ目のサイコロが 55 である 66 通りの組だけに狭まり、その 66 通りの組のうち和が 88 になるのは (5,3)(5,3) だけである。この追加情報によって AA の確率は 536\frac{5}{36} から 16\frac{1}{6} に変わる——この更新された値は P(A∣B)P(A \mid B) と書かれ、BB を条件とする AA の条件付き確率と呼ばれる。

根が2つの条件事象に分かれ、それぞれがさらに条件付き確率のラベルが付いた結果の枝に分かれる分岐木の図。
2段階の試行に対する確率の木:最初の枝分かれは、どの条件が成り立つか(例えば、どの壺が選ばれたか、あるいは患者が病気かどうか)によって標本空間を分割し、2段階目の各枝には P(A∣B)P(A \mid B) のような条件付き確率が付けられる。1つの経路に沿って掛け合わせると P(A∩B)P(A \cap B) が得られ、AA で終わるすべての経路にわたって足し合わせると全確率 P(A)P(A) が得られる。

中高条件付き確率の定義

定義: 条件付き確率

同じ標本空間内の2つの事象 AA と BB について、P(B)>0P(B) > 0 であるとき、BB を条件とする AA の条件付き確率は P(A∣B)=P(A∩B)P(B)P(A \mid B) = \frac{P(A \cap B)}{P(B)} である。直感的には、BB が起こったとわかった時点で標本空間は BB に制限され、P(A∣B)P(A \mid B) はその制限された空間のうちどれだけの割合が AA にも含まれるかを測る。

P(A∣B)=P(A∩B)P(B)P(A \mid B) = \frac{P(A \cap B)}{P(B)}

ここで P(A∩B)P(A \cap B) は AA と BB が両方起こる確率であり、P(B)P(B) は条件となる事象の確率で、P(B)=0P(B) = 0 で割ることは定義されないため正でなければならない。定義を変形すると乗法の法則 P(A∩B)=P(B)⋅P(A∣B)P(A \cap B) = P(B) \cdot P(A \mid B) が得られ、対称性により P(A)>0P(A) > 0 のときは P(A∩B)=P(A)⋅P(B∣A)P(A \cap B) = P(A) \cdot P(B \mid A) も成り立つ。この法則は複数の事象の連鎖にも自然に拡張される。

P(A∩B)=P(B)⋅P(A∣B)=P(A)⋅P(B∣A)P(A \cap B) = P(B) \cdot P(A \mid B) = P(A) \cdot P(B \mid A)

名前を付ける価値のある特別な場合が独立性である:AA と BB が独立であるとは、BB を知っても AA について新しい情報が得られないこと、すなわち P(A∣B)=P(A)P(A \mid B) = P(A) が成り立つことであり、これは P(A∩B)=P(A)⋅P(B)P(A \cap B) = P(A) \cdot P(B) と同値である。AA と BB が独立でないとき、2つの条件付き確率 P(A∣B)P(A \mid B) と P(B∣A)P(B \mid A) は一般に異なる数であり、これらを混同することは確率論で最もよくある間違いの1つである。

特別な場合における条件付き確率
AA と BB の関係P(A∣B)P(A \mid B) の値理由
独立P(A∣B)=P(A)P(A \mid B) = P(A)BB は AA について情報を持たない
AA が BB を含意する(すなわち A⊆BA \subseteq B)P(A∣B)=P(A)P(B)P(A \mid B) = \frac{P(A)}{P(B)}A∩B=AA \cap B = A であるため
AA と BB が排反P(A∣B)=0P(A \mid B) = 0A∩B=∅A \cap B = \varnothing であるため

大学全確率の定理とベイズの定理

B1,B2,…,BnB_1, B_2, \ldots, B_n を標本空間 Ω\Omega の分割とする。すなわち、i≠ji \neq j に対して Bi∩Bj=∅B_i \cap B_j = \varnothing であり、B1∪B2∪⋯∪Bn=ΩB_1 \cup B_2 \cup \cdots \cup B_n = \Omega であり、すべての ii について P(Bi)>0P(B_i) > 0 であるとする。このとき任意の事象 AA に対して、P(A)=∑i=1nP(Bi)⋅P(A∣Bi)P(A) = \sum_{i=1}^{n} P(B_i) \cdot P(A \mid B_i) が成り立つ。

なぜ正しいのか?

BiB_i が Ω\Omega を分割するため、事象 AA は自動的に nn 個の互いに素な部分に分けられ、各部分はそれぞれ1つの BiB_i の内側にある。乗法の法則で表した各部分の確率を足し合わせると、二重に数えたり見落としたりすることなく P(A)P(A) の全体が得られる。

証明

第1段階(BiB_i を用いて AA を分割する):各 i=1,…,ni = 1, \ldots, n について Ai=A∩BiA_i = A \cap B_i と定める。BiB_i は互いに素なので AiA_i も互いに素であり、B1∪⋯∪Bn=Ω⊇AB_1 \cup \cdots \cup B_n = \Omega \supseteq A なので、AA の各根元事象はちょうど1つの AiA_i に属し、A=A1∪A2∪⋯∪AnA = A_1 \cup A_2 \cup \cdots \cup A_n が互いに素な和集合として成り立つ。

第2段階(互いに素な部分の確率を足す):確率は互いに素な事象について加法性を持つので、P(A)=P(A1)+P(A2)+⋯+P(An)=∑i=1nP(A∩Bi)P(A) = P(A_1) + P(A_2) + \cdots + P(A_n) = \sum_{i=1}^{n} P(A \cap B_i) である。

第3段階(乗法の法則で各項を書き換える):各 ii について、乗法の法則より P(A∩Bi)=P(Bi)⋅P(A∣Bi)P(A \cap B_i) = P(B_i) \cdot P(A \mid B_i) が成り立ち、P(Bi)>0P(B_i) > 0 なのでこれは well-defined である。

第4段階(代入する):第2段階のすべての P(A∩Bi)P(A \cap B_i) を P(Bi)⋅P(A∣Bi)P(B_i) \cdot P(A \mid B_i) に置き換えると、主張どおり P(A)=∑i=1nP(Bi)⋅P(A∣Bi)P(A) = \sum_{i=1}^{n} P(B_i) \cdot P(A \mid B_i) が得られる。

B1,B2,…,BnB_1, B_2, \ldots, B_n を Ω\Omega の分割とし、すべての ii について P(Bi)>0P(B_i) > 0 とする。また AA を P(A)>0P(A) > 0 を満たす事象とする。このとき各 ii について、P(Bi∣A)=P(Bi)⋅P(A∣Bi)∑j=1nP(Bj)⋅P(A∣Bj)P(B_i \mid A) = \frac{P(B_i) \cdot P(A \mid B_i)}{\sum_{j=1}^{n} P(B_j) \cdot P(A \mid B_j)} が成り立つ。

なぜ正しいのか?

ベイズの定理は条件付けの向きを逆転させる:各仮説 BiB_i のもとで証拠 AA がどれほど起こりやすいか(多くの場合わかりやすい、あるいは測定しやすい)から出発し、証拠 AA が実際に観測された後で各仮説がどれほどもっともらしいか(通常こちらこそ本当に知りたいこと)を、各事前確率 P(Bi)P(B_i) を AA をどれだけうまく説明するかに応じて重み付け直すことで求める。

証明

第1段階(P(Bi∩A)P(B_i \cap A) を2通りに書く):乗法の法則を両方向に適用すると、P(Bi∩A)=P(Bi)⋅P(A∣Bi)P(B_i \cap A) = P(B_i) \cdot P(A \mid B_i) であり、また P(A)>0P(A) > 0 なので P(Bi∩A)=P(A)⋅P(Bi∣A)P(B_i \cap A) = P(A) \cdot P(B_i \mid A) でもある。

第2段階(2つの式を等しいとおいて解く):P(Bi∩A)P(B_i \cap A) の2つの式を等しいとおくと P(A)⋅P(Bi∣A)=P(Bi)⋅P(A∣Bi)P(A) \cdot P(B_i \mid A) = P(B_i) \cdot P(A \mid B_i) となり、両辺を P(A)P(A) で割ると P(Bi∣A)=P(Bi)⋅P(A∣Bi)P(A)P(B_i \mid A) = \frac{P(B_i) \cdot P(A \mid B_i)}{P(A)} が得られる。

第3段階(全確率の定理で分母を展開する):B1,…,BnB_1, \ldots, B_n が Ω\Omega を分割するので、全確率の定理より P(A)=∑j=1nP(Bj)⋅P(A∣Bj)P(A) = \sum_{j=1}^{n} P(B_j) \cdot P(A \mid B_j) である。

第4段階(代入して完成させる):第2段階の P(A)P(A) をこの和で置き換えると、ちょうど P(Bi∣A)=P(Bi)⋅P(A∣Bi)∑j=1nP(Bj)⋅P(A∣Bj)P(B_i \mid A) = \frac{P(B_i) \cdot P(A \mid B_i)}{\sum_{j=1}^{n} P(B_j) \cdot P(A \mid B_j)} が得られ、これがベイズの定理である。

大学実世界での応用と具体例

ベイズの定理は、医療診断(検査結果を受けて病気である確率を更新する)、迷惑メールフィルタ(メールの語句を見て迷惑メールである確率を更新する)、法的推論(新しい証拠を受けて有罪である確率を更新する)、そして機械学習の分類器(特徴量を観測した後にラベルの確率を更新する)における数学的な核心である。以下の2つの例では、全確率の定理とベイズの定理を具体的な数値に適用し、医療検査における偽陽性の古典的な逆説も扱う。

例: どちらの壺から取り出したか

壺が2つある。壺Iには赤玉が33個、青玉が77個入っており、壺IIには赤玉が66個、青玉が44個入っている。P(Urn I)=0.4P(\text{Urn I}) = 0.4、P(Urn II)=0.6P(\text{Urn II}) = 0.6 として無作為に壺を1つ選び、選んだ壺から玉を1個取り出す。取り出した玉は赤であった。それが壺Iから取り出された確率を求めよ。

解答

第1段階:取り出した玉が赤である事象を RR とする。壺Iの中では P(R∣Urn I)=310P(R \mid \text{Urn I}) = \frac{3}{10} であり、壺IIの中では P(R∣Urn II)=610P(R \mid \text{Urn II}) = \frac{6}{10} である。

第2段階:壺Iと壺IIは壺の選択を分割するので、全確率の定理より P(R)=P(Urn I)⋅P(R∣Urn I)+P(Urn II)⋅P(R∣Urn II)=0.4⋅0.3+0.6⋅0.6=0.12+0.36=0.48P(R) = P(\text{Urn I}) \cdot P(R \mid \text{Urn I}) + P(\text{Urn II}) \cdot P(R \mid \text{Urn II}) = 0.4 \cdot 0.3 + 0.6 \cdot 0.6 = 0.12 + 0.36 = 0.48 である。

第3段階:ベイズの定理より P(Urn I∣R)=P(Urn I)⋅P(R∣Urn I)P(R)=0.120.48=14P(\text{Urn I} \mid R) = \frac{P(\text{Urn I}) \cdot P(R \mid \text{Urn I})}{P(R)} = \frac{0.12}{0.48} = \frac{1}{4} となる。したがって壺Iが選ばれる頻度が低いにもかかわらず、赤を見ても壺Iである確率はわずか 25%25\% にとどまる。これは壺IIの方が2倍確実に赤玉を出すからである。

例: 医療検査における偽陽性の逆説

ある病気が人口の 1%1\% に見られ、無作為に選んだ人について P(D)=0.01P(D) = 0.01 であるとする。この病気の検査は感度 99%99\%、すなわち P(+∣D)=0.99P(+ \mid D) = 0.99 であり、特異度 95%95\%、すなわち P(−∣Dc)=0.95P(- \mid D^c) = 0.95 である(したがって偽陽性率は P(+∣Dc)=0.05P(+ \mid D^c) = 0.05)。無作為に選んだ人が陽性反応を示した。その人が実際に病気である確率 P(D∣+)P(D \mid +) を求めよ。

解答

第1段階:DD と DcD^c(病気である、病気でない)は人口を分割し、P(D)=0.01P(D) = 0.01、P(Dc)=0.99P(D^c) = 0.99 である。

第2段階:陽性反応を示す事象に全確率の定理を適用すると、P(+)=P(D)⋅P(+∣D)+P(Dc)⋅P(+∣Dc)=0.01⋅0.99+0.99⋅0.05=0.0099+0.0495=0.0594P(+) = P(D) \cdot P(+ \mid D) + P(D^c) \cdot P(+ \mid D^c) = 0.01 \cdot 0.99 + 0.99 \cdot 0.05 = 0.0099 + 0.0495 = 0.0594 である。

第3段階:ベイズの定理より P(D∣+)=P(D)⋅P(+∣D)P(+)=0.00990.0594=16P(D \mid +) = \frac{P(D) \cdot P(+ \mid D)}{P(+)} = \frac{0.0099}{0.0594} = \frac{1}{6}、わずか約 16.7%16.7\% である。

第4段階:これが偽陽性の逆説である。検査の感度が 99%99\%、特異度が 95%95\% であっても、病気がまれであるため、99%99\% の健康な人々がもたらす偽陽性(0.04950.0495)が、1%1\% の病気の人々がもたらす真陽性(0.00990.0099)をはるかに上回り、陽性結果の大半は依然として誤報となる。

P(A)=0.4P(A) = 0.4、P(B)=0.5P(B) = 0.5、P(A∩B)=0.2P(A \cap B) = 0.2 が与えられたとき、P(A∣B)P(A \mid B) を求めよ。

あるスクリーニング検査の感度は 99%99\%、特異度は 99%99\% である。人口の 1%1\% が病気であるとき、無作為に選んだ人が陽性反応を示した。P(D∣+)P(D \mid +) を最も近い整数パーセントに丸めるといくらか。

B1,B2,…,BnB_1, B_2, \ldots, B_n を標本空間 Ω\Omega の分割とし、すべての ii について P(Bi)>0P(B_i) > 0 とする。任意の事象 AA に対して P(A)P(A) を正しく与える公式はどれか。

事象 AA と BB は P(B)>0P(B) > 0 を満たす。AA と BB が独立であることのちょうど定義となる等式はどれか。