← 戻る ライブラリ › 確率と統計 › 初等確率論 12年生
条件付き確率とベイズの定理 他の事象が起こったことがわかったときに、ある事象の確率がどう変わるか。
直観 直感:新しい情報が確率を変える 公平な6面のサイコロを2個振り、2つのサイコロの目の和が 8 8 8 になる事象を A A A とすると、通常は P ( A ) = 5 36 P(A) = \frac{5}{36} P ( A ) = 36 5 である。なぜなら、同様に確からしい 36 36 36 通りの組のうち、ちょうど五つの組 ( 2 , 6 ) , ( 3 , 5 ) , ( 4 , 4 ) , ( 5 , 3 ) , ( 6 , 2 ) (2,6), (3,5), (4,4), (5,3), (6,2) ( 2 , 6 ) , ( 3 , 5 ) , ( 4 , 4 ) , ( 5 , 3 ) , ( 6 , 2 ) がその和を与えるからである。さて、誰かが1つ目のサイコロをのぞき見て、それが 5 5 5 の目であると教えてくれたとしよう。これを事象 B B B と呼ぶ。B B B を知ることで、標本空間は全 36 36 36 通りの組から、1つ目のサイコロが 5 5 5 である 6 6 6 通りの組だけに狭まり、その 6 6 6 通りの組のうち和が 8 8 8 になるのは ( 5 , 3 ) (5,3) ( 5 , 3 ) だけである。この追加情報によって A A A の確率は 5 36 \frac{5}{36} 36 5 から 1 6 \frac{1}{6} 6 1 に変わる——この更新された値は P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) と書かれ、B B B を条件とする A A A の条件付き確率と呼ばれる。
2段階の試行に対する確率の木:最初の枝分かれは、どの条件が成り立つか(例えば、どの壺が選ばれたか、あるいは患者が病気かどうか)によって標本空間を分割し、2段階目の各枝には P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) のような条件付き確率が付けられる。1つの経路に沿って掛け合わせると P ( A ∩ B ) P(A \cap B) P ( A ∩ B ) が得られ、A A A で終わるすべての経路にわたって足し合わせると全確率 P ( A ) P(A) P ( A ) が得られる。 中高 条件付き確率の定義 定義: 条件付き確率
同じ標本空間内の2つの事象 A A A と B B B について、P ( B ) > 0 P(B) > 0 P ( B ) > 0 であるとき、B B B を条件とする A A A の条件付き確率は P ( A ∣ B ) = P ( A ∩ B ) P ( B ) P(A \mid B) = \frac{P(A \cap B)}{P(B)} P ( A ∣ B ) = P ( B ) P ( A ∩ B ) である。直感的には、B B B が起こったとわかった時点で標本空間は B B B に制限され、P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) はその制限された空間のうちどれだけの割合が A A A にも含まれるかを測る。
P ( A ∣ B ) = P ( A ∩ B ) P ( B ) P(A \mid B) = \frac{P(A \cap B)}{P(B)} P ( A ∣ B ) = P ( B ) P ( A ∩ B ) ここで P ( A ∩ B ) P(A \cap B) P ( A ∩ B ) は A A A と B B B が両方起こる確率であり、P ( B ) P(B) P ( B ) は条件となる事象の確率で、P ( B ) = 0 P(B) = 0 P ( B ) = 0 で割ることは定義されないため正でなければならない。定義を変形すると乗法の法則 P ( A ∩ B ) = P ( B ) ⋅ P ( A ∣ B ) P(A \cap B) = P(B) \cdot P(A \mid B) P ( A ∩ B ) = P ( B ) ⋅ P ( A ∣ B ) が得られ、対称性により P ( A ) > 0 P(A) > 0 P ( A ) > 0 のときは P ( A ∩ B ) = P ( A ) ⋅ P ( B ∣ A ) P(A \cap B) = P(A) \cdot P(B \mid A) P ( A ∩ B ) = P ( A ) ⋅ P ( B ∣ A ) も成り立つ。この法則は複数の事象の連鎖にも自然に拡張される。
P ( A ∩ B ) = P ( B ) ⋅ P ( A ∣ B ) = P ( A ) ⋅ P ( B ∣ A ) P(A \cap B) = P(B) \cdot P(A \mid B) = P(A) \cdot P(B \mid A) P ( A ∩ B ) = P ( B ) ⋅ P ( A ∣ B ) = P ( A ) ⋅ P ( B ∣ A ) 名前を付ける価値のある特別な場合が独立性である:A A A と B B B が独立であるとは、B B B を知っても A A A について新しい情報が得られないこと、すなわち P ( A ∣ B ) = P ( A ) P(A \mid B) = P(A) P ( A ∣ B ) = P ( A ) が成り立つことであり、これは P ( A ∩ B ) = P ( A ) ⋅ P ( B ) P(A \cap B) = P(A) \cdot P(B) P ( A ∩ B ) = P ( A ) ⋅ P ( B ) と同値である。A A A と B B B が独立でないとき、2つの条件付き確率 P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) と P ( B ∣ A ) P(B \mid A) P ( B ∣ A ) は一般に異なる数であり、これらを混同することは確率論で最もよくある間違いの1つである。
特別な場合における条件付き確率 A A A と B B B の関係P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) の値理由 独立 P ( A ∣ B ) = P ( A ) P(A \mid B) = P(A) P ( A ∣ B ) = P ( A ) B B B は A A A について情報を持たないA A A が B B B を含意する(すなわち A ⊆ B A \subseteq B A ⊆ B )P ( A ∣ B ) = P ( A ) P ( B ) P(A \mid B) = \frac{P(A)}{P(B)} P ( A ∣ B ) = P ( B ) P ( A ) A ∩ B = A A \cap B = A A ∩ B = A であるためA A A と B B B が排反P ( A ∣ B ) = 0 P(A \mid B) = 0 P ( A ∣ B ) = 0 A ∩ B = ∅ A \cap B = \varnothing A ∩ B = ∅ であるため
大学 全確率の定理とベイズの定理 B 1 , B 2 , … , B n B_1, B_2, \ldots, B_n B 1 , B 2 , … , B n を標本空間 Ω \Omega Ω の分割とする。すなわち、i ≠ j i \neq j i = j に対して B i ∩ B j = ∅ B_i \cap B_j = \varnothing B i ∩ B j = ∅ であり、B 1 ∪ B 2 ∪ ⋯ ∪ B n = Ω B_1 \cup B_2 \cup \cdots \cup B_n = \Omega B 1 ∪ B 2 ∪ ⋯ ∪ B n = Ω であり、すべての i i i について P ( B i ) > 0 P(B_i) > 0 P ( B i ) > 0 であるとする。このとき任意の事象 A A A に対して、P ( A ) = ∑ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) P(A) = \sum_{i=1}^{n} P(B_i) \cdot P(A \mid B_i) P ( A ) = ∑ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) が成り立つ。
なぜ正しいのか? B i B_i B i が Ω \Omega Ω を分割するため、事象 A A A は自動的に n n n 個の互いに素な部分に分けられ、各部分はそれぞれ1つの B i B_i B i の内側にある。乗法の法則で表した各部分の確率を足し合わせると、二重に数えたり見落としたりすることなく P ( A ) P(A) P ( A ) の全体が得られる。
証明 第1段階(B i B_i B i を用いて A A A を分割する):各 i = 1 , … , n i = 1, \ldots, n i = 1 , … , n について A i = A ∩ B i A_i = A \cap B_i A i = A ∩ B i と定める。B i B_i B i は互いに素なので A i A_i A i も互いに素であり、B 1 ∪ ⋯ ∪ B n = Ω ⊇ A B_1 \cup \cdots \cup B_n = \Omega \supseteq A B 1 ∪ ⋯ ∪ B n = Ω ⊇ A なので、A A A の各根元事象はちょうど1つの A i A_i A i に属し、A = A 1 ∪ A 2 ∪ ⋯ ∪ A n A = A_1 \cup A_2 \cup \cdots \cup A_n A = A 1 ∪ A 2 ∪ ⋯ ∪ A n が互いに素な和集合として成り立つ。
第2段階(互いに素な部分の確率を足す):確率は互いに素な事象について加法性を持つので、P ( A ) = P ( A 1 ) + P ( A 2 ) + ⋯ + P ( A n ) = ∑ i = 1 n P ( A ∩ B i ) P(A) = P(A_1) + P(A_2) + \cdots + P(A_n) = \sum_{i=1}^{n} P(A \cap B_i) P ( A ) = P ( A 1 ) + P ( A 2 ) + ⋯ + P ( A n ) = ∑ i = 1 n P ( A ∩ B i ) である。
第3段階(乗法の法則で各項を書き換える):各 i i i について、乗法の法則より P ( A ∩ B i ) = P ( B i ) ⋅ P ( A ∣ B i ) P(A \cap B_i) = P(B_i) \cdot P(A \mid B_i) P ( A ∩ B i ) = P ( B i ) ⋅ P ( A ∣ B i ) が成り立ち、P ( B i ) > 0 P(B_i) > 0 P ( B i ) > 0 なのでこれは well-defined である。
第4段階(代入する):第2段階のすべての P ( A ∩ B i ) P(A \cap B_i) P ( A ∩ B i ) を P ( B i ) ⋅ P ( A ∣ B i ) P(B_i) \cdot P(A \mid B_i) P ( B i ) ⋅ P ( A ∣ B i ) に置き換えると、主張どおり P ( A ) = ∑ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) P(A) = \sum_{i=1}^{n} P(B_i) \cdot P(A \mid B_i) P ( A ) = ∑ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) が得られる。
B 1 , B 2 , … , B n B_1, B_2, \ldots, B_n B 1 , B 2 , … , B n を Ω \Omega Ω の分割とし、すべての i i i について P ( B i ) > 0 P(B_i) > 0 P ( B i ) > 0 とする。また A A A を P ( A ) > 0 P(A) > 0 P ( A ) > 0 を満たす事象とする。このとき各 i i i について、P ( B i ∣ A ) = P ( B i ) ⋅ P ( A ∣ B i ) ∑ j = 1 n P ( B j ) ⋅ P ( A ∣ B j ) P(B_i \mid A) = \frac{P(B_i) \cdot P(A \mid B_i)}{\sum_{j=1}^{n} P(B_j) \cdot P(A \mid B_j)} P ( B i ∣ A ) = ∑ j = 1 n P ( B j ) ⋅ P ( A ∣ B j ) P ( B i ) ⋅ P ( A ∣ B i ) が成り立つ。
なぜ正しいのか? ベイズの定理は条件付けの向きを逆転させる:各仮説 B i B_i B i のもとで証拠 A A A がどれほど起こりやすいか(多くの場合わかりやすい、あるいは測定しやすい)から出発し、証拠 A A A が実際に観測された後で各仮説がどれほどもっともらしいか(通常こちらこそ本当に知りたいこと)を、各事前確率 P ( B i ) P(B_i) P ( B i ) を A A A をどれだけうまく説明するかに応じて重み付け直すことで求める。
証明 第1段階(P ( B i ∩ A ) P(B_i \cap A) P ( B i ∩ A ) を2通りに書く):乗法の法則を両方向に適用すると、P ( B i ∩ A ) = P ( B i ) ⋅ P ( A ∣ B i ) P(B_i \cap A) = P(B_i) \cdot P(A \mid B_i) P ( B i ∩ A ) = P ( B i ) ⋅ P ( A ∣ B i ) であり、また P ( A ) > 0 P(A) > 0 P ( A ) > 0 なので P ( B i ∩ A ) = P ( A ) ⋅ P ( B i ∣ A ) P(B_i \cap A) = P(A) \cdot P(B_i \mid A) P ( B i ∩ A ) = P ( A ) ⋅ P ( B i ∣ A ) でもある。
第2段階(2つの式を等しいとおいて解く):P ( B i ∩ A ) P(B_i \cap A) P ( B i ∩ A ) の2つの式を等しいとおくと P ( A ) ⋅ P ( B i ∣ A ) = P ( B i ) ⋅ P ( A ∣ B i ) P(A) \cdot P(B_i \mid A) = P(B_i) \cdot P(A \mid B_i) P ( A ) ⋅ P ( B i ∣ A ) = P ( B i ) ⋅ P ( A ∣ B i ) となり、両辺を P ( A ) P(A) P ( A ) で割ると P ( B i ∣ A ) = P ( B i ) ⋅ P ( A ∣ B i ) P ( A ) P(B_i \mid A) = \frac{P(B_i) \cdot P(A \mid B_i)}{P(A)} P ( B i ∣ A ) = P ( A ) P ( B i ) ⋅ P ( A ∣ B i ) が得られる。
第3段階(全確率の定理で分母を展開する):B 1 , … , B n B_1, \ldots, B_n B 1 , … , B n が Ω \Omega Ω を分割するので、全確率の定理より P ( A ) = ∑ j = 1 n P ( B j ) ⋅ P ( A ∣ B j ) P(A) = \sum_{j=1}^{n} P(B_j) \cdot P(A \mid B_j) P ( A ) = ∑ j = 1 n P ( B j ) ⋅ P ( A ∣ B j ) である。
第4段階(代入して完成させる):第2段階の P ( A ) P(A) P ( A ) をこの和で置き換えると、ちょうど P ( B i ∣ A ) = P ( B i ) ⋅ P ( A ∣ B i ) ∑ j = 1 n P ( B j ) ⋅ P ( A ∣ B j ) P(B_i \mid A) = \frac{P(B_i) \cdot P(A \mid B_i)}{\sum_{j=1}^{n} P(B_j) \cdot P(A \mid B_j)} P ( B i ∣ A ) = ∑ j = 1 n P ( B j ) ⋅ P ( A ∣ B j ) P ( B i ) ⋅ P ( A ∣ B i ) が得られ、これがベイズの定理である。
大学 実世界での応用と具体例 ベイズの定理は、医療診断(検査結果を受けて病気である確率を更新する)、迷惑メールフィルタ(メールの語句を見て迷惑メールである確率を更新する)、法的推論(新しい証拠を受けて有罪である確率を更新する)、そして機械学習の分類器(特徴量を観測した後にラベルの確率を更新する)における数学的な核心である。以下の2つの例では、全確率の定理とベイズの定理を具体的な数値に適用し、医療検査における偽陽性の古典的な逆説も扱う。
例: どちらの壺から取り出したか
壺が2つある。壺Iには赤玉が3 3 3 個、青玉が7 7 7 個入っており、壺IIには赤玉が6 6 6 個、青玉が4 4 4 個入っている。P ( Urn I ) = 0.4 P(\text{Urn I}) = 0.4 P ( Urn I ) = 0.4 、P ( Urn II ) = 0.6 P(\text{Urn II}) = 0.6 P ( Urn II ) = 0.6 として無作為に壺を1つ選び、選んだ壺から玉を1個取り出す。取り出した玉は赤であった。それが壺Iから取り出された確率を求めよ。
解答 第1段階:取り出した玉が赤である事象を R R R とする。壺Iの中では P ( R ∣ Urn I ) = 3 10 P(R \mid \text{Urn I}) = \frac{3}{10} P ( R ∣ Urn I ) = 10 3 であり、壺IIの中では P ( R ∣ Urn II ) = 6 10 P(R \mid \text{Urn II}) = \frac{6}{10} P ( R ∣ Urn II ) = 10 6 である。
第2段階:壺Iと壺IIは壺の選択を分割するので、全確率の定理より P ( R ) = P ( Urn I ) ⋅ P ( R ∣ Urn I ) + P ( Urn II ) ⋅ P ( R ∣ Urn II ) = 0.4 ⋅ 0.3 + 0.6 ⋅ 0.6 = 0.12 + 0.36 = 0.48 P(R) = P(\text{Urn I}) \cdot P(R \mid \text{Urn I}) + P(\text{Urn II}) \cdot P(R \mid \text{Urn II}) = 0.4 \cdot 0.3 + 0.6 \cdot 0.6 = 0.12 + 0.36 = 0.48 P ( R ) = P ( Urn I ) ⋅ P ( R ∣ Urn I ) + P ( Urn II ) ⋅ P ( R ∣ Urn II ) = 0.4 ⋅ 0.3 + 0.6 ⋅ 0.6 = 0.12 + 0.36 = 0.48 である。
第3段階:ベイズの定理より P ( Urn I ∣ R ) = P ( Urn I ) ⋅ P ( R ∣ Urn I ) P ( R ) = 0.12 0.48 = 1 4 P(\text{Urn I} \mid R) = \frac{P(\text{Urn I}) \cdot P(R \mid \text{Urn I})}{P(R)} = \frac{0.12}{0.48} = \frac{1}{4} P ( Urn I ∣ R ) = P ( R ) P ( Urn I ) ⋅ P ( R ∣ Urn I ) = 0.48 0.12 = 4 1 となる。したがって壺Iが選ばれる頻度が低いにもかかわらず、赤を見ても壺Iである確率はわずか 25 % 25\% 25% にとどまる。これは壺IIの方が2倍確実に赤玉を出すからである。
例: 医療検査における偽陽性の逆説
ある病気が人口の 1 % 1\% 1% に見られ、無作為に選んだ人について P ( D ) = 0.01 P(D) = 0.01 P ( D ) = 0.01 であるとする。この病気の検査は感度 99 % 99\% 99% 、すなわち P ( + ∣ D ) = 0.99 P(+ \mid D) = 0.99 P ( + ∣ D ) = 0.99 であり、特異度 95 % 95\% 95% 、すなわち P ( − ∣ D c ) = 0.95 P(- \mid D^c) = 0.95 P ( − ∣ D c ) = 0.95 である(したがって偽陽性率は P ( + ∣ D c ) = 0.05 P(+ \mid D^c) = 0.05 P ( + ∣ D c ) = 0.05 )。無作為に選んだ人が陽性反応を示した。その人が実際に病気である確率 P ( D ∣ + ) P(D \mid +) P ( D ∣ + ) を求めよ。
解答 第1段階:D D D と D c D^c D c (病気である、病気でない)は人口を分割し、P ( D ) = 0.01 P(D) = 0.01 P ( D ) = 0.01 、P ( D c ) = 0.99 P(D^c) = 0.99 P ( D c ) = 0.99 である。
第2段階:陽性反応を示す事象に全確率の定理を適用すると、P ( + ) = P ( D ) ⋅ P ( + ∣ D ) + P ( D c ) ⋅ P ( + ∣ D c ) = 0.01 ⋅ 0.99 + 0.99 ⋅ 0.05 = 0.0099 + 0.0495 = 0.0594 P(+) = P(D) \cdot P(+ \mid D) + P(D^c) \cdot P(+ \mid D^c) = 0.01 \cdot 0.99 + 0.99 \cdot 0.05 = 0.0099 + 0.0495 = 0.0594 P ( + ) = P ( D ) ⋅ P ( + ∣ D ) + P ( D c ) ⋅ P ( + ∣ D c ) = 0.01 ⋅ 0.99 + 0.99 ⋅ 0.05 = 0.0099 + 0.0495 = 0.0594 である。
第3段階:ベイズの定理より P ( D ∣ + ) = P ( D ) ⋅ P ( + ∣ D ) P ( + ) = 0.0099 0.0594 = 1 6 P(D \mid +) = \frac{P(D) \cdot P(+ \mid D)}{P(+)} = \frac{0.0099}{0.0594} = \frac{1}{6} P ( D ∣ + ) = P ( + ) P ( D ) ⋅ P ( + ∣ D ) = 0.0594 0.0099 = 6 1 、わずか約 16.7 % 16.7\% 16.7% である。
第4段階:これが偽陽性の逆説である。検査の感度が 99 % 99\% 99% 、特異度が 95 % 95\% 95% であっても、病気がまれであるため、99 % 99\% 99% の健康な人々がもたらす偽陽性(0.0495 0.0495 0.0495 )が、1 % 1\% 1% の病気の人々がもたらす真陽性(0.0099 0.0099 0.0099 )をはるかに上回り、陽性結果の大半は依然として誤報となる。
よくある誤り. 検察官の誤謬と呼ばれることもある頻繁かつ深刻な誤りは、P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) と P ( B ∣ A ) P(B \mid A) P ( B ∣ A ) を混同することである。病気の例では P ( + ∣ D ) = 0.99 P(+ \mid D) = 0.99 P ( + ∣ D ) = 0.99 は非常に高いが、だからといって P ( D ∣ + ) P(D \mid +) P ( D ∣ + ) が 0.99 0.99 0.99 に近いわけではない——上の例が示すように、P ( D ∣ + ) P(D \mid +) P ( D ∣ + ) はわずか約 1 6 \frac{1}{6} 6 1 である。この2つの条件付き確率は異なる問いに答えている:一方は仮説が真であるときに証拠が得られる可能性についてであり、他方は証拠が得られたときに仮説が真である可能性についてであって、ベイズの定理はまさにこの2つを変換する補正係数である。 歴史的ノート
牧師トーマス・ベイズは、一様な事前分布についてのこの結果の特別な場合を、彼の死後に彼の書類の中から見つかった論文で導いていた。数学者リチャード・プライスがそれを編集し、王立協会に提出し、協会は1763年にそれを発表した。独立に、より一般的な形でこの定理を再発見し体系的に発展させたのはピエール=シモン・ラプラスであり、彼は1770年代から1780年代にかけて、天文学の問題から証言の信頼性に至るまでこれを応用し、このページ全体で使われている一般的な複数仮説の形を与えた。
P ( A ) = 0.4 P(A) = 0.4 P ( A ) = 0.4 、P ( B ) = 0.5 P(B) = 0.5 P ( B ) = 0.5 、P ( A ∩ B ) = 0.2 P(A \cap B) = 0.2 P ( A ∩ B ) = 0.2 が与えられたとき、P ( A ∣ B ) P(A \mid B) P ( A ∣ B ) を求めよ。
0.4 0.4 0.4 0.5 0.5 0.5 0.2 0.2 0.2 0.8 0.8 0.8 あるスクリーニング検査の感度は 99 % 99\% 99% 、特異度は 99 % 99\% 99% である。人口の 1 % 1\% 1% が病気であるとき、無作為に選んだ人が陽性反応を示した。P ( D ∣ + ) P(D \mid +) P ( D ∣ + ) を最も近い整数パーセントに丸めるといくらか。
約 50 % 50\% 50% 約 99 % 99\% 99% 約 90 % 90\% 90% 約 1 % 1\% 1% B 1 , B 2 , … , B n B_1, B_2, \ldots, B_n B 1 , B 2 , … , B n を標本空間 Ω \Omega Ω の分割とし、すべての i i i について P ( B i ) > 0 P(B_i) > 0 P ( B i ) > 0 とする。任意の事象 A A A に対して P ( A ) P(A) P ( A ) を正しく与える公式はどれか。
P ( A ) = ∑ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) P(A) = \sum_{i=1}^{n} P(B_i) \cdot P(A \mid B_i) P ( A ) = ∑ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) P ( A ) = ∑ i = 1 n P ( A ∣ B i ) P(A) = \sum_{i=1}^{n} P(A \mid B_i) P ( A ) = ∑ i = 1 n P ( A ∣ B i ) P ( A ) = ∏ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) P(A) = \prod_{i=1}^{n} P(B_i) \cdot P(A \mid B_i) P ( A ) = ∏ i = 1 n P ( B i ) ⋅ P ( A ∣ B i ) P ( A ) = ∑ i = 1 n P ( B i ) P(A) = \sum_{i=1}^{n} P(B_i) P ( A ) = ∑ i = 1 n P ( B i ) 事象 A A A と B B B は P ( B ) > 0 P(B) > 0 P ( B ) > 0 を満たす。A A A と B B B が独立であることのちょうど定義となる等式はどれか。
P ( A ∣ B ) = P ( A ) P(A \mid B) = P(A) P ( A ∣ B ) = P ( A ) P ( A ∣ B ) = P ( B ) P(A \mid B) = P(B) P ( A ∣ B ) = P ( B ) P ( A ∣ B ) = 0 P(A \mid B) = 0 P ( A ∣ B ) = 0 P ( A ∣ B ) = 1 P(A \mid B) = 1 P ( A ∣ B ) = 1