MathLabs

確率と統計

大数の法則と中心極限定理

独立な確率変数の平均がなぜ落ち着いていくのか、そして標準化すればなぜ釣鐘型の曲線に近づくのか:チェビシェフの不等式、弱法則と強法則、中心極限定理。

直観なぜ平均は落ち着いていくのか

公平なコインを一回投げても表か裏かは予測できない。しかし1万回投げれば、表が出る割合はほぼ確実に0.5に近づく。それでも一回一回の結果は依然として予測不可能である。ランダムさは消えるのではなく、薄まるのだ:個々の結果はランダムなままだが、その平均はデータが増えるほど予測しやすくなる。

中心で最大となり、あらゆる方向へ滑らかに0へ減衰していく3Dの釣鐘型曲面。z = e^(-r^2)(rは中心からの距離)のグラフ。
二変量ガウス関数 z=e−r2z = e^{-r^2} の山:多くの独立なランダム要因の和が近づいていく釣鐘型の曲面のプレビューである——このページの後半で扱う中心極限定理そのものである。

大学チェビシェフの不等式:確率変数はどこまで散らばりうるか

定義: チェビシェフの不等式

確率変数 XX は有限な平均 μ\mu と分散 σ2\sigma^2 を持つとする。チェビシェフの不等式は、σ2\sigma^2 だけを使って、平均から遠く離れる確率がどれだけになりうるかを評価する——XX の分布の形については何も仮定しない。

P(∣X−μ∣≥k)≤σ2k2,k>0P(|X-\mu|\ge k)\le \frac{\sigma^2}{k^2}, \qquad k>0

確率変数 XX が有限な平均 μ\mu と分散 σ2\sigma^2 を持つとき、任意の k>0k>0 について: P(∣X−μ∣≥k)≤σ2k2P(|X-\mu|\ge k)\le \dfrac{\sigma^2}{k^2}。

なぜ正しいのか?

非負の確率変数 (X−μ)2(X-\mu)^2 にマルコフの不等式を適用すると P((X−μ)2≥k2)≤E[(X−μ)2]/k2=σ2/k2P((X-\mu)^2 \ge k^2) \le E[(X-\mu)^2]/k^2 = \sigma^2/k^2 が得られる。事象 (X−μ)2≥k2(X-\mu)^2 \ge k^2 はまさに ∣X−μ∣≥k|X-\mu| \ge k である。

証明

まずマルコフの不等式を証明する:非負の確率変数 Y≥0Y\ge0 と任意の a>0a>0 に対して、指示関数による評価 Y≥a⋅1{Y≥a}Y\ge a\cdot\mathbb{1}_{\{Y\ge a\}} は各点で成り立つ。なぜなら事象 {Y≥a}\{Y\ge a\} 上では右辺は a≤Ya\le Y に等しく、それ以外では右辺は 0≤Y0\le Y だからである。両辺の期待値を取っても不等号は保たれる:E[Y]≥aP(Y≥a)E[Y]\ge aP(Y\ge a)、したがって P(Y≥a)≤E[Y]/aP(Y\ge a)\le E[Y]/a。

次に、非負の確率変数 Y=(X−μ)2Y=(X-\mu)^2 にしきい値 a=k2a=k^2 でマルコフの不等式を適用する:P((X−μ)2≥k2)≤E[(X−μ)2]/k2P((X-\mu)^2\ge k^2)\le E[(X-\mu)^2]/k^2。分散の定義により E[(X−μ)2]=σ2E[(X-\mu)^2]=\sigma^2 であるから、右辺はちょうど σ2/k2\sigma^2/k^2 となる。

最後に、マルコフの不等式の両辺にある事象は一致する:(X−μ)2≥k2  ⟺  ∣X−μ∣≥k(X-\mu)^2\ge k^2 \iff |X-\mu|\ge k(両辺とも非負なので、二乗しても順序は保たれる)。これを代入すると P(∣X−μ∣≥k)≤σ2/k2P(|X-\mu|\ge k)\le\sigma^2/k^2 が得られ、これがチェビシェフの不等式である。

例: 簡単な評価

確率変数 XX の平均が μ=10\mu = 10、分散が σ2=4\sigma^2 = 4 であるとき、P(∣X−10∣≥4)P(|X - 10| \ge 4) を評価せよ。

解答

P(∣X−10∣≥4)≤σ2/42=4/16=0.25P(|X-10|\ge 4) \le \sigma^2/4^2 = 4/16 = 0.25:XX の分布の形がどうであれ、平均から4以上離れる確率は高々25%である。

例: モンテカルロ法によるπの推定

π\pi を推定するため、コンピューターは正方形 [−1,1]2[-1,1]^2 上に一様に nn 個の独立な点 (Ui,Vi)(U_i,V_i) をサンプリングし、単位円の内部に入った割合を数える。なぜこれが π\pi に収束するのか、また(チェビシェフの不等式を使って)推定値が確率少なくとも 0.990.99 で π\pi から 0.010.01 以内に収まるにはおよそ何個のサンプル nn が必要か?

解答

ii 番目の点が単位円の内部に入ることを示す指示関数を Yi=1{Ui2+Vi2≤1}Y_i=\mathbb{1}_{\{U_i^2+V_i^2\le1\}} とする。点は面積 44 の正方形上に一様であり、円の面積は π\pi であるから、E[Yi]=π/4E[Y_i]=\pi/4。推定量を π^n=4n∑i=1nYi\hat\pi_n=\frac{4}{n}\sum_{i=1}^nY_i と定義すると、E[π^n]=πE[\hat\pi_n]=\pi。

上で証明した弱法則により、1n∑i=1nYi→π/4\frac1n\sum_{i=1}^nY_i\to\pi/4 が確率収束するので、π^n→π\hat\pi_n\to\pi も確率収束する:これこそがモンテカルロシミュレーションが機能する理由である——独立なランダムサンプルの平均は真の期待値に収束する。

具体的なサンプル数については、Var(Yi)=π4(1−π4)≈0.168\mathrm{Var}(Y_i)=\frac{\pi}{4}\left(1-\frac{\pi}{4}\right)\approx0.168(ベルヌーイ分散)なので、Var(π^n)=16 Var(Yi)/n\mathrm{Var}(\hat\pi_n)=16\,\mathrm{Var}(Y_i)/n となる。チェビシェフの不等式より P(∣π^n−π∣≥0.01)≤16×0.168n×0.0001P(|\hat\pi_n-\pi|\ge0.01)\le\frac{16\times0.168}{n\times0.0001};これを 0.010.01 以下にするには n≥2.7×106n\ge2.7\times10^{6} が必要となる——小数点以下二桁の精度を得るには数百万のサンプルが必要であり、これが実務上モンテカルロ法がより安価で分散削減効果の高い変種を好む理由だが、そもそも収束を保証しているのは大数の法則である。

例: 保険ポートフォリオにおけるリスクのプール化

保険加入者一人当たりの年間請求額 XiX_i は平均 μ=500\mu=500、標準偏差 σ=2000\sigma=2000(米ドル単位;請求は稀だが大きい)を持つとし、プール内の n=10000n=10000 人の加入者にわたる請求は独立同分布として扱う。中心極限定理を使って、プールの平均請求額がそれを超える確率がおよそ 0.00130.0013 以下となるような、加入者一人当たりの保険料を見積もれ。

解答

Xˉn\bar X_n をプール全体の平均請求額とする。弱法則により、プールが大きくなるにつれ Xˉn→μ=500\bar X_n\to\mu=500 となるので、多くの独立な加入者をプールすることで、個々の請求 XiX_i は非常に変動が大きくても平均請求額は予測可能になる——これが保険の経済的な論理そのものである。

上で証明した中心極限定理により、Xˉn\bar X_n は平均 μ\mu、分散 Var(Xˉn)=σ2/n=40\mathrm{Var}(\bar X_n)=\sigma^2/n=40(n=10000n=10000 のとき)のほぼ正規分布に従い、標準偏差は sd(Xˉn)=40≈6.32\mathrm{sd}(\bar X_n)=\sqrt{40}\approx6.32 ドルとなる——これは単一の請求の変動 20002000 ドルよりはるかに小さい。

正規分布については、P(Xˉn>μ+3 sd(Xˉn))≈P(Z>3)≈0.0013P(\bar X_n>\mu+3\,\mathrm{sd}(\bar X_n))\approx P(Z>3)\approx0.0013(ここで ZZ は標準正規分布)である。したがって、加入者一人当たりの保険料を μ+3 sd(Xˉn)≈519\mu+3\,\mathrm{sd}(\bar X_n)\approx519 ドルに設定すると、プールの平均請求額が保険料を超える確率をおよそ 0.13%0.13\% に抑えられる——中心極限定理こそが、保険会社が極めて予測困難な個々のリスクを、狭く、価格付け可能な集団リスクへと変換できる理由である。

大学弱法則(弱い大数の法則)

定義: 確率収束

確率変数の列 YnY_n が定数 cc に確率収束するとは、任意の ε>0\varepsilon > 0 に対して P(∣Yn−c∣>ε)→0P(|Y_n - c| > \varepsilon) \to 0(n→∞n \to \infty のとき)となることをいう:大きくずれる確率は0に近づいていくが、固定した nn に対しては大きなずれが起こる可能性は依然として残る。

X1,X2,…X_1, X_2, \dots を有限な平均 μ\mu を持つ独立同分布な確率変数列とする。このとき標本平均 Xˉn=1n∑i=1nXi\bar X_n = \frac{1}{n}\sum_{i=1}^n X_i は μ\mu に確率収束する(n→∞n \to \infty のとき)。

なぜ正しいのか?

Var(Xˉn)=σ2/n→0\mathrm{Var}(\bar X_n) = \sigma^2/n \to 0(σ2\sigma^2 が有限のとき)であるから、チェビシェフの不等式より P(∣Xˉn−μ∣≥ε)≤σ2/(nε2)→0P(|\bar X_n - \mu| \ge \varepsilon) \le \sigma^2/(n\varepsilon^2) \to 0 となる。(定理そのものは有限な平均だけを仮定すればよく、より精密な切断の議論で示されるが、チェビシェフによる証明は本質を見渡せる特別な場合である。)

証明

nn 個の独立同分布なコピー XX(平均 μ\mu、そしてこのチェビシェフに基づく証明のためには有限な分散 σ2\sigma^2 を持つ)に対する標本平均を Xˉn=1n∑i=1nXi\bar X_n=\frac1n\sum_{i=1}^nX_i とする。期待値の線形性より E[Xˉn]=μE[\bar X_n]=\mu。

独立性により分散は加法的になる:Var(Xˉn)=1n2∑i=1nVar(Xi)=σ2n\mathrm{Var}(\bar X_n)=\frac1{n^2}\sum_{i=1}^n\mathrm{Var}(X_i)=\frac{\sigma^2}{n}。各 XiX_i が Var(Xi)=σ2\mathrm{Var}(X_i)=\sigma^2 を寄与し、i≠ji\ne j に対する交差項 Cov(Xi,Xj)\mathrm{Cov}(X_i,X_j) は独立性により消えるからである。

任意の ε>0\varepsilon>0 を固定し、上で証明したチェビシェフの不等式を Xˉn\bar X_n に適用する:P(∣Xˉn−μ∣≥ε)≤Var(Xˉn)ε2=σ2nε2P(|\bar X_n-\mu|\ge\varepsilon)\le\frac{\mathrm{Var}(\bar X_n)}{\varepsilon^2}=\frac{\sigma^2}{n\varepsilon^2}。

n→∞n\to\infty のとき、固定された任意の ε>0\varepsilon>0 に対して右辺 σ2/(nε2)→0\sigma^2/(n\varepsilon^2)\to0 となり、これはまさに確率収束の定義である。したがって Xˉn→μ\bar X_n\to\mu は確率収束する。

この結果の一つの形は、ヤコブ・ベルヌーイによって最初に証明され、彼の死後1713年に Ars Conjectandi で発表された——コイン投げのような繰り返し試行における成功の割合についての、大数の法則の最も早い形である。

発展強法則(強い大数の法則)

定義: 概収束

数列 YnY_n が cc に概収束するとは、P(lim⁡n→∞Yn=c)=1P(\lim_{n\to\infty} Y_n = c) = 1 が成り立つことをいう:ほとんどすべての標本点について数列そのものが cc に落ち着く、というものであり、これは(一度に一つの nn しか制御しない)確率収束より強い条件である。

X1,X2,…X_1, X_2, \dots を有限な平均 μ\mu を持つ独立同分布な確率変数列とする。このとき Xˉn→μ\bar X_n \to \mu が概収束する(n→∞n \to \infty のとき)。

なぜ正しいのか?

古典的な証明(コルモゴロフ、1933年)は、部分和の軌道全体を一度に制御するチェビシェフの強化版であるコルモゴロフの不等式と、部分列に関する議論を組み合わせて用いる。弱法則の一行で済むチェビシェフによる証明よりもかなり繊細である。

証明

ここでは、追加の(教科書でよく使われる)仮定として XX が有限な四次モーメント E[X4]<∞E[X^4]<\infty を持つ場合の証明を概説する;一般の主張は有限な平均だけを必要とするが、より繊細な切断の議論(コルモゴロフ、1933年)が必要である。中心化の後、E[X]=0E[X]=0 と仮定し(全体で XiX_i を Xi−μX_i-\mu に置き換える)、Sn=∑i=1nXiS_n=\sum_{i=1}^nX_i とする。

n4n^4 個の添字の四つ組全体にわたって E[Sn4]=∑i,j,k,lE[XiXjXkXl]E[S_n^4]=\sum_{i,j,k,l}E[X_iX_jX_kX_l] を展開する。独立性と E[X]=0E[X]=0 により、ちょうど一度だけ現れる添字を含む項はすべて消える(その因子の期待値が 00 になるため)。残るのは、四つの添字がすべて等しい nn 個の項と、異なる二つの等しい添字の組に分かれる 3n(n−1)3n(n-1) 個の項だけである。これより E[Sn4]=nE[X4]+3n(n−1)σ4≤Cn2E[S_n^4]=nE[X^4]+3n(n-1)\sigma^4\le Cn^2 が得られる。ここで定数 CC は E[X4]E[X^4] と σ2\sigma^2 だけに依存する。

n4n^4 で割ると:E[(Snn)4]≤Cn2E\left[\left(\frac{S_n}{n}\right)^4\right]\le\frac{C}{n^2}。nn について総和を取ると、∑1/n2\sum 1/n^2 が収束するので ∑n=1∞E[(Snn)4]≤∑n=1∞Cn2<∞\sum_{n=1}^\infty E\left[\left(\frac{S_n}{n}\right)^4\right]\le\sum_{n=1}^\infty\frac{C}{n^2}<\infty となる。

非負の確率変数の和で、期待値の総和が有限であるものは、それ自身がほとんど確実に有限でなければならない(単調収束定理)。したがって ∑n=1∞(Snn)4<∞\sum_{n=1}^\infty\left(\frac{S_n}{n}\right)^4<\infty がほとんど確実に成り立ち、これは各項が消えることを強制する:(Snn)4→0\left(\frac{S_n}{n}\right)^4\to0、すなわち Snn→0\frac{S_n}{n}\to0 がほとんど確実に成り立つ。中心化を元に戻すと Xˉn→μ\bar X_n\to\mu がほとんど確実に成り立ち、これが強法則である。

発展中心極限定理

Xˉn−μσ/n →d N(0,1)as n→∞\frac{\bar X_n - \mu}{\sigma/\sqrt{n}} \ \xrightarrow{d}\ N(0,1) \quad \text{as } n \to \infty

X1,…,XnX_1, \dots, X_n を平均 μ\mu、有限な分散 σ2>0\sigma^2 > 0 を持つ独立同分布な確率変数とする。n→∞n \to \infty のとき、標準化された標本平均 Xˉn−μσ/n\dfrac{\bar X_n - \mu}{\sigma/\sqrt{n}} は標準正規分布 N(0,1)N(0,1) に分布収束する——XiX_i の元の分布の形状によらない。

なぜ正しいのか?

直感的には、標準化された和のモーメント母関数(または特性関数)は、テイラー展開により項ごとに N(0,1)N(0,1) のものへ収束する。標準化によって生き残るのは平均と分散だけであり、それより高次のモーメントは n→∞n \to \infty で消えていくからである。これが、XiX_i の元の分布がどのような形であっても同じ釣鐘型が現れる理由である。

証明

確率変数 ZZ について、その特性関数は φZ(t)=E[eitZ]\varphi_Z(t)=E[e^{itZ}] である。各 XiX_i を Zi=Xi−μσZ_i=\frac{X_i-\mu}{\sigma} とおいて標準化すると、E[Zi]=0, E[Zi2]=1E[Z_i]=0,\ E[Z_i^2]=1 となり、標準化された標本平均はこれらの和になる:Tn=1n∑i=1nZi=Xˉn−μσ/nT_n=\frac{1}{\sqrt n}\sum_{i=1}^nZ_i=\frac{\bar X_n-\mu}{\sigma/\sqrt n}。

ZiZ_i は独立同分布であるから、和の特性関数は積になる:φTn(t)=[φZ ⁣(tn)]n\varphi_{T_n}(t)=\left[\varphi_Z\!\left(\frac{t}{\sqrt n}\right)\right]^n。

E[Z]=0E[Z]=0 かつ E[Z2]=1E[Z^2]=1 であるから、φZ\varphi_Z の 00 近くでのテイラー展開は φZ(s)=1−s22+o(s2)\varphi_Z(s)=1-\frac{s^2}{2}+o(s^2) となる。s=t/ns=t/\sqrt n を代入すると:φZ ⁣(tn)=1−t22n+o ⁣(1n)\varphi_Z\!\left(\frac{t}{\sqrt n}\right)=1-\frac{t^2}{2n}+o\!\left(\frac1n\right)。

これを nn 乗し、標準的な極限 (1+cn+o(1/n))n→ec\left(1+\frac{c}{n}+o(1/n)\right)^n\to e^{c} を用いると:φTn(t)=[1−t22n+o ⁣(1n)]n→e−t2/2\varphi_{T_n}(t)=\left[1-\frac{t^2}{2n}+o\!\left(\frac1n\right)\right]^n\to e^{-t^2/2}。e−t2/2e^{-t^2/2} はまさに標準正規分布 N(0,1)N(0,1) の特性関数であるから、レヴィの連続性定理により、この特性関数の各点収束は分布収束に変換される:Tn→dN(0,1)T_n\xrightarrow{d}N(0,1)。

三つの定理、Xˉn\bar X_n についての三つの問い
結果答える問い主張の種類
チェビシェフの不等式XX は μ\mu からどれだけ離れうるか?有限標本での評価、任意の分布
弱法則Xˉn\bar X_n は μ\mu に近づくか?確率収束
強法則数列 Xˉn\bar X_n 全体は μ\mu に落ち着くか?概収束
中心極限定理Xˉn\bar X_n のゆらぎはどんな形をしているか?分布収束、N(0,1)N(0,1) へ

これらの収束結果は統計学を動かすエンジンである:推定は標本平均から μ\mu の信頼区間をどう作るかを問い、仮説検定は同じ正規近似を使って母集団に関する対立する主張のどちらを選ぶかを問う。

弱法則によれば、n→∞n \to \infty のとき、独立同分布な確率変数の標本平均 Xˉn\bar X_n(各変数の平均を μ\mu とする)は

チェビシェフの不等式 P(∣X−μ∣≥k)≤σ2/k2P(|X-\mu|\ge k) \le \sigma^2/k^2 は、XX の分布についてどんな仮定を必要とするか。

中心極限定理によれば、標準化された標本平均 (Xˉn−μ)/(σ/n)(\bar X_n - \mu)/(\sigma/\sqrt{n}) の分布は、n→∞n \to \infty のとき、

公平なコインで表が10回連続で出た後、大数の法則が示しているのは

参考文献

  1. Sheldon Ross (2019). A First Course in Probability
  2. Rick Durrett (2019). Probability: Theory and Examples
  3. Andrey Kolmogorov (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung