確率と統計
大数の法則と中心極限定理
独立な確率変数の平均がなぜ落ち着いていくのか、そして標準化すればなぜ釣鐘型の曲線に近づくのか:チェビシェフの不等式、弱法則と強法則、中心極限定理。
直観なぜ平均は落ち着いていくのか
公平なコインを一回投げても表か裏かは予測できない。しかし1万回投げれば、表が出る割合はほぼ確実に0.5に近づく。それでも一回一回の結果は依然として予測不可能である。ランダムさは消えるのではなく、薄まるのだ:個々の結果はランダムなままだが、その平均はデータが増えるほど予測しやすくなる。
二変量ガウス関数 z=e−r2 の山:多くの独立なランダム要因の和が近づいていく釣鐘型の曲面のプレビューである——このページの後半で扱う中心極限定理そのものである。大学チェビシェフの不等式:確率変数はどこまで散らばりうるか
定義: チェビシェフの不等式
確率変数 X は有限な平均 μ と分散 σ2 を持つとする。チェビシェフの不等式は、σ2 だけを使って、平均から遠く離れる確率がどれだけになりうるかを評価する——X の分布の形については何も仮定しない。
P(∣X−μ∣≥k)≤k2σ2,k>0 確率変数 X が有限な平均 μ と分散 σ2 を持つとき、任意の k>0 について: P(∣X−μ∣≥k)≤k2σ2。
なぜ正しいのか?
非負の確率変数 (X−μ)2 にマルコフの不等式を適用すると P((X−μ)2≥k2)≤E[(X−μ)2]/k2=σ2/k2 が得られる。事象 (X−μ)2≥k2 はまさに ∣X−μ∣≥k である。
証明
まずマルコフの不等式を証明する:非負の確率変数 Y≥0 と任意の a>0 に対して、指示関数による評価 Y≥a⋅1{Y≥a} は各点で成り立つ。なぜなら事象 {Y≥a} 上では右辺は a≤Y に等しく、それ以外では右辺は 0≤Y だからである。両辺の期待値を取っても不等号は保たれる:E[Y]≥aP(Y≥a)、したがって P(Y≥a)≤E[Y]/a。
次に、非負の確率変数 Y=(X−μ)2 にしきい値 a=k2 でマルコフの不等式を適用する:P((X−μ)2≥k2)≤E[(X−μ)2]/k2。分散の定義により E[(X−μ)2]=σ2 であるから、右辺はちょうど σ2/k2 となる。
最後に、マルコフの不等式の両辺にある事象は一致する:(X−μ)2≥k2⟺∣X−μ∣≥k(両辺とも非負なので、二乗しても順序は保たれる)。これを代入すると P(∣X−μ∣≥k)≤σ2/k2 が得られ、これがチェビシェフの不等式である。
例: 簡単な評価
確率変数 X の平均が μ=10、分散が σ2=4 であるとき、P(∣X−10∣≥4) を評価せよ。
解答
P(∣X−10∣≥4)≤σ2/42=4/16=0.25:X の分布の形がどうであれ、平均から4以上離れる確率は高々25%である。
例: モンテカルロ法によるπの推定
π を推定するため、コンピューターは正方形 [−1,1]2 上に一様に n 個の独立な点 (Ui,Vi) をサンプリングし、単位円の内部に入った割合を数える。なぜこれが π に収束するのか、また(チェビシェフの不等式を使って)推定値が確率少なくとも 0.99 で π から 0.01 以内に収まるにはおよそ何個のサンプル n が必要か?
解答
i 番目の点が単位円の内部に入ることを示す指示関数を Yi=1{Ui2+Vi2≤1} とする。点は面積 4 の正方形上に一様であり、円の面積は π であるから、E[Yi]=π/4。推定量を π^n=n4∑i=1nYi と定義すると、E[π^n]=π。
上で証明した弱法則により、n1∑i=1nYi→π/4 が確率収束するので、π^n→π も確率収束する:これこそがモンテカルロシミュレーションが機能する理由である——独立なランダムサンプルの平均は真の期待値に収束する。
具体的なサンプル数については、Var(Yi)=4π(1−4π)≈0.168(ベルヌーイ分散)なので、Var(π^n)=16Var(Yi)/n となる。チェビシェフの不等式より P(∣π^n−π∣≥0.01)≤n×0.000116×0.168;これを 0.01 以下にするには n≥2.7×106 が必要となる——小数点以下二桁の精度を得るには数百万のサンプルが必要であり、これが実務上モンテカルロ法がより安価で分散削減効果の高い変種を好む理由だが、そもそも収束を保証しているのは大数の法則である。
例: 保険ポートフォリオにおけるリスクのプール化
保険加入者一人当たりの年間請求額 Xi は平均 μ=500、標準偏差 σ=2000(米ドル単位;請求は稀だが大きい)を持つとし、プール内の n=10000 人の加入者にわたる請求は独立同分布として扱う。中心極限定理を使って、プールの平均請求額がそれを超える確率がおよそ 0.0013 以下となるような、加入者一人当たりの保険料を見積もれ。
解答
Xˉn をプール全体の平均請求額とする。弱法則により、プールが大きくなるにつれ Xˉn→μ=500 となるので、多くの独立な加入者をプールすることで、個々の請求 Xi は非常に変動が大きくても平均請求額は予測可能になる——これが保険の経済的な論理そのものである。
上で証明した中心極限定理により、Xˉn は平均 μ、分散 Var(Xˉn)=σ2/n=40(n=10000 のとき)のほぼ正規分布に従い、標準偏差は sd(Xˉn)=40≈6.32 ドルとなる——これは単一の請求の変動 2000 ドルよりはるかに小さい。
正規分布については、P(Xˉn>μ+3sd(Xˉn))≈P(Z>3)≈0.0013(ここで Z は標準正規分布)である。したがって、加入者一人当たりの保険料を μ+3sd(Xˉn)≈519 ドルに設定すると、プールの平均請求額が保険料を超える確率をおよそ 0.13% に抑えられる——中心極限定理こそが、保険会社が極めて予測困難な個々のリスクを、狭く、価格付け可能な集団リスクへと変換できる理由である。
大学弱法則(弱い大数の法則)
定義: 確率収束
確率変数の列 Yn が定数 c に確率収束するとは、任意の ε>0 に対して P(∣Yn−c∣>ε)→0(n→∞ のとき)となることをいう:大きくずれる確率は0に近づいていくが、固定した n に対しては大きなずれが起こる可能性は依然として残る。
X1,X2,… を有限な平均 μ を持つ独立同分布な確率変数列とする。このとき標本平均 Xˉn=n1∑i=1nXi は μ に確率収束する(n→∞ のとき)。
なぜ正しいのか?
Var(Xˉn)=σ2/n→0(σ2 が有限のとき)であるから、チェビシェフの不等式より P(∣Xˉn−μ∣≥ε)≤σ2/(nε2)→0 となる。(定理そのものは有限な平均だけを仮定すればよく、より精密な切断の議論で示されるが、チェビシェフによる証明は本質を見渡せる特別な場合である。)
証明
n 個の独立同分布なコピー X(平均 μ、そしてこのチェビシェフに基づく証明のためには有限な分散 σ2 を持つ)に対する標本平均を Xˉn=n1∑i=1nXi とする。期待値の線形性より E[Xˉn]=μ。
独立性により分散は加法的になる:Var(Xˉn)=n21∑i=1nVar(Xi)=nσ2。各 Xi が Var(Xi)=σ2 を寄与し、i=j に対する交差項 Cov(Xi,Xj) は独立性により消えるからである。
任意の ε>0 を固定し、上で証明したチェビシェフの不等式を Xˉn に適用する:P(∣Xˉn−μ∣≥ε)≤ε2Var(Xˉn)=nε2σ2。
n→∞ のとき、固定された任意の ε>0 に対して右辺 σ2/(nε2)→0 となり、これはまさに確率収束の定義である。したがって Xˉn→μ は確率収束する。
この結果の一つの形は、ヤコブ・ベルヌーイによって最初に証明され、彼の死後1713年に Ars Conjectandi で発表された——コイン投げのような繰り返し試行における成功の割合についての、大数の法則の最も早い形である。
発展強法則(強い大数の法則)
定義: 概収束
数列 Yn が c に概収束するとは、P(limn→∞Yn=c)=1 が成り立つことをいう:ほとんどすべての標本点について数列そのものが c に落ち着く、というものであり、これは(一度に一つの n しか制御しない)確率収束より強い条件である。
X1,X2,… を有限な平均 μ を持つ独立同分布な確率変数列とする。このとき Xˉn→μ が概収束する(n→∞ のとき)。
なぜ正しいのか?
古典的な証明(コルモゴロフ、1933年)は、部分和の軌道全体を一度に制御するチェビシェフの強化版であるコルモゴロフの不等式と、部分列に関する議論を組み合わせて用いる。弱法則の一行で済むチェビシェフによる証明よりもかなり繊細である。
証明
ここでは、追加の(教科書でよく使われる)仮定として X が有限な四次モーメント E[X4]<∞ を持つ場合の証明を概説する;一般の主張は有限な平均だけを必要とするが、より繊細な切断の議論(コルモゴロフ、1933年)が必要である。中心化の後、E[X]=0 と仮定し(全体で Xi を Xi−μ に置き換える)、Sn=∑i=1nXi とする。
n4 個の添字の四つ組全体にわたって E[Sn4]=∑i,j,k,lE[XiXjXkXl] を展開する。独立性と E[X]=0 により、ちょうど一度だけ現れる添字を含む項はすべて消える(その因子の期待値が 0 になるため)。残るのは、四つの添字がすべて等しい n 個の項と、異なる二つの等しい添字の組に分かれる 3n(n−1) 個の項だけである。これより E[Sn4]=nE[X4]+3n(n−1)σ4≤Cn2 が得られる。ここで定数 C は E[X4] と σ2 だけに依存する。
n4 で割ると:E[(nSn)4]≤n2C。n について総和を取ると、∑1/n2 が収束するので ∑n=1∞E[(nSn)4]≤∑n=1∞n2C<∞ となる。
非負の確率変数の和で、期待値の総和が有限であるものは、それ自身がほとんど確実に有限でなければならない(単調収束定理)。したがって ∑n=1∞(nSn)4<∞ がほとんど確実に成り立ち、これは各項が消えることを強制する:(nSn)4→0、すなわち nSn→0 がほとんど確実に成り立つ。中心化を元に戻すと Xˉn→μ がほとんど確実に成り立ち、これが強法則である。
発展中心極限定理
σ/nXˉn−μ d N(0,1)as n→∞ X1,…,Xn を平均 μ、有限な分散 σ2>0 を持つ独立同分布な確率変数とする。n→∞ のとき、標準化された標本平均 σ/nXˉn−μ は標準正規分布 N(0,1) に分布収束する——Xi の元の分布の形状によらない。
なぜ正しいのか?
直感的には、標準化された和のモーメント母関数(または特性関数)は、テイラー展開により項ごとに N(0,1) のものへ収束する。標準化によって生き残るのは平均と分散だけであり、それより高次のモーメントは n→∞ で消えていくからである。これが、Xi の元の分布がどのような形であっても同じ釣鐘型が現れる理由である。
証明
確率変数 Z について、その特性関数は φZ(t)=E[eitZ] である。各 Xi を Zi=σXi−μ とおいて標準化すると、E[Zi]=0, E[Zi2]=1 となり、標準化された標本平均はこれらの和になる:Tn=n1∑i=1nZi=σ/nXˉn−μ。
Zi は独立同分布であるから、和の特性関数は積になる:φTn(t)=[φZ(nt)]n。
E[Z]=0 かつ E[Z2]=1 であるから、φZ の 0 近くでのテイラー展開は φZ(s)=1−2s2+o(s2) となる。s=t/n を代入すると:φZ(nt)=1−2nt2+o(n1)。
これを n 乗し、標準的な極限 (1+nc+o(1/n))n→ec を用いると:φTn(t)=[1−2nt2+o(n1)]n→e−t2/2。e−t2/2 はまさに標準正規分布 N(0,1) の特性関数であるから、レヴィの連続性定理により、この特性関数の各点収束は分布収束に変換される:TndN(0,1)。
三つの定理、Xˉn についての三つの問い| 結果 | 答える問い | 主張の種類 |
|---|
| チェビシェフの不等式 | X は μ からどれだけ離れうるか? | 有限標本での評価、任意の分布 |
| 弱法則 | Xˉn は μ に近づくか? | 確率収束 |
| 強法則 | 数列 Xˉn 全体は μ に落ち着くか? | 概収束 |
| 中心極限定理 | Xˉn のゆらぎはどんな形をしているか? | 分布収束、N(0,1) へ |
これらの収束結果は統計学を動かすエンジンである:推定は標本平均から μ の信頼区間をどう作るかを問い、仮説検定は同じ正規近似を使って母集団に関する対立する主張のどちらを選ぶかを問う。
弱法則によれば、n→∞ のとき、独立同分布な確率変数の標本平均 Xˉn(各変数の平均を μ とする)は
チェビシェフの不等式 P(∣X−μ∣≥k)≤σ2/k2 は、X の分布についてどんな仮定を必要とするか。
中心極限定理によれば、標準化された標本平均 (Xˉn−μ)/(σ/n) の分布は、n→∞ のとき、
公平なコインで表が10回連続で出た後、大数の法則が示しているのは