MathLabs

確率と統計

確率変数と分布

ランダムな実験の数値的な結果を、各値が起こる確率で記述したもの。

直観直感:偶然を数に変える

コインを投げる、サイコロを振る、次に部屋に入ってくる人の身長を測る——こうしたランダムな実験にはどれも事前に予測できない結果がある。確率変数とは、起こりうるすべての結果に数を割り当てる規則にすぎない。曖昧な結果の代わりに数を扱えるので、足したり平均を取ったりグラフに描いたりできる。

二項分布の棒グラフにガウス近似曲線を重ねた図。
二項分布 Bin(n,p)\mathrm{Bin}(n, p)(紫の棒)とガウス正規近似曲線(橙):nn と pp を動かして平均 npnp と広がり np(1−p)\sqrt{np(1-p)} の変化を見よう。

中高離散確率変数と連続確率変数

定義: 離散確率変数

確率変数 XX が有限個または可算個の値だけを取り、それぞれの値が独自の確率を持つとき、離散確率変数と呼ぶ。その確率質量関数(PMF)は P(X=x)P(X=x) であり、XX は必ずどれかの値を取るので、取りうるすべての値の確率の合計は1になる。

∑xP(X=x)=1\sum_x P(X=x) = 1

最も有名な離散分布は、独立に繰り返される試行における成功回数を数えるものである。ある試行が確率 pp で成功し、それを nn 回繰り返すとき、成功回数 XX は二項分布に従う。

P(X=k)=(nk)pk(1−p)n−kP(X=k) = \binom{n}{k}p^k(1-p)^{n-k}

ここで nn は固定された試行回数、pp は各試行の成功確率、(nk)\binom{n}{k} は nn 回の試行の中で kk 回の成功をどのように配置できるかの場合の数を表す。どの配置も kk 回の成功と n−kn-k 回の失敗を与えるからである。

定義: 連続確率変数

連続確率変数は実数のある区間内の任意の値を取りうるため、どの一点 xx についても P(X=x)=0P(X=x)=0 となる。PMF の代わりに確率密度関数(PDF)f(x)f(x) を持ち、確率は ff のグラフの下、ある区間にわたる面積として得られる。

f(x)=1σ2πe−(x−μ)2/2σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/2\sigma^2}

これは正規(ガウス)密度である。μ\mu は平均であり、ベルの中心を示す。σ\sigma は標準偏差で、ベルの幅の広さを決める。多くの測定誤差や自然な量はこの曲線でよく近似される。

離散確率変数と連続確率変数の比較
観点離散連続
記述する関数確率質量関数 P(X=x)P(X=x)確率密度関数 f(x)f(x)
ちょうど一点での確率正になりうる常に 00
確率の計算方法和:∑xP(X=x)\sum_x P(X=x)積分:∫abf(x) dx\int_a^b f(x)\,dx
典型例二項分布(成功回数)正規分布(測定値)

大学期待値と分散

期待値 E[X]E[X] とは、実験を何度も繰り返したときの XX の長期的な平均値であり、各値をその起こりやすさで重み付けしたものである。

E[X]=∑xxP(X=x)E[X] = \sum_x xP(X=x)

各値 xx にその確率 P(X=x)P(X=x) を掛けて合計する。期待値は線形性を持ち、定数 a,ba,b に対して E[aX+b]=aE[X]+bE[aX+b] = aE[X]+b が成り立つ。分散は XX が E[X]E[X] の周りにどれだけ散らばっているかを測る量であり、次のショートカット公式で最も簡単に計算できる。

Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2

この式は、分散が X2X^2 の平均から XX の平均の二乗を引いたものに等しいことを意味する。標準偏差 σ=Var(X)\sigma = \sqrt{\mathrm{Var}(X)} は、この散らばりを XX 自体と同じ単位に戻したものである。

XX が試行回数 nn、成功確率 pp の二項分布に従うならば、E[X]=npE[X] = np である。

なぜ正しいのか?

二項の計数は多数の小さな「はい/いいえ」の試行の和にすぎず、和の期待値は試行同士がどう関わっていようと常に期待値の和に等しい。したがって一回の試行の平均的な寄与だけを求めればよい。

証明

X=X1+X2+⋯+XnX = X_1 + X_2 + \cdots + X_n と書く。ここで XiX_i は ii 番目の試行が成功すれば 11、そうでなければ 00 である。各 XiX_i は P(Xi=1)=pP(X_i=1)=p、P(Xi=0)=1−pP(X_i=0)=1-p のベルヌーイ確率変数であり、その期待値は E[Xi]=1⋅p+0⋅(1−p)=pE[X_i] = 1\cdot p + 0\cdot(1-p) = p となる。

期待値は、独立であるか否かにかかわらず、任意の確率変数に対して線形性を持つ:E[X1+X2+⋯+Xn]=E[X1]+E[X2]+⋯+E[Xn]E[X_1+X_2+\cdots+X_n] = E[X_1]+E[X_2]+\cdots+E[X_n]。この線形性は、期待値が重み付き和として定義されることから直接従う。和や重み付き和は常に並べ替えられるからである。

この線形性を X=X1+⋯+XnX = X_1+\cdots+X_n に適用すると E[X]=E[X1]+⋯+E[Xn]=p+p+⋯+p⏟n times=npE[X] = E[X_1]+\cdots+E[X_n] = \underbrace{p+p+\cdots+p}_{n \text{ times}} = np となり、主張した公式と一致する。

平均が有限な任意の確率変数 XX に対して Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2 が成り立つ。

なぜ正しいのか?

分散の定義には差の二乗が含まれており、直接計算するのは面倒である。その二乗を展開し期待値の線形性を使うことで、すでに計算方法を知っている二つの量、E[X2]E[X^2] と E[X]E[X] に置き換えることができる。

証明

定義により Var(X)=E[(X−μ)2]\mathrm{Var}(X) = E[(X-\mu)^2](μ=E[X]\mu = E[X])である。期待値の中の二乗を展開すると (X−μ)2=X2−2μX+μ2(X-\mu)^2 = X^2 - 2\mu X + \mu^2 となる。

期待値の線形性を各項に適用すると E[(X−μ)2]=E[X2]−2μE[X]+μ2E[(X-\mu)^2] = E[X^2] - 2\mu E[X] + \mu^2 となる。μ\mu は定数(結果に依存しない)なので、中間項と最後の項では期待値の外に出すことができる。

ここで E[X]=μE[X] = \mu を代入し直すと、E[X2]−2μ⋅μ+μ2=E[X2]−2μ2+μ2=E[X2]−μ2E[X^2] - 2\mu\cdot\mu + \mu^2 = E[X^2] - 2\mu^2 + \mu^2 = E[X^2] - \mu^2 となる。μ\mu を E[X]E[X] に置き換えれば、主張どおり Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2 が得られる。

大学実世界での応用と具体例

二項変数はいたるところで合格/不合格の回数をモデル化する:生産ラインの不良品、広告のクリック数、DNA鎖の変異など。正規変数は多くの小さな独立な影響から構成される量をモデル化する:測定誤差、人の身長、ポートフォリオの収益率、電子機器の背景雑音など。どちらも、エンジニアや科学者、アナリストが「ランダムさ」という曖昧な概念を計算可能な数に変えるのに役立つ。

例: 生産ラインの不良電球

ある工場は電球をロットごとに出荷している。各電球は独立に確率 p=0.1p = 0.1 で不良品となる。n=8n = 8 個の電球からなるロットで、ちょうど k=2k = 2 個が不良品である確率はいくらか。

解答

不良電球の個数 XX は n=8n=8、p=0.1p=0.1 の二項分布に従う。各電球は独立な試行であり、不良品かそうでないかのいずれかだからである。

PMFに代入すると P(X=2)=(82)(0.1)2(0.9)6P(X=2) = \binom{8}{2}(0.1)^2(0.9)^6 となる。二項係数は (82)=28\binom{8}{2} = 28 で、8個のうちどの2個が不良品かを選ぶ場合の数を表す。

べき乗を計算すると (0.1)2=0.01(0.1)^2 = 0.01、(0.9)6≈0.531441(0.9)^6 \approx 0.531441 なので、P(X=2)=28×0.01×0.531441≈0.1488P(X=2) = 28 \times 0.01 \times 0.531441 \approx 0.1488 となる。ロット内でちょうど2個の電球が不良になる確率は約15%である。

例: 身長と正規分布

ある集団の成人男性の身長は、平均 μ=170\mu = 170(cm)、標準偏差 σ=6\sigma = 6(cm)のほぼ正規分布に従う。身長が 164164 cmから 176176 cmの間にある男性はおよそ何割か。

解答

Z=X−μσZ = \frac{X-\mu}{\sigma} を用いて、二つの境界の身長を zz スコアに変換する。X=164X=164 のとき z1=164−1706=−1z_1 = \frac{164-170}{6} = -1、X=176X=176 のとき z2=176−1706=1z_2 = \frac{176-170}{6} = 1 となる。

区間 164<X<176164 < X < 176 は、標準化した単位で言えばちょうど平均から標準偏差1つ分の範囲、すなわち −1<Z<1-1 < Z < 1 に当たる。

標準正規曲線について、経験則(正規PDFを積分して得られる)により P(−1<Z<1)≈0.6827P(-1 < Z < 1) \approx 0.6827 となるので、身長がその範囲に入る男性はおよそ68%である。

X∼Binomial(n=5,p=0.4)X \sim \mathrm{Binomial}(n=5, p=0.4) とする。P(X=2)P(X=2) はいくらか。

離散PMFと連続PDFの違いを正しく述べているのはどれか。

離散確率変数が X∈{0,1,2}X \in \{0,1,2\} を満たし、P(X=0)=0.2P(X=0)=0.2、P(X=1)=0.5P(X=1)=0.5、P(X=2)=0.3P(X=2)=0.3 であるとする。E[X]E[X] はいくらか。

標準化テストの得点は μ=500\mu = 500、σ=100\sigma = 100 のほぼ正規分布に従う。経験則を使うと、600600 点を超える受験者の割合はおよそどれくらいか。

参考文献

  1. Charles M. Grinstead, J. Laurie Snell (1997). Introduction to Probability
  2. Sheldon Ross (2019). A First Course in Probability