MathLabs

確率と統計

仮説検定

標本データをもとに、母集団についての主張を棄却するかどうかを決める手続き。

直観直感:この証拠は納得できるものか?

コインを 2020 回投げて 1616 回表が出たとしよう。もしコインが完全に公平であれば、2020 回のうち 1616 回以上表が出ることはかなり珍しい——偶然にそうなるのは約 0.6%0.6\% の場合だけである。この珍しさこそが仮説検定の核心である:まず既定の主張(ここでは「コインは公平である」)を仮定し、その主張が正しいとしたら観測されたデータがどれほど驚くべきものかを問う。データが非常に驚くべきものであれば、それは主張に反する証拠であり、そうでなければ、データは単にその主張と整合しており、それを疑う理由はない。

原点を通り、緩やかな正の傾きを持つ直線を、1次の項だけが有効な退化した3次関数として描いた図。
N(0,1)\mathcal{N}(0,1) 上の両側 zz 検定:赤い縦線が棄却限界値 ±zα/2\pm z_{\alpha/2} を表し、緑の受容域の外に出ると帰無仮説 H0H_0 を棄却する。

中高仮説、誤り、そしてp値

定義: 帰無仮説と対立仮説

帰無仮説 H0H_0 は検定される既定の主張であり(例えば H0:μ=μ0H_0: \mu = \mu_0)、対立仮説 H1H_1 は H0H_0 が棄却された場合に採用される主張である(例えば H1:μ≠μ0H_1: \mu \neq \mu_0)。標本から検定統計量が計算され、その統計量があらかじめ定められた棄却域に入るとき検定は H0H_0 を棄却する。この棄却域は、真の H0H_0 を棄却してしまうことがまれにしか起こらないように選ばれる。

起こりうる誤りには2種類ある。第一種の誤りは、H0H_0 が実際には正しいのに H0H_0 を棄却してしまうことである(誤報)。その確率は有意水準 α=P(reject H0∣H0 true)\alpha = P(\text{reject } H_0 \mid H_0 \text{ true}) と呼ばれ、あらかじめ、多くの場合 α=0.05\alpha = 0.05 に固定される。第二種の誤りは、H1H_1 が実際には正しいのに H0H_0 を棄却しないことである(見逃し)。その確率は β=P(fail to reject H0∣H1 true)\beta = P(\text{fail to reject } H_0 \mid H_1 \text{ true}) であり、1−β1 - \beta は検定の検出力と呼ばれる。

仮説検定の4つの結果
決定H0H_0 が実際に真H0H_0 が実際に偽
H0H_0 を棄却する第一種の誤り(確率 α\alpha)正しい決定(検出力 1−β1 - \beta)
H0H_0 を棄却しない正しい決定(確率 1−α1 - \alpha)第二種の誤り(確率 β\beta)
Z=Xˉ−μ0σ/nZ = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}}

これは母標準偏差 σ\sigma が既知のとき H0:μ=μ0H_0: \mu = \mu_0 を検定するための1標本z統計量である:Xˉ\bar{X} は標本平均、nn は標本サイズ、σ/n\sigma / \sqrt{n} は平均の標準誤差である。H0H_0 のもとで、かつ母集団が正規分布であるか(あるいは中心極限定理が適用できるほど nn が十分大きいとき)、ZZ は標準正規分布に従う。

p=2 P(Z≥∣zobs∣∣H0)p = 2 \, P(Z \geq |z_{\text{obs}}| \mid H_0)

ここで zobsz_{\text{obs}} は実際の標本から計算された検定統計量の観測値であり、この式は両側p値を与える:H0H_0 が正しいと仮定したとき、どちらの方向でも zobsz_{\text{obs}} と同じかそれ以上に極端な検定統計量が観測される確率である。決定規則は単純である:p≤αp \leq \alpha ならば H0H_0 を棄却し、そうでなければ H0H_0 を棄却しない。p値が小さいほど H0H_0 に反する証拠は強い。

大学ネイマン・ピアソンの補題とz検定

尤度関数 L(θ)L(\theta) を持つデータに基づいて、単純な帰無仮説 H0:θ=θ0H_0: \theta = \theta_0 を単純な対立仮説 H1:θ=θ1H_1: \theta = \theta_1 に対して検定することを考える。k≥0k \geq 0 を定数とし、CC を棄却域 C={x:L(θ1)>k L(θ0)}C = \{x : L(\theta_1) > k \, L(\theta_0)\} とし、P(C∣H0)=αP(C \mid H_0) = \alpha となるように選ぶ。このとき、有意水準が α\alpha 以下であるすべての検定の中で、棄却域 CC を持つ検定は θ1\theta_1 における検出力が最大である。

なぜ正しいのか?

尤度比 L(θ1)/L(θ0)L(\theta_1)/L(\theta_0) が大きいときに棄却するということは、θ0\theta_0 と比べて相対的に θ1\theta_1 に最も整合する結果でちょうど棄却することを意味する。偽陽性リスクという固定された「予算」 α\alpha を、他のどの結果でもなくそうした結果に使うことで、得られる真陽性の検出力が最大になる。

証明

第1段階(任意の対抗検定を設定する):CC を主張中の尤度比棄却域とし、その指示関数を ϕC\phi_C とする。また DD を P(D∣H0)≤αP(D \mid H_0) \leq \alpha を満たす他の任意の検定の棄却域とし、その指示関数を ϕD\phi_D とする。θ1\theta_1 における検出力が P(C∣H1)≥P(D∣H1)P(C \mid H_1) \geq P(D \mid H_1) を満たすことを示さなければならない。

第2段階(鍵となる各点での不等式):すべての結果 xx について、量 (ϕC(x)−ϕD(x))⋅(L(θ1)−k L(θ0))(\phi_C(x) - \phi_D(x)) \cdot (L(\theta_1) - k \, L(\theta_0)) は決して負にならない。実際、x∈Cx \in C ならば L(θ1)>k L(θ0)L(\theta_1) > k \, L(\theta_0) であり ϕC(x)=1\phi_C(x) = 1 なので ϕC(x)−ϕD(x)≥0\phi_C(x) - \phi_D(x) \geq 0 である。x∉Cx \notin C ならば L(θ1)≤k L(θ0)L(\theta_1) \leq k \, L(\theta_0) であり ϕC(x)=0\phi_C(x) = 0 なので ϕC(x)−ϕD(x)≤0\phi_C(x) - \phi_D(x) \leq 0 である。いずれの場合も2つの因子の積は ≥0\geq 0 となる。

第3段階(不等式を足し合わせる):この非負の量をすべての結果 xx について足し合わせる(あるいは積分する)と、∑x(ϕC(x)−ϕD(x)) L(θ1)−k∑x(ϕC(x)−ϕD(x)) L(θ0)≥0\sum_x (\phi_C(x) - \phi_D(x)) \, L(\theta_1) - k \sum_x (\phi_C(x) - \phi_D(x)) \, L(\theta_0) \geq 0 となり、これは (P(C∣H1)−P(D∣H1))−k(P(C∣H0)−P(D∣H0))≥0\big(P(C \mid H_1) - P(D \mid H_1)\big) - k \big(P(C \mid H_0) - P(D \mid H_0)\big) \geq 0 と書き直せる。

第4段階(有意水準を用いて結論づける):構成により P(C∣H0)=αP(C \mid H_0) = \alpha であり、仮定により P(D∣H0)≤αP(D \mid H_0) \leq \alpha なので、P(C∣H0)−P(D∣H0)≥0P(C \mid H_0) - P(D \mid H_0) \geq 0 である。k≥0k \geq 0 なので、第3段階の最初の括弧から非負の量の kk 倍を引いても不等式は強まるだけであり、P(C∣H1)−P(D∣H1)≥k(P(C∣H0)−P(D∣H0))≥0P(C \mid H_1) - P(D \mid H_1) \geq k \big(P(C \mid H_0) - P(D \mid H_0)\big) \geq 0 となる。したがって P(C∣H1)≥P(D∣H1)P(C \mid H_1) \geq P(D \mid H_1) が示された。

X1,…,XnX_1, \ldots, X_n を独立に N(μ0,σ2)N(\mu_0, \sigma^2) に従うとし(σ\sigma は既知)、Z=Xˉ−μ0σ/nZ = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}} とする。標準正規分布について P(Z>zα/2)=α/2P(Z > z_{\alpha/2}) = \alpha/2 となる値を zα/2z_{\alpha/2} とする。このとき、∣Z∣>zα/2|Z| > z_{\alpha/2} のとき H0:μ=μ0H_0: \mu = \mu_0 を棄却する検定は、ちょうど P(reject H0∣H0)=αP(\text{reject } H_0 \mid H_0) = \alpha を満たす。

なぜ正しいのか?

棄却域は H0H_0 のもとでの ZZ の正確な分布から直接構成されるため、H0H_0 のもとでのその確率は単に上から抑えるのではなく正確に計算でき、選んだ水準 α\alpha で偽陽性率が近似的にではなく厳密に制御された検定が得られる。

証明

第1段階(H0H_0 のもとでの ZZ の分布):X1,…,XnX_1, \ldots, X_n が独立に N(μ0,σ2)N(\mu_0, \sigma^2) に従うので、標本平均 Xˉ\bar{X} は N(μ0,σ2/n)N(\mu_0, \sigma^2/n) に従い、標準化すると Z=Xˉ−μ0σ/n∼N(0,1)Z = \frac{\bar{X} - \mu_0}{\sigma/\sqrt{n}} \sim N(0, 1) が正確に成り立つ。

第2段階(棄却事象の確率):棄却事象は ∣Z∣>zα/2|Z| > z_{\alpha/2} であり、これは互いに素な2つの事象 Z>zα/2Z > z_{\alpha/2} と Z<−zα/2Z < -z_{\alpha/2} に分かれるので、P(∣Z∣>zα/2)=P(Z>zα/2)+P(Z<−zα/2)P(|Z| > z_{\alpha/2}) = P(Z > z_{\alpha/2}) + P(Z < -z_{\alpha/2}) である。

第3段階(標準正規分布の対称性を使う):標準正規密度は 00 について対称なので、P(Z<−zα/2)=P(Z>zα/2)P(Z < -z_{\alpha/2}) = P(Z > z_{\alpha/2}) である。zα/2z_{\alpha/2} の定義により、これらの確率はそれぞれ α/2\alpha/2 に等しい。

第4段階(2つの部分を足す):第2段階に代入すると、P(∣Z∣>zα/2)=α/2+α/2=αP(|Z| > z_{\alpha/2}) = \alpha/2 + \alpha/2 = \alpha となり、この確率は(第1段階を使って)H0H_0 のもとで正確に計算されたものなので、主張どおり P(reject H0∣H0)=αP(\text{reject } H_0 \mid H_0) = \alpha が正確に成り立つ。

大学実世界での応用と具体例

仮説検定は、臨床試験(新薬がプラセボより優れているかどうかを決める)、ソフトウェアやマーケティングにおけるA/Bテスト(新しいデザインがコンバージョンを増やすかどうかを決める)、品質管理(生産ラインが規格から外れていないかを決める)、そして物理学で使われる発見の閾値(実験信号が雑音以上のものかどうかを決める)の基盤となっている。以下の2つの例は、検定統計量、p値、最終的な決定の計算を含む完全なz検定を実行する。

例: 充填機の平均充填量を検定する

ある充填機は平均 μ0=500\mu_0 = 500 ml でボトルを充填するはずであり、長期の記録から充填量の標準偏差は σ=10\sigma = 10 ml であることがわかっている。n=25n = 25 本のボトルの標本平均は xˉ=495\bar{x} = 495 ml であった。有意水準 α=0.05\alpha = 0.05 で H0:μ=500H_0: \mu = 500 を H1:μ≠500H_1: \mu \neq 500 に対して検定せよ。

解答

第1段階:標準誤差を計算する、σ/n=10/25=10/5=2\sigma / \sqrt{n} = 10 / \sqrt{25} = 10 / 5 = 2。

第2段階:検定統計量を計算する、Z=xˉ−μ0σ/n=495−5002=−52=−2.5Z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}} = \frac{495 - 500}{2} = \frac{-5}{2} = -2.5。

第3段階:標準正規分布を用いて両側p値を計算する、p=2 P(Z≥2.5)≈2×0.0062=0.0124p = 2 \, P(Z \geq 2.5) \approx 2 \times 0.0062 = 0.0124。

第4段階:p=0.0124p = 0.0124 と α=0.05\alpha = 0.05 を比較する;p<αp < \alpha なので H0H_0 を棄却する。この機械の平均充填量が 500500 ml と異なるという有意な証拠がある。

例: 偏ったコインに対する片側検定

コインを n=100n = 100 回投げて 6262 回表が出た。H0H_0 のもとでの標準誤差 p0(1−p0)/n\sqrt{p_0 (1 - p_0) / n} を用いた正規近似により、有意水準 α=0.05\alpha = 0.05 で H0:p=0.5H_0: p = 0.5 を片側の対立仮説 H1:p>0.5H_1: p > 0.5 に対して検定せよ。

解答

第1段階:標本比率は p^=62/100=0.62\hat{p} = 62/100 = 0.62 であり、H0H_0 のもとでの標準誤差は p0(1−p0)/n=0.5×0.5/100=0.0025=0.05\sqrt{p_0 (1 - p_0) / n} = \sqrt{0.5 \times 0.5 / 100} = \sqrt{0.0025} = 0.05 である。

第2段階:検定統計量を計算する、Z=p^−p0p0(1−p0)/n=0.62−0.50.05=0.120.05=2.4Z = \frac{\hat{p} - p_0}{\sqrt{p_0 (1 - p_0) / n}} = \frac{0.62 - 0.5}{0.05} = \frac{0.12}{0.05} = 2.4。

第3段階:対立仮説が片側(H1:p>0.5H_1: p > 0.5)であるため、p値は標準正規分布の両側ではなく上側のみを用いて p=P(Z≥2.4)≈0.0082p = P(Z \geq 2.4) \approx 0.0082 となる。

第4段階:p≈0.0082<α=0.05p \approx 0.0082 < \alpha = 0.05 なので H0H_0 を棄却する。このコインが表に偏っているという有意な証拠がある。

標本サイズ n=16n = 16 の標本平均が xˉ=52\bar{x} = 52 であり、母集団は μ0=50\mu_0 = 50、σ=8\sigma = 8 であることがわかっている。z統計量 Z=xˉ−μ0σ/nZ = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}} を計算せよ。

仮説検定において、第一種の誤りが起こるのはどのような場合か:

有意水準 α=0.05\alpha = 0.05 で検定を行い、p値が 0.030.03 となった。正しい結論はどれか。

ネイマン・ピアソンの補題によれば、固定された有意水準 α\alpha で単純な H0:θ=θ0H_0: \theta = \theta_0 を単純な H1:θ=θ1H_1: \theta = \theta_1 に対して検定するとき、最も検出力が高い検定はどれか。