確率と統計
仮説検定
標本データをもとに、母集団についての主張を棄却するかどうかを決める手続き。
直観直感:この証拠は納得できるものか?
コインを 20 回投げて 16 回表が出たとしよう。もしコインが完全に公平であれば、20 回のうち 16 回以上表が出ることはかなり珍しい——偶然にそうなるのは約 0.6% の場合だけである。この珍しさこそが仮説検定の核心である:まず既定の主張(ここでは「コインは公平である」)を仮定し、その主張が正しいとしたら観測されたデータがどれほど驚くべきものかを問う。データが非常に驚くべきものであれば、それは主張に反する証拠であり、そうでなければ、データは単にその主張と整合しており、それを疑う理由はない。
N(0,1) 上の両側 z 検定:赤い縦線が棄却限界値 ±zα/2 を表し、緑の受容域の外に出ると帰無仮説 H0 を棄却する。中高仮説、誤り、そしてp値
定義: 帰無仮説と対立仮説
帰無仮説 H0 は検定される既定の主張であり(例えば H0:μ=μ0)、対立仮説 H1 は H0 が棄却された場合に採用される主張である(例えば H1:μ=μ0)。標本から検定統計量が計算され、その統計量があらかじめ定められた棄却域に入るとき検定は H0 を棄却する。この棄却域は、真の H0 を棄却してしまうことがまれにしか起こらないように選ばれる。
起こりうる誤りには2種類ある。第一種の誤りは、H0 が実際には正しいのに H0 を棄却してしまうことである(誤報)。その確率は有意水準 α=P(reject H0∣H0 true) と呼ばれ、あらかじめ、多くの場合 α=0.05 に固定される。第二種の誤りは、H1 が実際には正しいのに H0 を棄却しないことである(見逃し)。その確率は β=P(fail to reject H0∣H1 true) であり、1−β は検定の検出力と呼ばれる。
仮説検定の4つの結果| 決定 | H0 が実際に真 | H0 が実際に偽 |
|---|
| H0 を棄却する | 第一種の誤り(確率 α) | 正しい決定(検出力 1−β) |
| H0 を棄却しない | 正しい決定(確率 1−α) | 第二種の誤り(確率 β) |
Z=σ/nXˉ−μ0 これは母標準偏差 σ が既知のとき H0:μ=μ0 を検定するための1標本z統計量である:Xˉ は標本平均、n は標本サイズ、σ/n は平均の標準誤差である。H0 のもとで、かつ母集団が正規分布であるか(あるいは中心極限定理が適用できるほど n が十分大きいとき)、Z は標準正規分布に従う。
p=2P(Z≥∣zobs∣∣H0) ここで zobs は実際の標本から計算された検定統計量の観測値であり、この式は両側p値を与える:H0 が正しいと仮定したとき、どちらの方向でも zobs と同じかそれ以上に極端な検定統計量が観測される確率である。決定規則は単純である:p≤α ならば H0 を棄却し、そうでなければ H0 を棄却しない。p値が小さいほど H0 に反する証拠は強い。
大学ネイマン・ピアソンの補題とz検定
尤度関数 L(θ) を持つデータに基づいて、単純な帰無仮説 H0:θ=θ0 を単純な対立仮説 H1:θ=θ1 に対して検定することを考える。k≥0 を定数とし、C を棄却域 C={x:L(θ1)>kL(θ0)} とし、P(C∣H0)=α となるように選ぶ。このとき、有意水準が α 以下であるすべての検定の中で、棄却域 C を持つ検定は θ1 における検出力が最大である。
なぜ正しいのか?
尤度比 L(θ1)/L(θ0) が大きいときに棄却するということは、θ0 と比べて相対的に θ1 に最も整合する結果でちょうど棄却することを意味する。偽陽性リスクという固定された「予算」 α を、他のどの結果でもなくそうした結果に使うことで、得られる真陽性の検出力が最大になる。
証明
第1段階(任意の対抗検定を設定する):C を主張中の尤度比棄却域とし、その指示関数を ϕC とする。また D を P(D∣H0)≤α を満たす他の任意の検定の棄却域とし、その指示関数を ϕD とする。θ1 における検出力が P(C∣H1)≥P(D∣H1) を満たすことを示さなければならない。
第2段階(鍵となる各点での不等式):すべての結果 x について、量 (ϕC(x)−ϕD(x))⋅(L(θ1)−kL(θ0)) は決して負にならない。実際、x∈C ならば L(θ1)>kL(θ0) であり ϕC(x)=1 なので ϕC(x)−ϕD(x)≥0 である。x∈/C ならば L(θ1)≤kL(θ0) であり ϕC(x)=0 なので ϕC(x)−ϕD(x)≤0 である。いずれの場合も2つの因子の積は ≥0 となる。
第3段階(不等式を足し合わせる):この非負の量をすべての結果 x について足し合わせる(あるいは積分する)と、∑x(ϕC(x)−ϕD(x))L(θ1)−k∑x(ϕC(x)−ϕD(x))L(θ0)≥0 となり、これは (P(C∣H1)−P(D∣H1))−k(P(C∣H0)−P(D∣H0))≥0 と書き直せる。
第4段階(有意水準を用いて結論づける):構成により P(C∣H0)=α であり、仮定により P(D∣H0)≤α なので、P(C∣H0)−P(D∣H0)≥0 である。k≥0 なので、第3段階の最初の括弧から非負の量の k 倍を引いても不等式は強まるだけであり、P(C∣H1)−P(D∣H1)≥k(P(C∣H0)−P(D∣H0))≥0 となる。したがって P(C∣H1)≥P(D∣H1) が示された。
X1,…,Xn を独立に N(μ0,σ2) に従うとし(σ は既知)、Z=σ/nXˉ−μ0 とする。標準正規分布について P(Z>zα/2)=α/2 となる値を zα/2 とする。このとき、∣Z∣>zα/2 のとき H0:μ=μ0 を棄却する検定は、ちょうど P(reject H0∣H0)=α を満たす。
なぜ正しいのか?
棄却域は H0 のもとでの Z の正確な分布から直接構成されるため、H0 のもとでのその確率は単に上から抑えるのではなく正確に計算でき、選んだ水準 α で偽陽性率が近似的にではなく厳密に制御された検定が得られる。
証明
第1段階(H0 のもとでの Z の分布):X1,…,Xn が独立に N(μ0,σ2) に従うので、標本平均 Xˉ は N(μ0,σ2/n) に従い、標準化すると Z=σ/nXˉ−μ0∼N(0,1) が正確に成り立つ。
第2段階(棄却事象の確率):棄却事象は ∣Z∣>zα/2 であり、これは互いに素な2つの事象 Z>zα/2 と Z<−zα/2 に分かれるので、P(∣Z∣>zα/2)=P(Z>zα/2)+P(Z<−zα/2) である。
第3段階(標準正規分布の対称性を使う):標準正規密度は 0 について対称なので、P(Z<−zα/2)=P(Z>zα/2) である。zα/2 の定義により、これらの確率はそれぞれ α/2 に等しい。
第4段階(2つの部分を足す):第2段階に代入すると、P(∣Z∣>zα/2)=α/2+α/2=α となり、この確率は(第1段階を使って)H0 のもとで正確に計算されたものなので、主張どおり P(reject H0∣H0)=α が正確に成り立つ。
大学実世界での応用と具体例
仮説検定は、臨床試験(新薬がプラセボより優れているかどうかを決める)、ソフトウェアやマーケティングにおけるA/Bテスト(新しいデザインがコンバージョンを増やすかどうかを決める)、品質管理(生産ラインが規格から外れていないかを決める)、そして物理学で使われる発見の閾値(実験信号が雑音以上のものかどうかを決める)の基盤となっている。以下の2つの例は、検定統計量、p値、最終的な決定の計算を含む完全なz検定を実行する。
例: 充填機の平均充填量を検定する
ある充填機は平均 μ0=500 ml でボトルを充填するはずであり、長期の記録から充填量の標準偏差は σ=10 ml であることがわかっている。n=25 本のボトルの標本平均は xˉ=495 ml であった。有意水準 α=0.05 で H0:μ=500 を H1:μ=500 に対して検定せよ。
解答
第1段階:標準誤差を計算する、σ/n=10/25=10/5=2。
第2段階:検定統計量を計算する、Z=σ/nxˉ−μ0=2495−500=2−5=−2.5。
第3段階:標準正規分布を用いて両側p値を計算する、p=2P(Z≥2.5)≈2×0.0062=0.0124。
第4段階:p=0.0124 と α=0.05 を比較する;p<α なので H0 を棄却する。この機械の平均充填量が 500 ml と異なるという有意な証拠がある。
例: 偏ったコインに対する片側検定
コインを n=100 回投げて 62 回表が出た。H0 のもとでの標準誤差 p0(1−p0)/n を用いた正規近似により、有意水準 α=0.05 で H0:p=0.5 を片側の対立仮説 H1:p>0.5 に対して検定せよ。
解答
第1段階:標本比率は p^=62/100=0.62 であり、H0 のもとでの標準誤差は p0(1−p0)/n=0.5×0.5/100=0.0025=0.05 である。
第2段階:検定統計量を計算する、Z=p0(1−p0)/np^−p0=0.050.62−0.5=0.050.12=2.4。
第3段階:対立仮説が片側(H1:p>0.5)であるため、p値は標準正規分布の両側ではなく上側のみを用いて p=P(Z≥2.4)≈0.0082 となる。
第4段階:p≈0.0082<α=0.05 なので H0 を棄却する。このコインが表に偏っているという有意な証拠がある。
標本サイズ n=16 の標本平均が xˉ=52 であり、母集団は μ0=50、σ=8 であることがわかっている。z統計量 Z=σ/nxˉ−μ0 を計算せよ。
仮説検定において、第一種の誤りが起こるのはどのような場合か:
有意水準 α=0.05 で検定を行い、p値が 0.03 となった。正しい結論はどれか。
ネイマン・ピアソンの補題によれば、固定された有意水準 α で単純な H0:θ=θ0 を単純な H1:θ=θ1 に対して検定するとき、最も検出力が高い検定はどれか。