MathLabs

概率与统计

假设检验

一种利用样本数据来判断是否拒绝关于总体的某个论断的方法。

直观直觉:这个证据有说服力吗?

假设一枚硬币被抛掷 2020 次,其中 1616 次正面朝上。如果这枚硬币是完全均匀的,那么在 2020 次中出现 1616 次或更多正面是相当罕见的——纯粹由随机性造成的概率只有约 0.6%0.6\%。这种罕见性正是假设检验的核心思想:先假设一个默认的论断(这里是“硬币是均匀的”),然后问如果这个论断为真,观测到的数据会有多令人惊讶。如果数据非常令人惊讶,这就是反对该论断的证据;如果不是,数据只是与该论断相符,没有理由去怀疑它。

一条经过原点、斜率为适中正值的直线,以只保留一次项的退化三次函数形式绘制。
N(0,1)\mathcal{N}(0,1) 上的双侧 zz 检验:红线标出临界值 ±zα/2\pm z_{\alpha/2},落入绿色接受域之外的观测值将拒绝原假设 H0H_0。

中学假设、错误与 p 值

定义: 原假设与备择假设

原假设 H0H_0 是被检验的默认论断(例如 H0:μ=μ0H_0: \mu = \mu_0),备择假设 H1H_1 是当 H0H_0 被拒绝时所接受的论断(例如 H1:μ≠μ0H_1: \mu \neq \mu_0)。从样本中计算出一个检验统计量,当该统计量落入预先确定的拒绝域时,检验就拒绝 H0H_0;这个拒绝域的选取要使得错误地拒绝为真的 H0H_0 只是很少发生。

可能出现两种错误。第一类错误是在 H0H_0 实际为真时却拒绝了 H0H_0(误报);其概率称为显著性水平 α=P(reject H0∣H0 true)\alpha = P(\text{reject } H_0 \mid H_0 \text{ true}),并事先固定,常取 α=0.05\alpha = 0.05。第二类错误是在 H1H_1 实际为真时却未能拒绝 H0H_0(漏报);其概率为 β=P(fail to reject H0∣H1 true)\beta = P(\text{fail to reject } H_0 \mid H_1 \text{ true}),而 1−β1 - \beta 称为检验的功效。

假设检验的四种结果
决定H0H_0 实际为真H0H_0 实际为假
拒绝 H0H_0第一类错误(概率 α\alpha)正确决定(功效 1−β1 - \beta)
不拒绝 H0H_0正确决定(概率 1−α1 - \alpha)第二类错误(概率 β\beta)
Z=Xˉ−μ0σ/nZ = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}}

这是在总体标准差 σ\sigma 已知的情况下,用于检验 H0:μ=μ0H_0: \mu = \mu_0 的单样本 z 统计量:Xˉ\bar{X} 是样本均值,nn 是样本量,σ/n\sigma / \sqrt{n} 是均值的标准误。在 H0H_0 成立、且总体服从正态分布(或 nn 足够大以使中心极限定理适用)的条件下,ZZ 服从标准正态分布。

p=2 P(Z≥∣zobs∣∣H0)p = 2 \, P(Z \geq |z_{\text{obs}}| \mid H_0)

这里 zobsz_{\text{obs}} 是根据实际样本计算出的检验统计量观测值,该公式给出双侧 p 值:假设 H0H_0 为真,在任一方向上观测到至少与 zobsz_{\text{obs}} 一样极端的检验统计量的概率。决策规则很简单:若 p≤αp \leq \alpha 则拒绝 H0H_0,否则不拒绝 H0H_0;p 值越小,反对 H0H_0 的证据就越强。

大学内曼–皮尔逊引理与 z 检验

考虑基于具有似然函数 L(θ)L(\theta) 的数据,检验简单原假设 H0:θ=θ0H_0: \theta = \theta_0 对简单备择假设 H1:θ=θ1H_1: \theta = \theta_1。设 k≥0k \geq 0 为常数,设 CC 为拒绝域,即 C={x:L(θ1)>k L(θ0)}C = \{x : L(\theta_1) > k \, L(\theta_0)\},并选取使得 P(C∣H0)=αP(C \mid H_0) = \alpha。那么在所有显著性水平不超过 α\alpha 的检验中,拒绝域为 CC 的检验在 θ1\theta_1 处具有最大的功效。

为什么成立?

当似然比 L(θ1)/L(θ0)L(\theta_1)/L(\theta_0) 较大时拒绝,意味着恰好在相对最符合 θ1\theta_1 而非 θ0\theta_0 的那些结果上拒绝;把固定的“预算” α\alpha(假阳性风险)花在这些结果上,而不是其他任何结果上,能换来尽可能大的真阳性检测功效。

证明

第一步(设定任意的竞争检验):设 CC 为命题中基于似然比的拒绝域,其指示函数为 ϕC\phi_C;设 DD 为满足 P(D∣H0)≤αP(D \mid H_0) \leq \alpha 的任意其他检验的拒绝域,其指示函数为 ϕD\phi_D。我们需要证明在 θ1\theta_1 处的功效满足 P(C∣H1)≥P(D∣H1)P(C \mid H_1) \geq P(D \mid H_1)。

第二步(一个关键的逐点不等式):对每个结果 xx,量 (ϕC(x)−ϕD(x))⋅(L(θ1)−k L(θ0))(\phi_C(x) - \phi_D(x)) \cdot (L(\theta_1) - k \, L(\theta_0)) 都不会为负。事实上,若 x∈Cx \in C,则 L(θ1)>k L(θ0)L(\theta_1) > k \, L(\theta_0),且由 ϕC(x)=1\phi_C(x) = 1 知 ϕC(x)−ϕD(x)≥0\phi_C(x) - \phi_D(x) \geq 0;若 x∉Cx \notin C,则 L(θ1)≤k L(θ0)L(\theta_1) \leq k \, L(\theta_0),且由 ϕC(x)=0\phi_C(x) = 0 知 ϕC(x)−ϕD(x)≤0\phi_C(x) - \phi_D(x) \leq 0;两种情形下两个因子的乘积都 ≥0\geq 0。

第三步(对不等式求和):对所有结果 xx 把这个非负量求和(或积分),得到 ∑x(ϕC(x)−ϕD(x)) L(θ1)−k∑x(ϕC(x)−ϕD(x)) L(θ0)≥0\sum_x (\phi_C(x) - \phi_D(x)) \, L(\theta_1) - k \sum_x (\phi_C(x) - \phi_D(x)) \, L(\theta_0) \geq 0,可改写为 (P(C∣H1)−P(D∣H1))−k(P(C∣H0)−P(D∣H0))≥0\big(P(C \mid H_1) - P(D \mid H_1)\big) - k \big(P(C \mid H_0) - P(D \mid H_0)\big) \geq 0。

第四步(利用显著性水平得出结论):按构造 P(C∣H0)=αP(C \mid H_0) = \alpha,而由假设 P(D∣H0)≤αP(D \mid H_0) \leq \alpha,故 P(C∣H0)−P(D∣H0)≥0P(C \mid H_0) - P(D \mid H_0) \geq 0;又因 k≥0k \geq 0,在第三步的第一个括号中减去 kk 倍的一个非负量只会使不等式更强,即 P(C∣H1)−P(D∣H1)≥k(P(C∣H0)−P(D∣H0))≥0P(C \mid H_1) - P(D \mid H_1) \geq k \big(P(C \mid H_0) - P(D \mid H_0)\big) \geq 0,从而 P(C∣H1)≥P(D∣H1)P(C \mid H_1) \geq P(D \mid H_1),即为所证。

设 X1,…,XnX_1, \ldots, X_n 独立同分布于 N(μ0,σ2)N(\mu_0, \sigma^2),其中 σ\sigma 已知,并设 Z=Xˉ−μ0σ/nZ = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}}。设 zα/2z_{\alpha/2} 是使标准正态分布满足 P(Z>zα/2)=α/2P(Z > z_{\alpha/2}) = \alpha/2 的值。那么当 ∣Z∣>zα/2|Z| > z_{\alpha/2} 时拒绝 H0:μ=μ0H_0: \mu = \mu_0 的检验恰好满足 P(reject H0∣H0)=αP(\text{reject } H_0 \mid H_0) = \alpha。

为什么成立?

拒绝域是直接根据 H0H_0 成立时 ZZ 的精确分布构造出来的,因此其在 H0H_0 下的概率可以被精确计算,而不仅仅是被界定上限,从而得到一个假阳性率在所选水平 α\alpha 上被精确控制、而非仅仅近似控制的检验。

证明

第一步(H0H_0 下 ZZ 的分布):由于 X1,…,XnX_1, \ldots, X_n 独立同分布于 N(μ0,σ2)N(\mu_0, \sigma^2),样本均值 Xˉ\bar{X} 服从 N(μ0,σ2/n)N(\mu_0, \sigma^2/n),标准化后恰好有 Z=Xˉ−μ0σ/n∼N(0,1)Z = \frac{\bar{X} - \mu_0}{\sigma/\sqrt{n}} \sim N(0, 1)。

第二步(拒绝事件的概率):拒绝事件为 ∣Z∣>zα/2|Z| > z_{\alpha/2},它可分解为两个不相交的事件 Z>zα/2Z > z_{\alpha/2} 与 Z<−zα/2Z < -z_{\alpha/2},故 P(∣Z∣>zα/2)=P(Z>zα/2)+P(Z<−zα/2)P(|Z| > z_{\alpha/2}) = P(Z > z_{\alpha/2}) + P(Z < -z_{\alpha/2})。

第三步(利用标准正态分布的对称性):标准正态密度关于 00 对称,故 P(Z<−zα/2)=P(Z>zα/2)P(Z < -z_{\alpha/2}) = P(Z > z_{\alpha/2});由 zα/2z_{\alpha/2} 的定义,这两个概率各等于 α/2\alpha/2。

第四步(把两部分相加):代入第二步,得 P(∣Z∣>zα/2)=α/2+α/2=αP(|Z| > z_{\alpha/2}) = \alpha/2 + \alpha/2 = \alpha,由于该概率是(利用第一步)在 H0H_0 下精确计算出来的,故恰好有 P(reject H0∣H0)=αP(\text{reject } H_0 \mid H_0) = \alpha,即为所证。

大学实际应用与典型例题

假设检验是临床试验(判断新药是否优于安慰剂)、软件与市场营销中的 A/B 测试(判断新设计是否提高了转化率)、质量控制(判断生产线是否偏离了规格)以及物理学中使用的发现阈值(判断实验信号是否超出噪声)背后的基础。下面两个例子完整地进行了一次 z 检验,包括计算检验统计量、p 值以及最终决定。

例题: 检验灌装机的平均灌装量

某灌装机应当以平均 μ0=500\mu_0 = 500 毫升的量灌装瓶子,长期记录显示灌装量的标准差为 σ=10\sigma = 10 毫升。一个 n=25n = 25 瓶的样本,样本均值为 xˉ=495\bar{x} = 495 毫升。在显著性水平 α=0.05\alpha = 0.05 下检验 H0:μ=500H_0: \mu = 500 对 H1:μ≠500H_1: \mu \neq 500。

解答

第一步:计算标准误,σ/n=10/25=10/5=2\sigma / \sqrt{n} = 10 / \sqrt{25} = 10 / 5 = 2。

第二步:计算检验统计量,Z=xˉ−μ0σ/n=495−5002=−52=−2.5Z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}} = \frac{495 - 500}{2} = \frac{-5}{2} = -2.5。

第三步:利用标准正态分布计算双侧 p 值,p=2 P(Z≥2.5)≈2×0.0062=0.0124p = 2 \, P(Z \geq 2.5) \approx 2 \times 0.0062 = 0.0124。

第四步:比较 p=0.0124p = 0.0124 与 α=0.05\alpha = 0.05;由于 p<αp < \alpha,拒绝 H0H_0。有显著证据表明该机器的平均灌装量与 500500 毫升不同。

例题: 检验硬币是否偏向正面的单侧检验

抛掷一枚硬币 n=100n = 100 次,其中 6262 次正面朝上。使用 H0H_0 下标准误 p0(1−p0)/n\sqrt{p_0 (1 - p_0) / n} 的正态近似,在显著性水平 α=0.05\alpha = 0.05 下检验 H0:p=0.5H_0: p = 0.5 对单侧备择假设 H1:p>0.5H_1: p > 0.5。

解答

第一步:样本比例为 p^=62/100=0.62\hat{p} = 62/100 = 0.62,在 H0H_0 下标准误为 p0(1−p0)/n=0.5×0.5/100=0.0025=0.05\sqrt{p_0 (1 - p_0) / n} = \sqrt{0.5 \times 0.5 / 100} = \sqrt{0.0025} = 0.05。

第二步:计算检验统计量,Z=p^−p0p0(1−p0)/n=0.62−0.50.05=0.120.05=2.4Z = \frac{\hat{p} - p_0}{\sqrt{p_0 (1 - p_0) / n}} = \frac{0.62 - 0.5}{0.05} = \frac{0.12}{0.05} = 2.4。

第三步:由于备择假设是单侧的(H1:p>0.5H_1: p > 0.5),p 值只用标准正态分布的上尾而非双尾,p=P(Z≥2.4)≈0.0082p = P(Z \geq 2.4) \approx 0.0082。

第四步:由于 p≈0.0082<α=0.05p \approx 0.0082 < \alpha = 0.05,拒绝 H0H_0。有显著证据表明这枚硬币偏向正面。

一个 n=16n = 16 的样本均值为 xˉ=52\bar{x} = 52,已知总体 μ0=50\mu_0 = 50、σ=8\sigma = 8。计算 z 统计量 Z=xˉ−μ0σ/nZ = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}。

在假设检验中,第一类错误发生在:

在显著性水平 α=0.05\alpha = 0.05 下进行检验,得到 p 值为 0.030.03。正确的结论是什么?

根据内曼–皮尔逊引理,在固定显著性水平 α\alpha 下检验简单原假设 H0:θ=θ0H_0: \theta = \theta_0 对简单备择假设 H1:θ=θ1H_1: \theta = \theta_1 时,哪个检验的功效最大?