概率与统计
假设检验
一种利用样本数据来判断是否拒绝关于总体的某个论断的方法。
直观直觉:这个证据有说服力吗?
假设一枚硬币被抛掷 20 次,其中 16 次正面朝上。如果这枚硬币是完全均匀的,那么在 20 次中出现 16 次或更多正面是相当罕见的——纯粹由随机性造成的概率只有约 0.6%。这种罕见性正是假设检验的核心思想:先假设一个默认的论断(这里是“硬币是均匀的”),然后问如果这个论断为真,观测到的数据会有多令人惊讶。如果数据非常令人惊讶,这就是反对该论断的证据;如果不是,数据只是与该论断相符,没有理由去怀疑它。
N(0,1) 上的双侧 z 检验:红线标出临界值 ±zα/2,落入绿色接受域之外的观测值将拒绝原假设 H0。中学假设、错误与 p 值
定义: 原假设与备择假设
原假设 H0 是被检验的默认论断(例如 H0:μ=μ0),备择假设 H1 是当 H0 被拒绝时所接受的论断(例如 H1:μ=μ0)。从样本中计算出一个检验统计量,当该统计量落入预先确定的拒绝域时,检验就拒绝 H0;这个拒绝域的选取要使得错误地拒绝为真的 H0 只是很少发生。
可能出现两种错误。第一类错误是在 H0 实际为真时却拒绝了 H0(误报);其概率称为显著性水平 α=P(reject H0∣H0 true),并事先固定,常取 α=0.05。第二类错误是在 H1 实际为真时却未能拒绝 H0(漏报);其概率为 β=P(fail to reject H0∣H1 true),而 1−β 称为检验的功效。
假设检验的四种结果| 决定 | H0 实际为真 | H0 实际为假 |
|---|
| 拒绝 H0 | 第一类错误(概率 α) | 正确决定(功效 1−β) |
| 不拒绝 H0 | 正确决定(概率 1−α) | 第二类错误(概率 β) |
Z=σ/nXˉ−μ0 这是在总体标准差 σ 已知的情况下,用于检验 H0:μ=μ0 的单样本 z 统计量:Xˉ 是样本均值,n 是样本量,σ/n 是均值的标准误。在 H0 成立、且总体服从正态分布(或 n 足够大以使中心极限定理适用)的条件下,Z 服从标准正态分布。
p=2P(Z≥∣zobs∣∣H0) 这里 zobs 是根据实际样本计算出的检验统计量观测值,该公式给出双侧 p 值:假设 H0 为真,在任一方向上观测到至少与 zobs 一样极端的检验统计量的概率。决策规则很简单:若 p≤α 则拒绝 H0,否则不拒绝 H0;p 值越小,反对 H0 的证据就越强。
大学内曼–皮尔逊引理与 z 检验
考虑基于具有似然函数 L(θ) 的数据,检验简单原假设 H0:θ=θ0 对简单备择假设 H1:θ=θ1。设 k≥0 为常数,设 C 为拒绝域,即 C={x:L(θ1)>kL(θ0)},并选取使得 P(C∣H0)=α。那么在所有显著性水平不超过 α 的检验中,拒绝域为 C 的检验在 θ1 处具有最大的功效。
为什么成立?
当似然比 L(θ1)/L(θ0) 较大时拒绝,意味着恰好在相对最符合 θ1 而非 θ0 的那些结果上拒绝;把固定的“预算” α(假阳性风险)花在这些结果上,而不是其他任何结果上,能换来尽可能大的真阳性检测功效。
证明
第一步(设定任意的竞争检验):设 C 为命题中基于似然比的拒绝域,其指示函数为 ϕC;设 D 为满足 P(D∣H0)≤α 的任意其他检验的拒绝域,其指示函数为 ϕD。我们需要证明在 θ1 处的功效满足 P(C∣H1)≥P(D∣H1)。
第二步(一个关键的逐点不等式):对每个结果 x,量 (ϕC(x)−ϕD(x))⋅(L(θ1)−kL(θ0)) 都不会为负。事实上,若 x∈C,则 L(θ1)>kL(θ0),且由 ϕC(x)=1 知 ϕC(x)−ϕD(x)≥0;若 x∈/C,则 L(θ1)≤kL(θ0),且由 ϕC(x)=0 知 ϕC(x)−ϕD(x)≤0;两种情形下两个因子的乘积都 ≥0。
第三步(对不等式求和):对所有结果 x 把这个非负量求和(或积分),得到 ∑x(ϕC(x)−ϕD(x))L(θ1)−k∑x(ϕC(x)−ϕD(x))L(θ0)≥0,可改写为 (P(C∣H1)−P(D∣H1))−k(P(C∣H0)−P(D∣H0))≥0。
第四步(利用显著性水平得出结论):按构造 P(C∣H0)=α,而由假设 P(D∣H0)≤α,故 P(C∣H0)−P(D∣H0)≥0;又因 k≥0,在第三步的第一个括号中减去 k 倍的一个非负量只会使不等式更强,即 P(C∣H1)−P(D∣H1)≥k(P(C∣H0)−P(D∣H0))≥0,从而 P(C∣H1)≥P(D∣H1),即为所证。
设 X1,…,Xn 独立同分布于 N(μ0,σ2),其中 σ 已知,并设 Z=σ/nXˉ−μ0。设 zα/2 是使标准正态分布满足 P(Z>zα/2)=α/2 的值。那么当 ∣Z∣>zα/2 时拒绝 H0:μ=μ0 的检验恰好满足 P(reject H0∣H0)=α。
为什么成立?
拒绝域是直接根据 H0 成立时 Z 的精确分布构造出来的,因此其在 H0 下的概率可以被精确计算,而不仅仅是被界定上限,从而得到一个假阳性率在所选水平 α 上被精确控制、而非仅仅近似控制的检验。
证明
第一步(H0 下 Z 的分布):由于 X1,…,Xn 独立同分布于 N(μ0,σ2),样本均值 Xˉ 服从 N(μ0,σ2/n),标准化后恰好有 Z=σ/nXˉ−μ0∼N(0,1)。
第二步(拒绝事件的概率):拒绝事件为 ∣Z∣>zα/2,它可分解为两个不相交的事件 Z>zα/2 与 Z<−zα/2,故 P(∣Z∣>zα/2)=P(Z>zα/2)+P(Z<−zα/2)。
第三步(利用标准正态分布的对称性):标准正态密度关于 0 对称,故 P(Z<−zα/2)=P(Z>zα/2);由 zα/2 的定义,这两个概率各等于 α/2。
第四步(把两部分相加):代入第二步,得 P(∣Z∣>zα/2)=α/2+α/2=α,由于该概率是(利用第一步)在 H0 下精确计算出来的,故恰好有 P(reject H0∣H0)=α,即为所证。
大学实际应用与典型例题
假设检验是临床试验(判断新药是否优于安慰剂)、软件与市场营销中的 A/B 测试(判断新设计是否提高了转化率)、质量控制(判断生产线是否偏离了规格)以及物理学中使用的发现阈值(判断实验信号是否超出噪声)背后的基础。下面两个例子完整地进行了一次 z 检验,包括计算检验统计量、p 值以及最终决定。
例题: 检验灌装机的平均灌装量
某灌装机应当以平均 μ0=500 毫升的量灌装瓶子,长期记录显示灌装量的标准差为 σ=10 毫升。一个 n=25 瓶的样本,样本均值为 xˉ=495 毫升。在显著性水平 α=0.05 下检验 H0:μ=500 对 H1:μ=500。
解答
第一步:计算标准误,σ/n=10/25=10/5=2。
第二步:计算检验统计量,Z=σ/nxˉ−μ0=2495−500=2−5=−2.5。
第三步:利用标准正态分布计算双侧 p 值,p=2P(Z≥2.5)≈2×0.0062=0.0124。
第四步:比较 p=0.0124 与 α=0.05;由于 p<α,拒绝 H0。有显著证据表明该机器的平均灌装量与 500 毫升不同。
例题: 检验硬币是否偏向正面的单侧检验
抛掷一枚硬币 n=100 次,其中 62 次正面朝上。使用 H0 下标准误 p0(1−p0)/n 的正态近似,在显著性水平 α=0.05 下检验 H0:p=0.5 对单侧备择假设 H1:p>0.5。
解答
第一步:样本比例为 p^=62/100=0.62,在 H0 下标准误为 p0(1−p0)/n=0.5×0.5/100=0.0025=0.05。
第二步:计算检验统计量,Z=p0(1−p0)/np^−p0=0.050.62−0.5=0.050.12=2.4。
第三步:由于备择假设是单侧的(H1:p>0.5),p 值只用标准正态分布的上尾而非双尾,p=P(Z≥2.4)≈0.0082。
第四步:由于 p≈0.0082<α=0.05,拒绝 H0。有显著证据表明这枚硬币偏向正面。
一个 n=16 的样本均值为 xˉ=52,已知总体 μ0=50、σ=8。计算 z 统计量 Z=σ/nxˉ−μ0。
在假设检验中,第一类错误发生在:
在显著性水平 α=0.05 下进行检验,得到 p 值为 0.03。正确的结论是什么?
根据内曼–皮尔逊引理,在固定显著性水平 α 下检验简单原假设 H0:θ=θ0 对简单备择假设 H1:θ=θ1 时,哪个检验的功效最大?