MathLabs

概率与统计

估计

利用样本数据推断总体未知参数,包括点估计与区间估计。

直观从一把样本到整体

想象从一大锅汤中舀一勺来判断整锅汤的咸淡。你不需要喝完整锅汤——一勺有代表性的样本(样本)就足以估计整锅汤(总体)的咸淡。估计就是把这一勺样本变成一个可信猜测的数学方法,并给出这个猜测可能偏离多少的说法。

钟形曲线示意随样本量增大,抽样分布在均值附近变窄。
标准正态抽样分布 N(0,1)\mathcal{N}(0,1) 及其中央绿色置信区间 [−z,+z][-z, +z]:拖动 pp 增减置信水平宽度。

中学点估计:一个最佳的单一猜测

定义: 点估计量

点估计量是由样本数据计算出的一个单一数值,用作对总体未知参数的最佳猜测。要估计总体均值 μ\mu,自然的点估计量就是样本均值 Xˉ\bar X:观测值 X1,…,XnX_1,\dots,X_n 的平均数。

Xˉ=1n∑i=1nXi\bar X = \frac{1}{n}\sum_{i=1}^{n} X_i

这里 nn 是样本量,X1,…,XnX_1,\dots,X_n 是各个样本观测值,Xˉ\bar X 是它们的平均数。由于不同样本得到的 Xˉ\bar X 值不同,它本身就是一个具有自身分布的随机变量——称为均值的抽样分布——其离散程度会随着 nn 增大而缩小。

Xˉ−zα/2σn≤μ≤Xˉ+zα/2σn\bar X - z_{\alpha/2}\frac{\sigma}{\sqrt{n}} \le \mu \le \bar X + z_{\alpha/2}\frac{\sigma}{\sqrt{n}}

当总体标准差 σ\sigma 已知时,这就是 μ\mu 的 100(1−α)%100(1-\alpha)\% 置信区间:zα/2z_{\alpha/2} 是标准正态分布中在每个尾部留下概率 α/2\alpha/2 的临界值,而 σn\frac{\sigma}{\sqrt n} 是 Xˉ\bar X 的标准误,即 Xˉ\bar X 与 μ\mu 之间的典型距离。

常用置信水平及其 zz 临界值
置信水平zα/2z_{\alpha/2}
90%zα/2=1.645z_{\alpha/2}=1.645
95%zα/2=1.960z_{\alpha/2}=1.960
99%zα/2=2.576z_{\alpha/2}=2.576

大学为什么置信区间是有效的

若 X1,…,XnX_1,\dots,X_n 独立同分布,且对每个 ii 都有 E[Xi]=μE[X_i] = \mu,则样本均值 Xˉ=1n∑i=1nXi\bar X = \frac{1}{n}\sum_{i=1}^{n} X_i 满足 E[Xˉ]=μE[\bar X] = \mu。

为什么成立?

取平均消除了系统性偏差:在许多假想样本上取平均,Xˉ\bar X 恰好落在真实总体均值 μ\mu 处,既不系统性偏高也不系统性偏低。

证明

根据定义,Xˉ=1n∑i=1nXi\bar X = \frac{1}{n}\sum_{i=1}^{n} X_i。期望是线性算子,因此可以分配到求和及常数因子 1n\frac{1}{n} 上:E[Xˉ]=1n∑i=1nE[Xi]E[\bar X] = \frac{1}{n}\sum_{i=1}^{n} E[X_i]。

由于每个 XiX_i 都来自同一总体,对 nn 项中的每一项都有 E[Xi]=μE[X_i] = \mu,于是求和化简为 1n∑i=1nμ=1n(nμ)=μ\frac{1}{n}\sum_{i=1}^{n} \mu = \frac{1}{n}(n\mu) = \mu。

因此对任意样本量 nn 都有 E[Xˉ]=μE[\bar X] = \mu:无论样本大小,样本均值都是无偏的。这只是关于抽样分布中心的结论——该分布的离散程度 Var⁡(Xˉ)=σ2/n\operatorname{Var}(\bar X) = \sigma^2/n 仍会随 nn 增大而缩小,这正是下面置信区间所用到的。

若 X1,…,XnX_1,\dots,X_n 独立同分布,均值为 μ\mu,方差有限为 σ2\sigma^2,则当 nn 较大时,置信区间 Xˉ−zα/2σn≤μ≤Xˉ+zα/2σn\bar X - z_{\alpha/2}\frac{\sigma}{\sqrt n} \le \mu \le \bar X + z_{\alpha/2}\frac{\sigma}{\sqrt n} 以约 1−α1-\alpha 的概率包含 μ\mu。

为什么成立?

中心极限定理表明,当 nn 较大时,标准化后的样本均值表现得像标准正态变量,因此我们可以用正态分位数 zα/2z_{\alpha/2} 来夹住 μ\mu,无论原始总体的形状如何,都能获得已知的长期成功率。

证明

由中心极限定理,Xˉ−μσ/n\frac{\bar X - \mu}{\sigma/\sqrt n} 在 nn→∞\to\infty 时依分布收敛于 N(0,1)N(0,1)。所以当 nn 较大时,−zα/2≤Xˉ−μσ/n≤zα/2-z_{\alpha/2} \le \frac{\bar X - \mu}{\sigma/\sqrt n} \le z_{\alpha/2} 以约 1−α1-\alpha 的概率成立,其中 zα/2z_{\alpha/2} 是使 N(0,1)N(0,1) 每个尾部留下概率 α/2\alpha/2 的值。

将不等式三边都乘以 σn\frac{\sigma}{\sqrt n}>0>0(不改变不等号方向):−zα/2σn≤Xˉ−μ≤zα/2σn-z_{\alpha/2}\frac{\sigma}{\sqrt n} \le \bar X - \mu \le z_{\alpha/2}\frac{\sigma}{\sqrt n}。

所有边都减去 Xˉ\bar X,再乘以 −1-1(不等号方向翻转):Xˉ−zα/2σn≤μ≤Xˉ+zα/2σn\bar X - z_{\alpha/2}\frac{\sigma}{\sqrt n} \le \mu \le \bar X + z_{\alpha/2}\frac{\sigma}{\sqrt n}。这正是置信区间公式:由于原来的概率命题以约 1−α1-\alpha 的概率成立,重新整理后的这个区间也以同样的概率包含 μ\mu。

误差范围 E=zα/2σnE = z_{\alpha/2}\frac{\sigma}{\sqrt n} 只按 1/n1/\sqrt n 的速度缩小,而不是按 1/n1/n:要把误差范围减半,就必须把样本量 nn 变为四倍,要减到三分之一则需要九倍的观测数。精度的代价很高:每多提高一位精度,所需的数据都远多于前一位。

大学实际应用与典型例题

置信区间出现在任何需要根据不完整样本做决策的场合:工厂生产线的质量控制、选举前的民意调查、医学中的剂量试验,或利用重复测量校准望远镜。在每种情况下,同一个公式都把样本均值变成一个如实反映自身不确定性的区间。

例题: 螺栓平均直径的置信区间

一位质量控制工程师抽取 n=64n=64 个螺栓样本,得到样本平均直径 xˉ=12.02\bar x = 12.02 毫米,已知总体标准差为 σ=0.16\sigma = 0.16 毫米。请用 z0.025=1.96z_{0.025}=1.96 构造真实平均直径 μ\mu 的95%置信区间。

解答

标准误为 0.1664=0.02\frac{0.16}{\sqrt{64}} = 0.02 毫米。

误差范围为 1.96×0.02=0.03921.96 \times 0.02 = 0.0392 毫米。

95%置信区间为 (12.02−0.0392, 12.02+0.0392)=(11.981, 12.059)(12.02 - 0.0392,\ 12.02 + 0.0392) = (11.981,\ 12.059) 毫米:我们有95%的把握认为真实的螺栓平均直径落在此区间内。

例题: 估计支持某政策的选民比例

一位民调员随机调查了 n=400n=400 名选民,得到支持某政策的样本比例 p^=0.53\hat p = 0.53。将样本比例视为0/1回答的样本均值,请用 z0.025=1.96z_{0.025}=1.96 构造支持者真实总体比例 μ\mu 的95%置信区间。

解答

单次0/1回答的估计标准差为 p^(1−p^)=0.53×0.47≈0.499\sqrt{\hat p(1-\hat p)} = \sqrt{0.53\times 0.47} \approx 0.499,因此样本比例的标准误为 0.499400≈0.025\frac{0.499}{\sqrt{400}} \approx 0.025。

误差范围为 1.96×0.025≈0.0491.96 \times 0.025 \approx 0.049。

95%置信区间为 (0.53−0.049, 0.53+0.049)=(0.481, 0.579)(0.53 - 0.049,\ 0.53 + 0.049) = (0.481,\ 0.579):该民调有95%的把握认为真实支持率介于约48.1%到57.9%之间,区间过宽,无法确定该政策获得多数支持——需要更大的样本才能得出更明确的结论。

利用误差范围公式 E=zα/2σnE = z_{\alpha/2}\frac{\sigma}{\sqrt n},当 zα/2=1.96z_{\alpha/2}=1.96、σ=8\sigma=8、n=64n=64 时,误差范围是多少?

根据一个样本计算出平均日气温的95%置信区间。“95%置信”的正确理解是什么?

对所有样本量 nn 都成立的性质 E[Xˉ]=μE[\bar X] = \mu 描述了估计量 Xˉ\bar X 的哪个特征?

如果样本量 nn 从100增加到400,而 σ\sigma 和 zα/2z_{\alpha/2} 不变,误差范围会乘以……

参考文献

  1. NIST/SEMATECH (2013). Confidence Limits for the Mean
  2. Diez, D.; Cetinkaya-Rundel, M.; Barr, C. (2019). OpenIntro Statistics