概率与统计
大数定律与中心极限定理
为什么独立随机变量的平均值会趋于稳定,以及标准化之后为什么会呈现钟形曲线:切比雪夫不等式、弱大数定律与强大数定律、中心极限定理。
直观为什么平均值会趋于稳定
公平的硬币抛一次,你无法预测正面还是反面。但抛一万次,正面出现的比例几乎肯定接近0.5,尽管每一次单独的抛掷仍然不可预测。随机性并没有消失——它被稀释了:单个结果依然是随机的,但随着收集的次数增多,它们的平均值变得越来越可预测。
二元高斯曲面 z=e−r2 的隆起:预示着许多独立随机贡献之和最终趋近的钟形曲面——也就是本页后面要讲的中心极限定理。大学切比雪夫不等式:随机变量能偏离多远?
定义: 切比雪夫不等式
设随机变量 X 的均值 μ 和方差 σ2 均有限。切比雪夫不等式仅用 σ2 就能限制远离均值的概率有多大——不需要对 X 的分布形状做任何假设。
P(∣X−μ∣≥k)≤k2σ2,k>0 设随机变量 X 的均值 μ 和方差 σ2 均有限,对任意 k>0: P(∣X−μ∣≥k)≤k2σ2。
为什么成立?
对非负随机变量 (X−μ)2 应用马尔可夫不等式,得到 P((X−μ)2≥k2)≤E[(X−μ)2]/k2=σ2/k2;事件 (X−μ)2≥k2 正是 ∣X−μ∣≥k。
证明
首先证明马尔可夫不等式:对非负随机变量 Y≥0 和任意 a>0,逐点不等式 Y≥a⋅1{Y≥a} 成立,因为在事件 {Y≥a} 上右边等于 a≤Y,而在别处右边为 0≤Y。对两边取期望仍保持不等号:E[Y]≥aP(Y≥a),于是 P(Y≥a)≤E[Y]/a。
现在对非负随机变量 Y=(X−μ)2 以阈值 a=k2 应用马尔可夫不等式:P((X−μ)2≥k2)≤E[(X−μ)2]/k2。根据方差的定义,E[(X−μ)2]=σ2,因此右边恰好等于 σ2/k2。
最后,马尔可夫不等式两边的事件是相同的:(X−μ)2≥k2⟺∣X−μ∣≥k(两边都非负,故平方保持顺序)。代入即得 P(∣X−μ∣≥k)≤σ2/k2,这正是切比雪夫不等式。
例题: 一个简单的界
随机变量 X 的均值为 μ=10,方差为 σ2=4。求 P(∣X−10∣≥4) 的上界。
解答
P(∣X−10∣≥4)≤σ2/42=4/16=0.25:无论 X 的分布形状如何,它偏离均值4或更多的概率至多为25%。
例题: 用蒙特卡洛方法估计π
为估计 π,计算机在正方形 [−1,1]2 上均匀独立地采样 n 个点 (Ui,Vi),并统计落入单位圆内的比例。为什么这会收敛到 π?利用切比雪夫不等式,大约需要多少样本 n,才能使估计值以至少 0.99 的概率落在 π 的 0.01 范围内?
解答
设 Yi=1{Ui2+Vi2≤1} 表示第 i 个点落在单位圆内。由于点在面积为 4 的正方形上均匀分布,而圆的面积为 π,故 E[Yi]=π/4。定义估计量 π^n=n4∑i=1nYi,于是 E[π^n]=π。
由上面证明的弱大数定律,n1∑i=1nYi→π/4 依概率成立,故 π^n→π 依概率成立:这正是蒙特卡洛模拟有效的原因——独立随机样本的平均收敛于真实期望值。
对于具体的样本量,Var(Yi)=4π(1−4π)≈0.168(伯努利方差),故 Var(π^n)=16Var(Yi)/n。切比雪夫不等式给出 P(∣π^n−π∣≥0.01)≤n×0.000116×0.168;要求此式不超过 0.01 就迫使 n≥2.7×106——要达到两位小数的精度需要数百万个样本,这也是实践中蒙特卡洛方法偏好更廉价、方差削减效果更好的变体的原因,但保证收敛本身的正是大数定律。
例题: 在保险组合中分摊风险
设每位投保人年度理赔额 Xi 的均值为 μ=500,标准差为 σ=2000(美元单位;理赔罕见但金额大),一个保险池内 n=10000 位投保人的理赔被视为独立同分布。利用中心极限定理,估计每位投保人应缴的保费,使保险池的平均理赔超过该保费的概率约不超过 0.0013。
解答
设 Xˉn 为整个保险池的平均理赔额。由弱大数定律,随着保险池扩大,Xˉn→μ=500,因此汇集众多独立投保人使平均理赔变得可预测,尽管单个理赔 Xi 波动极大——这正是保险的整套经济逻辑。
由上面证明的中心极限定理,Xˉn 近似服从均值为 μ、方差为 Var(Xˉn)=σ2/n=40(当 n=10000)的正态分布,标准差为 sd(Xˉn)=40≈6.32 美元——远小于单个理赔 2000 美元的波动。
对正态分布而言,P(Xˉn>μ+3sd(Xˉn))≈P(Z>3)≈0.0013,其中 Z 为标准正态变量。因此将每位投保人的保费定为 μ+3sd(Xˉn)≈519 美元,可使保险池平均理赔超过保费的概率维持在约 0.13%——中心极限定理正是保险公司能把极难预测的个体风险,转化为狭窄、可定价的总体风险的原因。
大学弱大数定律
定义: 依概率收敛
随机变量序列 Yn 依概率收敛于常数 c,是指对任意 ε>0,P(∣Yn−c∣>ε)→0(当 n→∞ 时):出现较大偏差的机会趋于零,但对任何固定的 n,较大的偏差仍然可能发生。
设 X1,X2,… 是均值有限为 μ 的独立同分布随机变量。那么样本均值 Xˉn=n1∑i=1nXi 依概率收敛于 μ(当 n→∞ 时)。
为什么成立?
Var(Xˉn)=σ2/n→0(当 σ2 有限时),于是切比雪夫不等式给出 P(∣Xˉn−μ∣≥ε)≤σ2/(nε2)→0。(完整的定理只需均值有限,靠更精细的截断论证即可证明,但切比雪夫证明是最直观的特殊情形。)
证明
设 Xˉn=n1∑i=1nXi 为 X 的 n 个独立同分布副本的样本均值,其均值为 μ,并且——为了这个基于切比雪夫的证明——方差有限为 σ2。由期望的线性性,E[Xˉn]=μ。
独立性使方差可加:Var(Xˉn)=n21∑i=1nVar(Xi)=nσ2,因为每个 Xi 贡献 Var(Xi)=σ2,而 i=j 时的交叉项 Cov(Xi,Xj) 由独立性为零。
固定任意 ε>0,对 Xˉn 应用上面证明的切比雪夫不等式:P(∣Xˉn−μ∣≥ε)≤ε2Var(Xˉn)=nε2σ2。
当 n→∞ 时,对每个固定的 ε>0,右边 σ2/(nε2)→0,这正是依概率收敛的定义。因此 Xˉn→μ 依概率成立。
这一结果的一个版本最早由雅各布·伯努利证明,于他去世后的1713年在《猜度术》(Ars Conjectandi)中发表——这是大数定律最早的形式,针对的是重复的类似抛硬币试验中成功的比例。
进阶强大数定律
定义: 几乎必然收敛
序列 Yn 几乎必然收敛于 c,是指 P(limn→∞Yn=c)=1:对几乎每一个样本点,整个序列本身都会稳定在 c,这比依概率收敛(每次只控制一个 n)更强。
设 X1,X2,… 是均值有限为 μ 的独立同分布随机变量。那么 Xˉn→μ 几乎必然成立(当 n→∞ 时)。
为什么成立?
经典证明(柯尔莫哥洛夫,1933年)使用了柯尔莫哥洛夫不等式——切比雪夫不等式的加强版,能同时控制部分和的整条轨迹——并结合子列论证;这比弱大数定律那种一行切比雪夫证明要精细得多。
证明
我们在额外(教材中常见)的假设下勾勒证明:X 有有限的四阶矩 E[X4]<∞;一般命题只需均值有限,但需要更精细的截断论证(柯尔莫哥洛夫,1933年)。中心化后,设 E[X]=0(将各处的 Xi 换成 Xi−μ),并记 Sn=∑i=1nXi。
在全部 n4 个下标四元组上展开 E[Sn4]=∑i,j,k,lE[XiXjXkXl]。独立性与 E[X]=0 使得含有恰好出现一次的下标的项全部消失(该因子的期望为 0),只留下四个下标全相等的 n 项,以及配对成两个不同相等下标的 3n(n−1) 项。由此得到 E[Sn4]=nE[X4]+3n(n−1)σ4≤Cn2,常数 C 只依赖于 E[X4] 和 σ2。
除以 n4:E[(nSn)4]≤n2C。对 n 求和,由于 ∑1/n2 收敛,得 ∑n=1∞E[(nSn)4]≤∑n=1∞n2C<∞。
非负随机变量之和若期望总和有限,则该和本身几乎必然有限(单调收敛),故 ∑n=1∞(nSn)4<∞ 几乎必然成立,这迫使各项趋于零:(nSn)4→0,即 nSn→0 几乎必然成立。还原中心化即得 Xˉn→μ 几乎必然成立,这就是强大数定律。
进阶中心极限定理
σ/nXˉn−μ d N(0,1)as n→∞ 设 X1,…,Xn 为独立同分布随机变量,均值为 μ,方差有限为 σ2>0。当 n→∞ 时,标准化的样本均值 σ/nXˉn−μ 依分布收敛于标准正态分布 N(0,1)——无论 Xi 原始分布的形状如何。
为什么成立?
直观地说,标准化后和的矩生成函数(或特征函数)通过泰勒展开逐项收敛到 N(0,1) 的对应函数,因为标准化后只有均值和方差保留下来——所有更高阶矩在 n→∞ 时都被'冲刷'掉了。这正是为什么无论 Xi 原始分布是什么形状,都会出现相同的钟形曲线。
证明
对随机变量 Z,其特征函数为 φZ(t)=E[eitZ]。对每个 Xi 令 Zi=σXi−μ 进行标准化,使得 E[Zi]=0, E[Zi2]=1,标准化的样本均值就变成了这些变量之和:Tn=n1∑i=1nZi=σ/nXˉn−μ。
由于 Zi 独立同分布,和的特征函数等于各特征函数之积:φTn(t)=[φZ(nt)]n。
由 E[Z]=0 及 E[Z2]=1,φZ 在 0 附近的泰勒展开给出 φZ(s)=1−2s2+o(s2)。代入 s=t/n:φZ(nt)=1−2nt2+o(n1)。
取 n 次幂,并利用标准极限 (1+nc+o(1/n))n→ec:φTn(t)=[1−2nt2+o(n1)]n→e−t2/2。由于 e−t2/2 恰好是标准正态分布 N(0,1) 的特征函数,由莱维连续性定理,特征函数的这种逐点收敛可转化为依分布收敛:TndN(0,1)。
三个定理,关于 Xˉn 的三个问题| 结果 | 回答的问题 | 陈述类型 |
|---|
| 切比雪夫不等式 | X 能偏离 μ 多远? | 有限样本界,适用任意分布 |
| 弱大数定律 | Xˉn 会趋近 μ 吗? | 依概率收敛 |
| 强大数定律 | 整个序列 Xˉn 都会稳定在 μ 吗? | 几乎必然收敛 |
| 中心极限定理 | Xˉn 的波动呈什么形状? | 依分布收敛于 N(0,1) |
这些收敛结果是统计学的引擎:估计探讨如何把样本均值转化为 μ 的置信区间,假设检验则探讨如何利用同样的正态近似,在关于总体的相互竞争的主张之间做出判断。
根据弱大数定律,当 n→∞ 时,独立同分布变量的样本均值 Xˉn(各变量均值记为 μ)
切比雪夫不等式 P(∣X−μ∣≥k)≤σ2/k2 对 X 的分布需要什么假设?
根据中心极限定理,标准化样本均值 (Xˉn−μ)/(σ/n) 的分布在 n→∞ 时趋近于
在公平硬币连续出现10次正面之后,大数定律意味着