MathLabs

概率与统计

随机变量与分布

随机试验的数值结果,用各可能取值的概率来描述。

直观直觉:把随机变成数字

抛一枚硬币、掷一颗骰子、测量下一个走进房间的人的身高——每个随机试验都有一个事先无法预测的结果。随机变量就是给每一个可能的结果指定一个数字的规则,这样我们就能用数字来计算:求和、取平均、画图,而不再只是谈论模糊的结果。

叠加高斯近似曲线的二项分布柱状图。
二项分布 Bin(n,p)\mathrm{Bin}(n, p)(紫色柱)及其高斯正态近似曲线(橙色):调节 nn 与 pp,观察均值 npnp 与标准差 np(1−p)\sqrt{np(1-p)} 的变化。

中学离散随机变量与连续随机变量

定义: 离散随机变量

如果随机变量 XX 只取有限个或可数个值,且每个值都有各自的概率,就称为离散随机变量。它的概率质量函数(PMF)记为 P(X=x)P(X=x);由于 XX 必定取某个值,所有可能取值的概率之和等于1。

∑xP(X=x)=1\sum_x P(X=x) = 1

最著名的离散分布是统计独立重复试验中成功次数的分布。如果每次试验以概率 pp 成功,并重复 nn 次,那么成功次数 XX 服从二项分布:

P(X=k)=(nk)pk(1−p)n−kP(X=k) = \binom{n}{k}p^k(1-p)^{n-k}

这里 nn 是固定的试验次数,pp 是每次试验的成功概率,(nk)\binom{n}{k} 表示在 nn 次试验中安排 kk 次成功的方式数,因为其中任何一种排列都恰好给出 kk 次成功和 n−kn-k 次失败。

定义: 连续随机变量

连续随机变量可以取实数区间内的任意值,因此对任意单点 xx 都有 P(X=x)=0P(X=x)=0。它没有PMF,而是有一个概率密度函数(PDF)f(x)f(x),概率由 ff 在某区间上曲线下方的面积给出。

f(x)=1σ2πe−(x−μ)2/2σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/2\sigma^2}

这是正态(高斯)密度函数:μ\mu 是均值,标出钟形的中心;σ\sigma 是标准差,决定钟形的宽窄。许多测量误差和自然量都能被这条曲线很好地近似。

离散随机变量与连续随机变量的比较
方面离散连续
描述函数概率质量函数 P(X=x)P(X=x)概率密度函数 f(x)f(x)
恰好取某一值的概率可以为正恒为 00
概率的计算方式求和:∑xP(X=x)\sum_x P(X=x)积分:∫abf(x) dx\int_a^b f(x)\,dx
典型例子二项分布(成功次数)正态分布(测量值)

大学期望与方差

期望 E[X]E[X] 是如果实验重复很多次时 XX 的长期平均值,按每个可能取值出现的可能性加权:

E[X]=∑xxP(X=x)E[X] = \sum_x xP(X=x)

把每个可能取值 xx 乘以其概率 P(X=x)P(X=x) 后相加;期望具有线性性,即对常数 a,ba,b 有 E[aX+b]=aE[X]+bE[aX+b] = aE[X]+b。方差衡量 XX 在 E[X]E[X] 周围的分散程度,用如下简便公式计算最容易:

Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2

这说明方差等于 X2X^2 的平均值减去 XX 的平均值的平方;标准差 σ=Var(X)\sigma = \sqrt{\mathrm{Var}(X)} 则把这种分散程度换回与 XX 本身相同的单位。

如果 XX 服从试验次数为 nn、成功概率为 pp 的二项分布,那么 E[X]=npE[X] = np。

为什么成立?

二项计数只是许多个小的“是/否”试验之和,而和的期望永远等于期望之和——无论这些试验之间如何关联——所以只需求出单次试验的平均贡献即可。

证明

记 X=X1+X2+⋯+XnX = X_1 + X_2 + \cdots + X_n,其中 XiX_i 在第 ii 次试验成功时为 11,否则为 00。每个 XiX_i 都是伯努利随机变量,满足 P(Xi=1)=pP(X_i=1)=p,P(Xi=0)=1−pP(X_i=0)=1-p,因此其期望为 E[Xi]=1⋅p+0⋅(1−p)=pE[X_i] = 1\cdot p + 0\cdot(1-p) = p。

无论各随机变量是否独立,期望对任意随机变量都具有线性性:E[X1+X2+⋯+Xn]=E[X1]+E[X2]+⋯+E[Xn]E[X_1+X_2+\cdots+X_n] = E[X_1]+E[X_2]+\cdots+E[X_n]。这一线性性直接来自期望作为加权和的定义,因为求和与加权求和总是可以重新排列的。

把线性性用于 X=X1+⋯+XnX = X_1+\cdots+X_n,得到 E[X]=E[X1]+⋯+E[Xn]=p+p+⋯+p⏟n times=npE[X] = E[X_1]+\cdots+E[X_n] = \underbrace{p+p+\cdots+p}_{n \text{ times}} = np,恰好就是所要证明的公式。

对任意均值有限的随机变量 XX,都有 Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2。

为什么成立?

方差的定义涉及对一个差值取平方,直接计算并不方便;展开这个平方并利用期望的线性性,就能把它化为两个我们已经会计算的量:E[X2]E[X^2] 与 E[X]E[X]。

证明

根据定义,Var(X)=E[(X−μ)2]\mathrm{Var}(X) = E[(X-\mu)^2],其中 μ=E[X]\mu = E[X]。展开期望内部的平方:(X−μ)2=X2−2μX+μ2(X-\mu)^2 = X^2 - 2\mu X + \mu^2。

对每一项应用期望的线性性:E[(X−μ)2]=E[X2]−2μE[X]+μ2E[(X-\mu)^2] = E[X^2] - 2\mu E[X] + \mu^2。由于 μ\mu 是常数(不依赖于结果),可以在中间项和最后一项中提到期望之外。

再把 E[X]=μE[X] = \mu 代回:E[X2]−2μ⋅μ+μ2=E[X2]−2μ2+μ2=E[X2]−μ2E[X^2] - 2\mu\cdot\mu + \mu^2 = E[X^2] - 2\mu^2 + \mu^2 = E[X^2] - \mu^2。把 μ\mu 换回 E[X]E[X],恰好得到所要证明的 Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2。

大学实际应用与典型例题

二项变量随处可用来建模合格/不合格的次数:生产线上的次品、广告的点击量、DNA链上的突变。正态变量则用来建模由许多微小独立影响叠加而成的量:测量误差、人的身高、投资组合收益、电子设备的背景噪声。两者都能帮助工程师、科学家和分析师把模糊的“随机性”变成可以计算的数字。

例题: 生产线上的次品灯泡

某工厂按批次出货灯泡。每个灯泡独立地以概率 p=0.1p = 0.1 出现次品。在一批 n=8n = 8 个灯泡中,恰好有 k=2k = 2 个次品的概率是多少?

解答

次品灯泡数 XX 服从 n=8n=8、p=0.1p=0.1 的二项分布,因为每个灯泡都是独立试验,要么是次品要么不是。

代入PMF:P(X=2)=(82)(0.1)2(0.9)6P(X=2) = \binom{8}{2}(0.1)^2(0.9)^6。二项系数 (82)=28\binom{8}{2} = 28,表示从8个灯泡中选出2个作为次品的方式数。

计算幂次,(0.1)2=0.01(0.1)^2 = 0.01,(0.9)6≈0.531441(0.9)^6 \approx 0.531441,于是 P(X=2)=28×0.01×0.531441≈0.1488P(X=2) = 28 \times 0.01 \times 0.531441 \approx 0.1488。也就是说,这一批中恰好有两个次品的概率约为15%。

例题: 身高与正态分布

某人群成年男性身高近似服从均值 μ=170\mu = 170(厘米)、标准差 σ=6\sigma = 6(厘米)的正态分布。身高在 164164 到 176176 厘米之间的男性大约占多大比例?

解答

用 Z=X−μσZ = \frac{X-\mu}{\sigma} 把两个边界身高换算成 zz 分数:当 X=164X=164 时,z1=164−1706=−1z_1 = \frac{164-170}{6} = -1;当 X=176X=176 时,z2=176−1706=1z_2 = \frac{176-170}{6} = 1。

区间 164<X<176164 < X < 176 恰好就是标准化后落在均值一个标准差以内的范围,即 −1<Z<1-1 < Z < 1。

对标准正态曲线,由正态PDF积分得到的经验法则给出 P(−1<Z<1)≈0.6827P(-1 < Z < 1) \approx 0.6827,所以大约68%的男性身高落在这个区间内。

设 X∼Binomial(n=5,p=0.4)X \sim \mathrm{Binomial}(n=5, p=0.4)。P(X=2)P(X=2) 等于多少?

下列哪项正确区分了离散PMF与连续PDF?

某离散随机变量满足 X∈{0,1,2}X \in \{0,1,2\},P(X=0)=0.2P(X=0)=0.2,P(X=1)=0.5P(X=1)=0.5,P(X=2)=0.3P(X=2)=0.3。E[X]E[X] 等于多少?

标准化考试成绩近似服从 μ=500\mu = 500、σ=100\sigma = 100 的正态分布。用经验法则估计,大约有多大比例的考生得分高于 600600?

参考文献

  1. Charles M. Grinstead, J. Laurie Snell (1997). Introduction to Probability
  2. Sheldon Ross (2019). A First Course in Probability