概率与统计
随机变量与分布
随机试验的数值结果,用各可能取值的概率来描述。
直观直觉:把随机变成数字
抛一枚硬币、掷一颗骰子、测量下一个走进房间的人的身高——每个随机试验都有一个事先无法预测的结果。随机变量就是给每一个可能的结果指定一个数字的规则,这样我们就能用数字来计算:求和、取平均、画图,而不再只是谈论模糊的结果。
二项分布 Bin(n,p)(紫色柱)及其高斯正态近似曲线(橙色):调节 n 与 p,观察均值 np 与标准差 np(1−p) 的变化。中学离散随机变量与连续随机变量
定义: 离散随机变量
如果随机变量 X 只取有限个或可数个值,且每个值都有各自的概率,就称为离散随机变量。它的概率质量函数(PMF)记为 P(X=x);由于 X 必定取某个值,所有可能取值的概率之和等于1。
x∑P(X=x)=1 最著名的离散分布是统计独立重复试验中成功次数的分布。如果每次试验以概率 p 成功,并重复 n 次,那么成功次数 X 服从二项分布:
P(X=k)=(kn)pk(1−p)n−k 这里 n 是固定的试验次数,p 是每次试验的成功概率,(kn) 表示在 n 次试验中安排 k 次成功的方式数,因为其中任何一种排列都恰好给出 k 次成功和 n−k 次失败。
定义: 连续随机变量
连续随机变量可以取实数区间内的任意值,因此对任意单点 x 都有 P(X=x)=0。它没有PMF,而是有一个概率密度函数(PDF)f(x),概率由 f 在某区间上曲线下方的面积给出。
f(x)=σ2π1e−(x−μ)2/2σ2 这是正态(高斯)密度函数:μ 是均值,标出钟形的中心;σ 是标准差,决定钟形的宽窄。许多测量误差和自然量都能被这条曲线很好地近似。
离散随机变量与连续随机变量的比较| 方面 | 离散 | 连续 |
|---|
| 描述函数 | 概率质量函数 P(X=x) | 概率密度函数 f(x) |
| 恰好取某一值的概率 | 可以为正 | 恒为 0 |
| 概率的计算方式 | 求和:∑xP(X=x) | 积分:∫abf(x)dx |
| 典型例子 | 二项分布(成功次数) | 正态分布(测量值) |
大学期望与方差
期望 E[X] 是如果实验重复很多次时 X 的长期平均值,按每个可能取值出现的可能性加权:
E[X]=x∑xP(X=x) 把每个可能取值 x 乘以其概率 P(X=x) 后相加;期望具有线性性,即对常数 a,b 有 E[aX+b]=aE[X]+b。方差衡量 X 在 E[X] 周围的分散程度,用如下简便公式计算最容易:
Var(X)=E[X2]−E[X]2 这说明方差等于 X2 的平均值减去 X 的平均值的平方;标准差 σ=Var(X) 则把这种分散程度换回与 X 本身相同的单位。
如果 X 服从试验次数为 n、成功概率为 p 的二项分布,那么 E[X]=np。
为什么成立?
二项计数只是许多个小的“是/否”试验之和,而和的期望永远等于期望之和——无论这些试验之间如何关联——所以只需求出单次试验的平均贡献即可。
证明
记 X=X1+X2+⋯+Xn,其中 Xi 在第 i 次试验成功时为 1,否则为 0。每个 Xi 都是伯努利随机变量,满足 P(Xi=1)=p,P(Xi=0)=1−p,因此其期望为 E[Xi]=1⋅p+0⋅(1−p)=p。
无论各随机变量是否独立,期望对任意随机变量都具有线性性:E[X1+X2+⋯+Xn]=E[X1]+E[X2]+⋯+E[Xn]。这一线性性直接来自期望作为加权和的定义,因为求和与加权求和总是可以重新排列的。
把线性性用于 X=X1+⋯+Xn,得到 E[X]=E[X1]+⋯+E[Xn]=n timesp+p+⋯+p=np,恰好就是所要证明的公式。
对任意均值有限的随机变量 X,都有 Var(X)=E[X2]−E[X]2。
为什么成立?
方差的定义涉及对一个差值取平方,直接计算并不方便;展开这个平方并利用期望的线性性,就能把它化为两个我们已经会计算的量:E[X2] 与 E[X]。
证明
根据定义,Var(X)=E[(X−μ)2],其中 μ=E[X]。展开期望内部的平方:(X−μ)2=X2−2μX+μ2。
对每一项应用期望的线性性:E[(X−μ)2]=E[X2]−2μE[X]+μ2。由于 μ 是常数(不依赖于结果),可以在中间项和最后一项中提到期望之外。
再把 E[X]=μ 代回:E[X2]−2μ⋅μ+μ2=E[X2]−2μ2+μ2=E[X2]−μ2。把 μ 换回 E[X],恰好得到所要证明的 Var(X)=E[X2]−E[X]2。
大学实际应用与典型例题
二项变量随处可用来建模合格/不合格的次数:生产线上的次品、广告的点击量、DNA链上的突变。正态变量则用来建模由许多微小独立影响叠加而成的量:测量误差、人的身高、投资组合收益、电子设备的背景噪声。两者都能帮助工程师、科学家和分析师把模糊的“随机性”变成可以计算的数字。
例题: 生产线上的次品灯泡
某工厂按批次出货灯泡。每个灯泡独立地以概率 p=0.1 出现次品。在一批 n=8 个灯泡中,恰好有 k=2 个次品的概率是多少?
解答
次品灯泡数 X 服从 n=8、p=0.1 的二项分布,因为每个灯泡都是独立试验,要么是次品要么不是。
代入PMF:P(X=2)=(28)(0.1)2(0.9)6。二项系数 (28)=28,表示从8个灯泡中选出2个作为次品的方式数。
计算幂次,(0.1)2=0.01,(0.9)6≈0.531441,于是 P(X=2)=28×0.01×0.531441≈0.1488。也就是说,这一批中恰好有两个次品的概率约为15%。
例题: 身高与正态分布
某人群成年男性身高近似服从均值 μ=170(厘米)、标准差 σ=6(厘米)的正态分布。身高在 164 到 176 厘米之间的男性大约占多大比例?
解答
用 Z=σX−μ 把两个边界身高换算成 z 分数:当 X=164 时,z1=6164−170=−1;当 X=176 时,z2=6176−170=1。
区间 164<X<176 恰好就是标准化后落在均值一个标准差以内的范围,即 −1<Z<1。
对标准正态曲线,由正态PDF积分得到的经验法则给出 P(−1<Z<1)≈0.6827,所以大约68%的男性身高落在这个区间内。
设 X∼Binomial(n=5,p=0.4)。P(X=2) 等于多少?
下列哪项正确区分了离散PMF与连续PDF?
某离散随机变量满足 X∈{0,1,2},P(X=0)=0.2,P(X=1)=0.5,P(X=2)=0.3。E[X] 等于多少?
标准化考试成绩近似服从 μ=500、σ=100 的正态分布。用经验法则估计,大约有多大比例的考生得分高于 600?