MathLabs

概率与统计

描述统计

用平均数、中位数、标准差等指标概括数据,并用图表呈现。

直观直觉:用几个数字讲述数据的故事

想象一位老师有30个测验分数,或一位店主有一个月的每日销售额。没有人愿意盯着30个孤立的数字去理解发生了什么。描述统计把整个数据集压缩成少数几个数字——一个典型值、数值的分散程度——这样我们就能一眼比较、概括,并发现异常之处。

一条有起有伏的不对称曲线,展示偏斜而非对称的数据形状。
右偏计数分布(参数为 λ=np\lambda = np 的泊松分布):增大 nn 或 pp,观察分布重心右移且形状趋于对称。

中学衡量中心:平均数、中位数、众数

定义: 平均数

nn 个数据值 x1,x2,…,xnx_1, x_2, \ldots, x_n 的平均数(均值)是把它们全部相加后除以个数。它用到了数据集中的每一个值,因此对异常大或异常小的值很敏感。

xˉ=1n∑i=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i

这里 xˉ\bar x 是平均数,nn 是数据值的个数,xix_i 是被相加的第 ii 个值。xx 上方的横线是表示“xx 的平均数”的标准记法。

定义: 中位数与众数

中位数是把数据从小到大排序后位于中间的值(若 nn 为偶数,则取中间两个值的平均)。众数是出现次数最多的值。与平均数不同,中位数忽略极端值离得多远——只有它们的排名重要——这使它对异常值有较强的抵抗力。

那么该用哪个指标呢?如果数据大致对称且没有极端值,平均数是高效的,能利用全部信息。如果数据存在异常值或严重偏斜——比如家庭收入或房价——中位数能给出更具代表性的“典型”值。

平均数、中位数与众数的比较
指标定义对异常值敏感吗
平均数所有值之和除以个数是——每个值都会影响它
中位数排序后位于中间的值否——只有排名重要
众数出现次数最多的值否

中学衡量分散程度:标准差与四分位数

两组数据可能均值相同,但看起来完全不同——一组高度集中,一组分散很广。标准差 ss 通过衡量数据值与平均数之间的典型距离来刻画这一点:

s=1n∑i=1n(xi−xˉ)2s = \sqrt{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar{x})^2}

每个偏差 xi−xˉx_i-\bar x 先被平方(这样正负偏差不会相互抵消),再取平均,然后开平方根把单位还原为数据原来的量纲。ss 小说明数据紧密聚集在 xˉ\bar x 附近;ss 大说明数据比较分散。

IQR=Q3−Q1IQR = Q_3 - Q_1

四分位数把排序后的数据分成四等份:Q1Q_1(走到25%处)、中位数(50%)和 Q3Q_3(75%)。四分位距 IQR=Q3−Q1IQR = Q_3-Q_1 衡量数据中间一半的分散程度,和中位数一样对异常值有抵抗力——这正是箱线图所画的内容:一个从 Q1Q_1 到 Q3Q_3 的箱子,加上中位数处的一条线。

对任意数据集 x1,x2,…,xnx_1, x_2, \ldots, x_n 及其均值 xˉ\bar x,都有 ∑i=1n(xi−xˉ)=0\sum_{i=1}^{n}(x_i-\bar x) = 0。

为什么成立?

均值恰恰被定义为数据的平衡点——可以想象一个在每个 xix_i 处都放了砝码的跷跷板——因此均值以上的值必须恰好抵消均值以下的值,否则 xˉ\bar x 就不会是那个平衡点。

证明

把求和展开:∑i=1n(xi−xˉ)=∑i=1nxi−∑i=1nxˉ\sum_{i=1}^{n}(x_i-\bar x) = \sum_{i=1}^{n}x_i - \sum_{i=1}^{n}\bar x。第二个和把常数 xˉ\bar x 自身相加了 nn 次,所以 ∑i=1nxˉ=nxˉ\sum_{i=1}^{n}\bar x = n\bar x。

根据定义,xˉ=1n∑i=1nxi\bar x = \frac{1}{n}\sum_{i=1}^{n}x_i,两边同乘以 nn 得到 nxˉ=∑i=1nxin\bar x = \sum_{i=1}^{n}x_i。这恰好与上面展开式中的第一个和是同一个量。

代回原式:∑i=1n(xi−xˉ)=∑i=1nxi−nxˉ=∑i=1nxi−∑i=1nxi=0\sum_{i=1}^{n}(x_i-\bar x) = \sum_{i=1}^{n}x_i - n\bar x = \sum_{i=1}^{n}x_i - \sum_{i=1}^{n}x_i = 0,这就证明了结论。

若用常数 a,ba,b通过 yi=axi+by_i = ax_i+b 构造新数据集,则 yˉ=axˉ+b\bar y = a\bar x+b,新的标准差为 sy=∣a∣sxs_y = |a|s_x。

为什么成立?

把每个数据点都平移相同的量 bb,均值也会平移相同的量,但各点之间的相对分散程度不变;把每个点都乘以 aa,均值和分散程度都会按 aa 缩放(由于分散程度不能为负,所以用 ∣a∣|a|)。

证明

关于均值:yˉ=1n∑i=1nyi=1n∑i=1n(axi+b)=an∑i=1nxi+1n∑i=1nb=axˉ+b\bar y = \frac{1}{n}\sum_{i=1}^{n}y_i = \frac{1}{n}\sum_{i=1}^{n}(ax_i+b) = \frac{a}{n}\sum_{i=1}^{n}x_i + \frac{1}{n}\sum_{i=1}^{n}b = a\bar x + b,这里用到 1n∑xi=xˉ\frac{1}{n}\sum x_i = \bar x 以及 1n∑i=1nb=b\frac{1}{n}\sum_{i=1}^{n}b = b。

关于分散程度,先注意到 yi−yˉ=(axi+b)−(axˉ+b)=a(xi−xˉ)y_i-\bar y = (ax_i+b)-(a\bar x+b) = a(x_i-\bar x):常数平移 bb 完全抵消,只剩下经过缩放的偏差。

平方并取平均,sy2=1n∑i=1n(yi−yˉ)2=1n∑i=1na2(xi−xˉ)2=a2sx2s_y^2 = \frac{1}{n}\sum_{i=1}^{n}(y_i-\bar y)^2 = \frac{1}{n}\sum_{i=1}^{n}a^2(x_i-\bar x)^2 = a^2 s_x^2。两边开平方,由于平方根总是非负的,得到 sy=∣a∣sxs_y = |a|s_x。

中学实际应用与典型例题

描述统计无处不在:体育分析师把击球率与联盟平均值相比较,工厂追踪零件尺寸的标准差以发现质量问题,气象部门报告降雨量的中位数,因为单独一个洪灾年份会扭曲平均值,公司在报告季度营收时既给出一个典型值,也给出一个波动性指标。

例题: 异常值使平均数失真

某家教记录了6次测验分数:5,6,7,7,8,95, 6, 7, 7, 8, 9。在最后一次测验中,数据录入错误把 99 写成了 5050。比较错误发生前后的平均数与中位数。

解答

错误发生前:平均数为 5+6+7+7+8+96=426=7\frac{5+6+7+7+8+9}{6} = \frac{42}{6} = 7,把数据 5,6,7,7,8,95,6,7,7,8,9 排序后中位数为 7+72=7\frac{7+7}{2}=7(中间两个值的平均)。平均数与中位数十分接近。

错误发生后,数据变为 5,6,7,7,8,505,6,7,7,8,50。此时平均数为 5+6+7+7+8+506=836≈13.83\frac{5+6+7+7+8+50}{6} = \frac{83}{6} \approx 13.83——被这一个错误值大幅拉高。

排序后的数据仍是 5,6,7,7,8,505,6,7,7,8,50,因此中位数仍为 7+72=7\frac{7+7}{2}=7,完全不受影响。这正是当数据集可能包含录入错误或极端异常值时,中位数更受青睐的原因。

例题: 用标准差比较稳定性

两名球员在5场比赛中的得分如下。球员A:9,10,11,12,139, 10, 11, 12, 13。球员B:1,6,11,16,211, 6, 11, 16, 21。两人的平均分相同,但哪位球员更稳定?计算各自的标准差进行比较。

解答

两组数据的平均值都是 1111:对A,9+10+11+12+135=555=11\frac{9+10+11+12+13}{5}=\frac{55}{5}=11;对B,1+6+11+16+215=555=11\frac{1+6+11+16+21}{5}=\frac{55}{5}=11。

对球员A,与 1111 的偏差为 −2,−1,0,1,2-2,-1,0,1,2,平方后为 4,1,0,1,44,1,0,1,4,相加为 1010,因此方差为 105=2\frac{10}{5}=2,标准差为 sA=2≈1.41s_A=\sqrt{2}\approx 1.41。

对球员B,偏差为 −10,−5,0,5,10-10,-5,0,5,10,平方后为 100,25,0,25,100100,25,0,25,100,相加为 250250,因此方差为 2505=50\frac{250}{5}=50,sB=50≈7.07s_B=\sqrt{50}\approx 7.07。由于 sA<sBs_A < s_B,尽管两人场均都是 1111 分,但球员A的发挥要稳定得多。

计算数据集 2,4,4,6,92, 4, 4, 6, 9 的平均数。

数据中的一个极端异常值,对哪种集中趋势指标的影响最小?

对于数据集 1,2,3,4,51, 2, 3, 4, 5,标准差 ss 是多少?

配送时间(分钟)的箱线图显示 Q1=20Q_1=20,Q3=35Q_3=35。四分位距是多少?

参考文献

  1. David Freedman, Robert Pisani, Roger Purves (2007). Statistics
  2. David S. Moore, William I. Notz (2020). The Basic Practice of Statistics