概率与统计
描述统计
用平均数、中位数、标准差等指标概括数据,并用图表呈现。
直观直觉:用几个数字讲述数据的故事
想象一位老师有30个测验分数,或一位店主有一个月的每日销售额。没有人愿意盯着30个孤立的数字去理解发生了什么。描述统计把整个数据集压缩成少数几个数字——一个典型值、数值的分散程度——这样我们就能一眼比较、概括,并发现异常之处。
右偏计数分布(参数为 λ=np 的泊松分布):增大 n 或 p,观察分布重心右移且形状趋于对称。中学衡量中心:平均数、中位数、众数
定义: 平均数
n 个数据值 x1,x2,…,xn 的平均数(均值)是把它们全部相加后除以个数。它用到了数据集中的每一个值,因此对异常大或异常小的值很敏感。
xˉ=n1i=1∑nxi 这里 xˉ 是平均数,n 是数据值的个数,xi 是被相加的第 i 个值。x 上方的横线是表示“x 的平均数”的标准记法。
定义: 中位数与众数
中位数是把数据从小到大排序后位于中间的值(若 n 为偶数,则取中间两个值的平均)。众数是出现次数最多的值。与平均数不同,中位数忽略极端值离得多远——只有它们的排名重要——这使它对异常值有较强的抵抗力。
那么该用哪个指标呢?如果数据大致对称且没有极端值,平均数是高效的,能利用全部信息。如果数据存在异常值或严重偏斜——比如家庭收入或房价——中位数能给出更具代表性的“典型”值。
平均数、中位数与众数的比较| 指标 | 定义 | 对异常值敏感吗 |
|---|
| 平均数 | 所有值之和除以个数 | 是——每个值都会影响它 |
| 中位数 | 排序后位于中间的值 | 否——只有排名重要 |
| 众数 | 出现次数最多的值 | 否 |
中学衡量分散程度:标准差与四分位数
两组数据可能均值相同,但看起来完全不同——一组高度集中,一组分散很广。标准差 s 通过衡量数据值与平均数之间的典型距离来刻画这一点:
s=n1i=1∑n(xi−xˉ)2 每个偏差 xi−xˉ 先被平方(这样正负偏差不会相互抵消),再取平均,然后开平方根把单位还原为数据原来的量纲。s 小说明数据紧密聚集在 xˉ 附近;s 大说明数据比较分散。
IQR=Q3−Q1 四分位数把排序后的数据分成四等份:Q1(走到25%处)、中位数(50%)和 Q3(75%)。四分位距 IQR=Q3−Q1 衡量数据中间一半的分散程度,和中位数一样对异常值有抵抗力——这正是箱线图所画的内容:一个从 Q1 到 Q3 的箱子,加上中位数处的一条线。
对任意数据集 x1,x2,…,xn 及其均值 xˉ,都有 ∑i=1n(xi−xˉ)=0。
为什么成立?
均值恰恰被定义为数据的平衡点——可以想象一个在每个 xi 处都放了砝码的跷跷板——因此均值以上的值必须恰好抵消均值以下的值,否则 xˉ 就不会是那个平衡点。
证明
把求和展开:∑i=1n(xi−xˉ)=∑i=1nxi−∑i=1nxˉ。第二个和把常数 xˉ 自身相加了 n 次,所以 ∑i=1nxˉ=nxˉ。
根据定义,xˉ=n1∑i=1nxi,两边同乘以 n 得到 nxˉ=∑i=1nxi。这恰好与上面展开式中的第一个和是同一个量。
代回原式:∑i=1n(xi−xˉ)=∑i=1nxi−nxˉ=∑i=1nxi−∑i=1nxi=0,这就证明了结论。
若用常数 a,b通过 yi=axi+b 构造新数据集,则 yˉ=axˉ+b,新的标准差为 sy=∣a∣sx。
为什么成立?
把每个数据点都平移相同的量 b,均值也会平移相同的量,但各点之间的相对分散程度不变;把每个点都乘以 a,均值和分散程度都会按 a 缩放(由于分散程度不能为负,所以用 ∣a∣)。
证明
关于均值:yˉ=n1∑i=1nyi=n1∑i=1n(axi+b)=na∑i=1nxi+n1∑i=1nb=axˉ+b,这里用到 n1∑xi=xˉ 以及 n1∑i=1nb=b。
关于分散程度,先注意到 yi−yˉ=(axi+b)−(axˉ+b)=a(xi−xˉ):常数平移 b 完全抵消,只剩下经过缩放的偏差。
平方并取平均,sy2=n1∑i=1n(yi−yˉ)2=n1∑i=1na2(xi−xˉ)2=a2sx2。两边开平方,由于平方根总是非负的,得到 sy=∣a∣sx。
中学实际应用与典型例题
描述统计无处不在:体育分析师把击球率与联盟平均值相比较,工厂追踪零件尺寸的标准差以发现质量问题,气象部门报告降雨量的中位数,因为单独一个洪灾年份会扭曲平均值,公司在报告季度营收时既给出一个典型值,也给出一个波动性指标。
例题: 异常值使平均数失真
某家教记录了6次测验分数:5,6,7,7,8,9。在最后一次测验中,数据录入错误把 9 写成了 50。比较错误发生前后的平均数与中位数。
解答
错误发生前:平均数为 65+6+7+7+8+9=642=7,把数据 5,6,7,7,8,9 排序后中位数为 27+7=7(中间两个值的平均)。平均数与中位数十分接近。
错误发生后,数据变为 5,6,7,7,8,50。此时平均数为 65+6+7+7+8+50=683≈13.83——被这一个错误值大幅拉高。
排序后的数据仍是 5,6,7,7,8,50,因此中位数仍为 27+7=7,完全不受影响。这正是当数据集可能包含录入错误或极端异常值时,中位数更受青睐的原因。
例题: 用标准差比较稳定性
两名球员在5场比赛中的得分如下。球员A:9,10,11,12,13。球员B:1,6,11,16,21。两人的平均分相同,但哪位球员更稳定?计算各自的标准差进行比较。
解答
两组数据的平均值都是 11:对A,59+10+11+12+13=555=11;对B,51+6+11+16+21=555=11。
对球员A,与 11 的偏差为 −2,−1,0,1,2,平方后为 4,1,0,1,4,相加为 10,因此方差为 510=2,标准差为 sA=2≈1.41。
对球员B,偏差为 −10,−5,0,5,10,平方后为 100,25,0,25,100,相加为 250,因此方差为 5250=50,sB=50≈7.07。由于 sA<sB,尽管两人场均都是 11 分,但球员A的发挥要稳定得多。
计算数据集 2,4,4,6,9 的平均数。
数据中的一个极端异常值,对哪种集中趋势指标的影响最小?
对于数据集 1,2,3,4,5,标准差 s 是多少?
配送时间(分钟)的箱线图显示 Q1=20,Q3=35。四分位距是多少?