MathLabs

確率と統計

記述統計学

平均・中央値・標準偏差などの指標でデータを要約し、グラフで表す統計学。

直観直感:少数の数字でデータを物語る

30個のクイズの点数を持つ先生や、1か月分の日々の売上を持つ店主を想像してほしい。何が起きたかを理解するために30個もの個別の数字をじっと見つめたい人はいない。記述統計学はデータ集合全体を一握りの数——典型的な値、値がどれくらい散らばっているか——に圧縮し、ひと目で比較・要約し、異常なものを見つけられるようにする。

上昇と谷を持つ非対称な曲線で、対称ではなく歪んだデータの形を示す図。
右に裾を引く計数分布(パラメータ λ=np\lambda = np のポアソン分布):nn や pp を大きくすると重心が右へ移り、分布がより対称に近づく。

中高中心を測る:平均値・中央値・最頻値

定義: 平均値

nn 個のデータ値 x1,x2,…,xnx_1, x_2, \ldots, x_n の平均値(または平均)は、それらすべてを足し合わせて個数で割ったものである。データ集合のすべての値を使うため、異常に大きい値や小さい値に敏感である。

xˉ=1n∑i=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i

ここで xˉ\bar x は平均値、nn はデータ値の個数、xix_i は合計される ii 番目の値である。xx の上の横棒は「xx の平均」を表す標準的な記法である。

定義: 中央値と最頻値

中央値とは、データを小さい順から大きい順に並べたときの真ん中の値である(nn が偶数の場合は真ん中の2つの値の平均)。最頻値とは最も多く現れる値である。平均値と異なり、中央値は極端な値がどれだけ離れているかを無視し——その順位だけが重要である——そのため外れ値に対して頑健である。

では、どの指標を使うべきか。データがほぼ対称で極端な値がない場合、平均値は効率的であり、すべての情報を使う。データに外れ値がある場合や大きく歪んでいる場合——世帯所得や住宅価格のように——中央値の方がより代表的な「典型」の値を与える。

平均値・中央値・最頻値の比較
指標定義外れ値に敏感か
平均値値の合計を個数で割ったものはい——すべての値が影響する
中央値並べ替えたときの真ん中の値いいえ——順位だけが重要
最頻値最も頻繁に現れる値いいえ

中高散らばりを測る:標準偏差と四分位数

2つのデータ集合は平均が同じでも、まったく違って見えることがある——一方は密集し、もう一方は大きく散らばっている。標準偏差 ss は、データ値が平均からどれくらい離れているかの典型的な距離を測ることでこれを捉える。

s=1n∑i=1n(xi−xˉ)2s = \sqrt{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar{x})^2}

各偏差 xi−xˉx_i-\bar x は二乗され(負と正の偏差が打ち消し合わないようにするため)、平均が取られ、その後平方根を取ることで単位が元のデータの尺度に戻る。ss が小さいことはデータが xˉ\bar x の周りに密集していることを意味し、ss が大きいことは散らばっていることを意味する。

IQR=Q3−Q1IQR = Q_3 - Q_1

四分位数は、並べ替えたデータを4つの等しい部分に分ける:Q1Q_1(25%地点)、中央値(50%)、Q3Q_3(75%)である。四分位範囲 IQR=Q3−Q1IQR = Q_3-Q_1 はデータの中央半分の散らばりを測り、中央値と同様に外れ値に対して頑健である——これはまさに箱ひげ図が描くもの、すなわち Q1Q_1 から Q3Q_3 までの箱と中央値の位置の線である。

任意のデータ集合 x1,x2,…,xnx_1, x_2, \ldots, x_n とその平均 xˉ\bar x に対して ∑i=1n(xi−xˉ)=0\sum_{i=1}^{n}(x_i-\bar x) = 0 が成り立つ。

なぜ正しいのか?

平均値はまさにデータの釣り合いの点として定義されている——各 xix_i に重りを置いたシーソーを思い浮かべてほしい——そのため平均より上の値は平均より下の値と正確に打ち消し合わなければならない。そうでなければ xˉ\bar x は釣り合いの点にならない。

証明

和を分配して展開する:∑i=1n(xi−xˉ)=∑i=1nxi−∑i=1nxˉ\sum_{i=1}^{n}(x_i-\bar x) = \sum_{i=1}^{n}x_i - \sum_{i=1}^{n}\bar x。第二の和は定数 xˉ\bar x を nn 回足し合わせるので ∑i=1nxˉ=nxˉ\sum_{i=1}^{n}\bar x = n\bar x となる。

定義により xˉ=1n∑i=1nxi\bar x = \frac{1}{n}\sum_{i=1}^{n}x_i であるから、両辺に nn を掛けると nxˉ=∑i=1nxin\bar x = \sum_{i=1}^{n}x_i が得られる。これは上の展開における最初の和とまったく同じ量である。

これを代入し直すと、∑i=1n(xi−xˉ)=∑i=1nxi−nxˉ=∑i=1nxi−∑i=1nxi=0\sum_{i=1}^{n}(x_i-\bar x) = \sum_{i=1}^{n}x_i - n\bar x = \sum_{i=1}^{n}x_i - \sum_{i=1}^{n}x_i = 0 となり、主張が証明される。

定数 a,ba,b に対して yi=axi+by_i = ax_i+b で新しいデータ集合を作るとき、yˉ=axˉ+b\bar y = a\bar x+b であり、新しい標準偏差は sy=∣a∣sxs_y = |a|s_x である。

なぜ正しいのか?

すべてのデータ点を同じ量 bb だけずらすと、平均もその分だけずれるが、点同士の相対的な散らばり方は変わらない。すべての点を aa 倍すると、平均も散らばりも aa 倍される(散らばりは負になれないため ∣a∣|a| を使う)。

証明

平均について:yˉ=1n∑i=1nyi=1n∑i=1n(axi+b)=an∑i=1nxi+1n∑i=1nb=axˉ+b\bar y = \frac{1}{n}\sum_{i=1}^{n}y_i = \frac{1}{n}\sum_{i=1}^{n}(ax_i+b) = \frac{a}{n}\sum_{i=1}^{n}x_i + \frac{1}{n}\sum_{i=1}^{n}b = a\bar x + b となる。ここで 1n∑xi=xˉ\frac{1}{n}\sum x_i = \bar x と 1n∑i=1nb=b\frac{1}{n}\sum_{i=1}^{n}b = b を用いた。

散らばりについては、まず yi−yˉ=(axi+b)−(axˉ+b)=a(xi−xˉ)y_i-\bar y = (ax_i+b)-(a\bar x+b) = a(x_i-\bar x) に注目する。定数のずれ bb は完全に打ち消され、倍された偏差だけが残る。

二乗して平均を取ると sy2=1n∑i=1n(yi−yˉ)2=1n∑i=1na2(xi−xˉ)2=a2sx2s_y^2 = \frac{1}{n}\sum_{i=1}^{n}(y_i-\bar y)^2 = \frac{1}{n}\sum_{i=1}^{n}a^2(x_i-\bar x)^2 = a^2 s_x^2 となる。両辺の平方根を取ると、平方根は常に非負であるから sy=∣a∣sxs_y = |a|s_x が得られる。

中高実世界での応用と具体例

記述統計学はいたるところにある:スポーツアナリストは打率をリーグ平均と比較し、工場は部品サイズの標準偏差を追跡して品質問題を発見し、気象サービスは1年だけの洪水が平均を歪めてしまうため中央値の降水量を報告し、企業は典型的な値と変動性の指標の両方とともに四半期の収益を報告する。

例: 外れ値が平均を狂わせる

ある家庭教師が6回のクイズの点数を記録する:5,6,7,7,8,95, 6, 7, 7, 8, 9。最後のクイズで、データ入力ミスにより 99 が 5050 に置き換わる。ミスの前と後で平均値と中央値を比較せよ。

解答

ミスの前:平均値は 5+6+7+7+8+96=426=7\frac{5+6+7+7+8+9}{6} = \frac{42}{6} = 7 であり、データ 5,6,7,7,8,95,6,7,7,8,9 を並べ替えると中央値は 7+72=7\frac{7+7}{2}=7(真ん中の2つの値の平均)となる。平均値と中央値はほぼ一致している。

ミスの後、データは 5,6,7,7,8,505,6,7,7,8,50 になる。平均値は今や 5+6+7+7+8+506=836≈13.83\frac{5+6+7+7+8+50}{6} = \frac{83}{6} \approx 13.83 となり——たった一つの誤った値によって大きく引き上げられている。

並べ替えたデータは依然として 5,6,7,7,8,505,6,7,7,8,50 なので、中央値は依然として 7+72=7\frac{7+7}{2}=7 であり、まったく影響を受けない。これこそ、データ集合にデータ入力ミスや極端な外れ値が含まれる可能性がある場合に中央値が好まれる理由である。

例: 標準偏差で安定性を比較する

2人の選手が5試合で得点する。選手A:9,10,11,12,139, 10, 11, 12, 13。選手B:1,6,11,16,211, 6, 11, 16, 21。両者は平均が同じだが、どちらの選手がより安定しているか。それぞれの標準偏差を計算して比較せよ。

解答

両方のデータ集合の平均は 1111 である。Aについては 9+10+11+12+135=555=11\frac{9+10+11+12+13}{5}=\frac{55}{5}=11、Bについては 1+6+11+16+215=555=11\frac{1+6+11+16+21}{5}=\frac{55}{5}=11 となる。

選手Aについて、1111 からの偏差は −2,−1,0,1,2-2,-1,0,1,2 であり、その二乗は 4,1,0,1,44,1,0,1,4 で合計は 1010 となる。したがって分散は 105=2\frac{10}{5}=2 であり、標準偏差は sA=2≈1.41s_A=\sqrt{2}\approx 1.41 となる。

選手Bについて、偏差は −10,−5,0,5,10-10,-5,0,5,10 であり、その二乗は 100,25,0,25,100100,25,0,25,100 で合計は 250250 となる。したがって分散は 2505=50\frac{250}{5}=50 であり sB=50≈7.07s_B=\sqrt{50}\approx 7.07 となる。sA<sBs_A < s_B なので、両者とも1試合平均 1111 点であるにもかかわらず、選手Aの方がはるかに安定して得点していることが分かる。

データ集合 2,4,4,6,92, 4, 4, 6, 9 の平均値を計算せよ。

データ中のただ一つの極端な外れ値の影響を最も受けにくい中心傾向の指標はどれか。

データ集合 1,2,3,4,51, 2, 3, 4, 5 について、標準偏差 ss はいくらか。

配達時間(分)の箱ひげ図で Q1=20Q_1=20、Q3=35Q_3=35 であった。四分位範囲はいくらか。

参考文献

  1. David Freedman, Robert Pisani, Roger Purves (2007). Statistics
  2. David S. Moore, William I. Notz (2020). The Basic Practice of Statistics