確率と統計
記述統計学
平均・中央値・標準偏差などの指標でデータを要約し、グラフで表す統計学。
直観直感:少数の数字でデータを物語る
30個のクイズの点数を持つ先生や、1か月分の日々の売上を持つ店主を想像してほしい。何が起きたかを理解するために30個もの個別の数字をじっと見つめたい人はいない。記述統計学はデータ集合全体を一握りの数——典型的な値、値がどれくらい散らばっているか——に圧縮し、ひと目で比較・要約し、異常なものを見つけられるようにする。
右に裾を引く計数分布(パラメータ λ=np のポアソン分布):n や p を大きくすると重心が右へ移り、分布がより対称に近づく。中高中心を測る:平均値・中央値・最頻値
定義: 平均値
n 個のデータ値 x1,x2,…,xn の平均値(または平均)は、それらすべてを足し合わせて個数で割ったものである。データ集合のすべての値を使うため、異常に大きい値や小さい値に敏感である。
xˉ=n1i=1∑nxi ここで xˉ は平均値、n はデータ値の個数、xi は合計される i 番目の値である。x の上の横棒は「x の平均」を表す標準的な記法である。
定義: 中央値と最頻値
中央値とは、データを小さい順から大きい順に並べたときの真ん中の値である(n が偶数の場合は真ん中の2つの値の平均)。最頻値とは最も多く現れる値である。平均値と異なり、中央値は極端な値がどれだけ離れているかを無視し——その順位だけが重要である——そのため外れ値に対して頑健である。
では、どの指標を使うべきか。データがほぼ対称で極端な値がない場合、平均値は効率的であり、すべての情報を使う。データに外れ値がある場合や大きく歪んでいる場合——世帯所得や住宅価格のように——中央値の方がより代表的な「典型」の値を与える。
平均値・中央値・最頻値の比較| 指標 | 定義 | 外れ値に敏感か |
|---|
| 平均値 | 値の合計を個数で割ったもの | はい——すべての値が影響する |
| 中央値 | 並べ替えたときの真ん中の値 | いいえ——順位だけが重要 |
| 最頻値 | 最も頻繁に現れる値 | いいえ |
中高散らばりを測る:標準偏差と四分位数
2つのデータ集合は平均が同じでも、まったく違って見えることがある——一方は密集し、もう一方は大きく散らばっている。標準偏差 s は、データ値が平均からどれくらい離れているかの典型的な距離を測ることでこれを捉える。
s=n1i=1∑n(xi−xˉ)2 各偏差 xi−xˉ は二乗され(負と正の偏差が打ち消し合わないようにするため)、平均が取られ、その後平方根を取ることで単位が元のデータの尺度に戻る。s が小さいことはデータが xˉ の周りに密集していることを意味し、s が大きいことは散らばっていることを意味する。
IQR=Q3−Q1 四分位数は、並べ替えたデータを4つの等しい部分に分ける:Q1(25%地点)、中央値(50%)、Q3(75%)である。四分位範囲 IQR=Q3−Q1 はデータの中央半分の散らばりを測り、中央値と同様に外れ値に対して頑健である——これはまさに箱ひげ図が描くもの、すなわち Q1 から Q3 までの箱と中央値の位置の線である。
任意のデータ集合 x1,x2,…,xn とその平均 xˉ に対して ∑i=1n(xi−xˉ)=0 が成り立つ。
なぜ正しいのか?
平均値はまさにデータの釣り合いの点として定義されている——各 xi に重りを置いたシーソーを思い浮かべてほしい——そのため平均より上の値は平均より下の値と正確に打ち消し合わなければならない。そうでなければ xˉ は釣り合いの点にならない。
証明
和を分配して展開する:∑i=1n(xi−xˉ)=∑i=1nxi−∑i=1nxˉ。第二の和は定数 xˉ を n 回足し合わせるので ∑i=1nxˉ=nxˉ となる。
定義により xˉ=n1∑i=1nxi であるから、両辺に n を掛けると nxˉ=∑i=1nxi が得られる。これは上の展開における最初の和とまったく同じ量である。
これを代入し直すと、∑i=1n(xi−xˉ)=∑i=1nxi−nxˉ=∑i=1nxi−∑i=1nxi=0 となり、主張が証明される。
定数 a,b に対して yi=axi+b で新しいデータ集合を作るとき、yˉ=axˉ+b であり、新しい標準偏差は sy=∣a∣sx である。
なぜ正しいのか?
すべてのデータ点を同じ量 b だけずらすと、平均もその分だけずれるが、点同士の相対的な散らばり方は変わらない。すべての点を a 倍すると、平均も散らばりも a 倍される(散らばりは負になれないため ∣a∣ を使う)。
証明
平均について:yˉ=n1∑i=1nyi=n1∑i=1n(axi+b)=na∑i=1nxi+n1∑i=1nb=axˉ+b となる。ここで n1∑xi=xˉ と n1∑i=1nb=b を用いた。
散らばりについては、まず yi−yˉ=(axi+b)−(axˉ+b)=a(xi−xˉ) に注目する。定数のずれ b は完全に打ち消され、倍された偏差だけが残る。
二乗して平均を取ると sy2=n1∑i=1n(yi−yˉ)2=n1∑i=1na2(xi−xˉ)2=a2sx2 となる。両辺の平方根を取ると、平方根は常に非負であるから sy=∣a∣sx が得られる。
中高実世界での応用と具体例
記述統計学はいたるところにある:スポーツアナリストは打率をリーグ平均と比較し、工場は部品サイズの標準偏差を追跡して品質問題を発見し、気象サービスは1年だけの洪水が平均を歪めてしまうため中央値の降水量を報告し、企業は典型的な値と変動性の指標の両方とともに四半期の収益を報告する。
例: 外れ値が平均を狂わせる
ある家庭教師が6回のクイズの点数を記録する:5,6,7,7,8,9。最後のクイズで、データ入力ミスにより 9 が 50 に置き換わる。ミスの前と後で平均値と中央値を比較せよ。
解答
ミスの前:平均値は 65+6+7+7+8+9=642=7 であり、データ 5,6,7,7,8,9 を並べ替えると中央値は 27+7=7(真ん中の2つの値の平均)となる。平均値と中央値はほぼ一致している。
ミスの後、データは 5,6,7,7,8,50 になる。平均値は今や 65+6+7+7+8+50=683≈13.83 となり——たった一つの誤った値によって大きく引き上げられている。
並べ替えたデータは依然として 5,6,7,7,8,50 なので、中央値は依然として 27+7=7 であり、まったく影響を受けない。これこそ、データ集合にデータ入力ミスや極端な外れ値が含まれる可能性がある場合に中央値が好まれる理由である。
例: 標準偏差で安定性を比較する
2人の選手が5試合で得点する。選手A:9,10,11,12,13。選手B:1,6,11,16,21。両者は平均が同じだが、どちらの選手がより安定しているか。それぞれの標準偏差を計算して比較せよ。
解答
両方のデータ集合の平均は 11 である。Aについては 59+10+11+12+13=555=11、Bについては 51+6+11+16+21=555=11 となる。
選手Aについて、11 からの偏差は −2,−1,0,1,2 であり、その二乗は 4,1,0,1,4 で合計は 10 となる。したがって分散は 510=2 であり、標準偏差は sA=2≈1.41 となる。
選手Bについて、偏差は −10,−5,0,5,10 であり、その二乗は 100,25,0,25,100 で合計は 250 となる。したがって分散は 5250=50 であり sB=50≈7.07 となる。sA<sB なので、両者とも1試合平均 11 点であるにもかかわらず、選手Aの方がはるかに安定して得点していることが分かる。
データ集合 2,4,4,6,9 の平均値を計算せよ。
データ中のただ一つの極端な外れ値の影響を最も受けにくい中心傾向の指標はどれか。
データ集合 1,2,3,4,5 について、標準偏差 s はいくらか。
配達時間(分)の箱ひげ図で Q1=20、Q3=35 であった。四分位範囲はいくらか。