← 戻る ライブラリ › 確率と統計 › 統計学 確率と統計
回帰分析 変数間の関係をモデル化し、他の変数から1つの変数を予測する手法。
直観 一方の変数からもう一方を予測する 学生グループの勉強時間と試験の得点を散布図にプロットしたとしよう。点は完全な直線上には乗らないが、明らかに右肩上がりの傾向がある:勉強時間が長いほど得点も高くなる傾向がある。回帰 とは、この漂うような点の集まりを、傾向を要約し新しい勉強時間に対する得点を予測できる、最もよく当てはまる1本の直線(または曲線)に変える手法である。
最小二乗法による線形回帰:橙色の直線は観測データ点までの鉛直残差(破線)の二乗和を最小にする。 大学 単回帰モデル 定義: 単回帰
対のデータ ( x 1 , y 1 ) , … , ( x n , y n ) (x_1,y_1),\dots,(x_n,y_n) ( x 1 , y 1 ) , … , ( x n , y n ) が与えられたとき、単回帰モデルは y y y が x x x に、直線とランダムな誤差を通じて依存すると仮定する:y = β 0 + β 1 x + ϵ y=\beta_0+\beta_1x+\epsilon y = β 0 + β 1 x + ϵ 。ここで β 0 \beta_0 β 0 は切片、β 1 \beta_1 β 1 は傾き、ϵ \epsilon ϵ は平均0のランダムな誤差項であり、直線が捉えきれないすべてを吸収する。
y = β 0 + β 1 x + ϵ y=\beta_0+\beta_1x+\epsilon y = β 0 + β 1 x + ϵ 切片 β 0 \beta_0 β 0 と傾き β 1 \beta_1 β 1 は未知の母集団パラメータ であり、直接観測することのできない固定された数である。手元にあるのは n n n 個のデータ点からなる標本であり、そこから推定量 β ^ 0 \hat\beta_0 β ^ 0 と β ^ 1 \hat\beta_1 β ^ 1 を計算する。当てはめ直線 y ^ = β ^ 0 + β ^ 1 x \hat y=\hat\beta_0+\hat\beta_1x y ^ = β ^ 0 + β ^ 1 x は真の直線に対する最良の推測であり、各データ点について残差 e i = y i − y ^ i e_i=y_i-\hat y_i e i = y i − y ^ i は当てはめ直線がその観測値をどれだけ外しているかを測る。
β ^ 1 = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) ∑ i = 1 n ( x i − x ˉ ) 2 , β ^ 0 = y ˉ − β ^ 1 x ˉ \hat\beta_1=\dfrac{\sum_{i=1}^n (x_i-\bar x)(y_i-\bar y)}{\sum_{i=1}^n (x_i-\bar x)^2},\qquad \hat\beta_0=\bar y-\hat\beta_1\bar x β ^ 1 = ∑ i = 1 n ( x i − x ˉ ) 2 ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) , β ^ 0 = y ˉ − β ^ 1 x ˉ すべての直線 y = b 0 + b 1 x y=b_0+b_1x y = b 0 + b 1 x の中で、残差平方和 ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 \sum_{i=1}^n (y_i-b_0-b_1x_i)^2 ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 を最小にする選択は b 1 = β ^ 1 = S x y S x x b_1=\hat\beta_1=\dfrac{S_{xy}}{S_{xx}} b 1 = β ^ 1 = S xx S x y および b 0 = β ^ 0 = y ˉ − β ^ 1 x ˉ b_0=\hat\beta_0=\bar y-\hat\beta_1\bar x b 0 = β ^ 0 = y ˉ − β ^ 1 x ˉ である。ここで S x y = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) S_{xy}=\sum_{i=1}^n(x_i-\bar x)(y_i-\bar y) S x y = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) 、S x x = ∑ i = 1 n ( x i − x ˉ ) 2 S_{xx}=\sum_{i=1}^n(x_i-\bar x)^2 S xx = ∑ i = 1 n ( x i − x ˉ ) 2 。
なぜ正しいのか? 残差平方和は b 0 b_0 b 0 と b 1 b_1 b 1 に関して滑らかな(二次で凸な)関数であるから、その最小値はちょうど両方の偏微分が0になる点で見つかる——お椀の底を、あらゆる方向の傾きを0にすることで見つけるのと同じ発想である。
証明 Q ( b 0 , b 1 ) = ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 Q(b_0,b_1)=\sum_{i=1}^n (y_i-b_0-b_1x_i)^2 Q ( b 0 , b 1 ) = ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 とおく。b 0 b_0 b 0 に関する偏微分を0とすると:∂ Q ∂ b 0 = − 2 ∑ i = 1 n ( y i − b 0 − b 1 x i ) = 0 \dfrac{\partial Q}{\partial b_0}=-2\sum_{i=1}^n(y_i-b_0-b_1x_i)=0 ∂ b 0 ∂ Q = − 2 ∑ i = 1 n ( y i − b 0 − b 1 x i ) = 0 、これは第一正規方程式 ∑ i = 1 n y i = n b 0 + b 1 ∑ i = 1 n x i \sum_{i=1}^n y_i = nb_0+b_1\sum_{i=1}^n x_i ∑ i = 1 n y i = n b 0 + b 1 ∑ i = 1 n x i 、すなわち b 0 = y ˉ − b 1 x ˉ b_0=\bar y-b_1\bar x b 0 = y ˉ − b 1 x ˉ に簡約される。
b 1 b_1 b 1 に関する偏微分を0とすると:∂ Q ∂ b 1 = − 2 ∑ i = 1 n x i ( y i − b 0 − b 1 x i ) = 0 \dfrac{\partial Q}{\partial b_1}=-2\sum_{i=1}^n x_i(y_i-b_0-b_1x_i)=0 ∂ b 1 ∂ Q = − 2 ∑ i = 1 n x i ( y i − b 0 − b 1 x i ) = 0 、第二正規方程式 ∑ i = 1 n x i y i = b 0 ∑ i = 1 n x i + b 1 ∑ i = 1 n x i 2 \sum_{i=1}^n x_iy_i = b_0\sum_{i=1}^n x_i+b_1\sum_{i=1}^n x_i^2 ∑ i = 1 n x i y i = b 0 ∑ i = 1 n x i + b 1 ∑ i = 1 n x i 2 。
第一式の b 0 = y ˉ − b 1 x ˉ b_0=\bar y-b_1\bar x b 0 = y ˉ − b 1 x ˉ を第二式に代入すると:∑ i = 1 n x i y i = ( y ˉ − b 1 x ˉ ) n x ˉ + b 1 ∑ i = 1 n x i 2 = n x ˉ y ˉ + b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) \sum_{i=1}^n x_iy_i = (\bar y-b_1\bar x)n\bar x+b_1\sum_{i=1}^n x_i^2 = n\bar x\bar y+b_1\left(\sum_{i=1}^n x_i^2-n\bar x^2\right) ∑ i = 1 n x i y i = ( y ˉ − b 1 x ˉ ) n x ˉ + b 1 ∑ i = 1 n x i 2 = n x ˉ y ˉ + b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) 。整理して b 1 b_1 b 1 を分離する:b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) = ∑ i = 1 n x i y i − n x ˉ y ˉ b_1\left(\sum_{i=1}^n x_i^2-n\bar x^2\right)=\sum_{i=1}^n x_iy_i-n\bar x\bar y b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) = ∑ i = 1 n x i y i − n x ˉ y ˉ 。
直接の代数展開により ∑ i = 1 n x i 2 − n x ˉ 2 = ∑ i = 1 n ( x i − x ˉ ) 2 = S x x \sum_{i=1}^n x_i^2-n\bar x^2=\sum_{i=1}^n(x_i-\bar x)^2=S_{xx} ∑ i = 1 n x i 2 − n x ˉ 2 = ∑ i = 1 n ( x i − x ˉ ) 2 = S xx 、∑ i = 1 n x i y i − n x ˉ y ˉ = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) = S x y \sum_{i=1}^n x_iy_i-n\bar x\bar y=\sum_{i=1}^n(x_i-\bar x)(y_i-\bar y)=S_{xy} ∑ i = 1 n x i y i − n x ˉ y ˉ = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) = S x y となるので、b 1 = S x y / S x x b_1=S_{xy}/S_{xx} b 1 = S x y / S xx 。これを戻すと b 0 = y ˉ − b 1 x ˉ b_0=\bar y-b_1\bar x b 0 = y ˉ − b 1 x ˉ が得られる。Q Q Q は ∣ b 0 ∣ , ∣ b 1 ∣ → ∞ |b_0|,|b_1|\to\infty ∣ b 0 ∣ , ∣ b 1 ∣ → ∞ で際限なく増加する二次形式の平方和であるから、この唯一の停留点が大域的最小値である。
大学 当てはまりの良さ:決定係数 R 2 = 1 − S S E S S T R^2=1-\dfrac{SSE}{SST} R 2 = 1 − S S T S S E 定義: 平方和とR 2 R^2 R 2
y y y の総変動を3つの平方和に分解する:S S T = ∑ i = 1 n ( y i − y ˉ ) 2 SST=\sum_{i=1}^n(y_i-\bar y)^2 S S T = ∑ i = 1 n ( y i − y ˉ ) 2 (総和)、S S R = ∑ i = 1 n ( y ^ i − y ˉ ) 2 SSR=\sum_{i=1}^n(\hat y_i-\bar y)^2 S S R = ∑ i = 1 n ( y ^ i − y ˉ ) 2 (回帰によって説明される部分)、S S E = ∑ i = 1 n ( y i − y ^ i ) 2 SSE=\sum_{i=1}^n(y_i-\hat y_i)^2 S S E = ∑ i = 1 n ( y i − y ^ i ) 2 (残差として残る部分)。決定係数 R 2 = S S R / S S T = 1 − S S E / S S T R^2=SSR/SST=1-SSE/SST R 2 = S S R / S S T = 1 − S S E / S S T は、直線が説明する y y y の変動の割合である。
単回帰において S S T = S S R + S S E SST=SSR+SSE S S T = S S R + S S E が成り立ち、したがって 0 ≤ R 2 ≤ 1 0\le R^2\le 1 0 ≤ R 2 ≤ 1 である。さらに R 2 R^2 R 2 は x x x と y y y の標本相関係数 r r r の二乗に等しい:R 2 = r 2 R^2=r^2 R 2 = r 2 。
なぜ正しいのか? 最小二乗による残差は、当てはめ値と常に無相関である。なぜなら β ^ 0 , β ^ 1 \hat\beta_0,\hat\beta_1 β ^ 0 , β ^ 1 を定める正規方程式こそが、まさにこれを強制する条件だからである。この直交性こそが、総変動を交差項なしに「説明される」部分と「残りの」部分へきれいに分解させる理由である。
証明 上で示した最小二乗定理の2つの正規方程式は ∑ i = 1 n e i = 0 \sum_{i=1}^n e_i=0 ∑ i = 1 n e i = 0 と ∑ i = 1 n x i e i = 0 \sum_{i=1}^n x_ie_i=0 ∑ i = 1 n x i e i = 0 を与える(ただし e i = y i − y ^ i e_i=y_i-\hat y_i e i = y i − y ^ i )。y ^ i = β ^ 0 + β ^ 1 x i \hat y_i=\hat\beta_0+\hat\beta_1x_i y ^ i = β ^ 0 + β ^ 1 x i は 1 1 1 と x i x_i x i の線形結合であるから、両正規方程式を組み合わせると ∑ i = 1 n e i y ^ i = β ^ 0 ∑ i = 1 n e i + β ^ 1 ∑ i = 1 n x i e i = 0 \sum_{i=1}^n e_i\hat y_i=\hat\beta_0\sum_{i=1}^n e_i+\hat\beta_1\sum_{i=1}^n x_ie_i=0 ∑ i = 1 n e i y ^ i = β ^ 0 ∑ i = 1 n e i + β ^ 1 ∑ i = 1 n x i e i = 0 が得られる。∑ e i = 0 \sum e_i=0 ∑ e i = 0 と合わせると ∑ i = 1 n e i ( y ^ i − y ˉ ) = ∑ e i y ^ i − y ˉ ∑ e i = 0 \sum_{i=1}^n e_i(\hat y_i-\bar y)=\sum e_i\hat y_i-\bar y\sum e_i=0 ∑ i = 1 n e i ( y ^ i − y ˉ ) = ∑ e i y ^ i − y ˉ ∑ e i = 0 。
次に S S T = ∑ i = 1 n ( y i − y ˉ ) 2 = ∑ i = 1 n ( ( y i − y ^ i ) + ( y ^ i − y ˉ ) ) 2 = ∑ e i 2 + 2 ∑ e i ( y ^ i − y ˉ ) + ∑ ( y ^ i − y ˉ ) 2 SST=\sum_{i=1}^n(y_i-\bar y)^2=\sum_{i=1}^n\big((y_i-\hat y_i)+(\hat y_i-\bar y)\big)^2=\sum e_i^2+2\sum e_i(\hat y_i-\bar y)+\sum(\hat y_i-\bar y)^2 S S T = ∑ i = 1 n ( y i − y ˉ ) 2 = ∑ i = 1 n ( ( y i − y ^ i ) + ( y ^ i − y ˉ ) ) 2 = ∑ e i 2 + 2 ∑ e i ( y ^ i − y ˉ ) + ∑ ( y ^ i − y ˉ ) 2 を展開する。交差項は今示した直交性により消え、S S T = S S E + S S R SST=SSE+SSR S S T = S S E + S S R が残る。
S S E = ∑ e i 2 ≥ 0 SSE=\sum e_i^2\ge0 S S E = ∑ e i 2 ≥ 0 、S S R = ∑ ( y ^ i − y ˉ ) 2 ≥ 0 SSR=\sum(\hat y_i-\bar y)^2\ge0 S S R = ∑ ( y ^ i − y ˉ ) 2 ≥ 0 であるから、S S T = S S R + S S E SST=SSR+SSE S S T = S S R + S S E を S S T > 0 SST>0 S S T > 0 で割ると R 2 = S S R / S S T ∈ [ 0 , 1 ] R^2=SSR/SST\in[0,1] R 2 = S S R / S S T ∈ [ 0 , 1 ] が得られる。
最後に、y ^ i − y ˉ = β ^ 1 ( x i − x ˉ ) \hat y_i-\bar y=\hat\beta_1(x_i-\bar x) y ^ i − y ˉ = β ^ 1 ( x i − x ˉ ) (なぜなら y ^ i = β ^ 0 + β ^ 1 x i \hat y_i=\hat\beta_0+\hat\beta_1x_i y ^ i = β ^ 0 + β ^ 1 x i 、y ˉ = β ^ 0 + β ^ 1 x ˉ \bar y=\hat\beta_0+\hat\beta_1\bar x y ˉ = β ^ 0 + β ^ 1 x ˉ であるから)なので S S R = β ^ 1 2 S x x SSR=\hat\beta_1^2S_{xx} S S R = β ^ 1 2 S xx 。β ^ 1 = S x y / S x x \hat\beta_1=S_{xy}/S_{xx} β ^ 1 = S x y / S xx を代入すると S S R = S x y 2 / S x x SSR=S_{xy}^2/S_{xx} S S R = S x y 2 / S xx 、S S T = S y y = ∑ ( y i − y ˉ ) 2 SST=S_{yy}=\sum(y_i-\bar y)^2 S S T = S y y = ∑ ( y i − y ˉ ) 2 であるから、R 2 = S x y 2 S x x S y y = ( S x y S x x S y y ) 2 = r 2 R^2=\dfrac{S_{xy}^2}{S_{xx}S_{yy}}=\left(\dfrac{S_{xy}}{\sqrt{S_{xx}S_{yy}}}\right)^2=r^2 R 2 = S xx S y y S x y 2 = ( S xx S y y S x y ) 2 = r 2 、すなわち標本相関係数の二乗となる。
例: 5つのデータ点への直線当てはめ
小さなデータセットが x = ( 1 , 2 , 3 , 4 , 5 ) x=(1,2,3,4,5) x = ( 1 , 2 , 3 , 4 , 5 ) 、y = ( 2 , 4 , 5 , 4 , 5 ) y=(2,4,5,4,5) y = ( 2 , 4 , 5 , 4 , 5 ) で与えられている。最小二乗直線を求め、R 2 R^2 R 2 を計算せよ。
解答 平均は x ˉ = 3 \bar x=3 x ˉ = 3 、y ˉ = 4 \bar y=4 y ˉ = 4 である。偏差 ( x i − x ˉ , y i − y ˉ ) (x_i-\bar x, y_i-\bar y) ( x i − x ˉ , y i − y ˉ ) は ( − 2 , − 2 ) , ( − 1 , 0 ) , ( 0 , 1 ) , ( 1 , 0 ) , ( 2 , 1 ) (-2,-2),(-1,0),(0,1),(1,0),(2,1) ( − 2 , − 2 ) , ( − 1 , 0 ) , ( 0 , 1 ) , ( 1 , 0 ) , ( 2 , 1 ) なので、S x y = 4 + 0 + 0 + 0 + 2 = 6 S_{xy}=4+0+0+0+2=6 S x y = 4 + 0 + 0 + 0 + 2 = 6 、S x x = 4 + 1 + 0 + 1 + 4 = 10 S_{xx}=4+1+0+1+4=10 S xx = 4 + 1 + 0 + 1 + 4 = 10 。
これより β ^ 1 = S x y / S x x = 6 / 10 = 0.6 \hat\beta_1=S_{xy}/S_{xx}=6/10=0.6 β ^ 1 = S x y / S xx = 6/10 = 0.6 、β ^ 0 = y ˉ − β ^ 1 x ˉ = 4 − 0.6 × 3 = 2.2 \hat\beta_0=\bar y-\hat\beta_1\bar x=4-0.6\times3=2.2 β ^ 0 = y ˉ − β ^ 1 x ˉ = 4 − 0.6 × 3 = 2.2 となり、当てはめ直線は y ^ = 0.6 x + 2.2 \hat y=0.6x+2.2 y ^ = 0.6 x + 2.2 。
R 2 R^2 R 2 については:S S T = ∑ ( y i − y ˉ ) 2 = 4 + 0 + 1 + 0 + 1 = 6 SST=\sum(y_i-\bar y)^2=4+0+1+0+1=6 S S T = ∑ ( y i − y ˉ ) 2 = 4 + 0 + 1 + 0 + 1 = 6 、S S R = β ^ 1 2 S x x = 0.36 × 10 = 3.6 SSR=\hat\beta_1^2S_{xx}=0.36\times10=3.6 S S R = β ^ 1 2 S xx = 0.36 × 10 = 3.6 なので R 2 = S S R / S S T = 3.6 / 6 = 0.6 R^2=SSR/SST=3.6/6=0.6 R 2 = S S R / S S T = 3.6/6 = 0.6 ——直線は y y y の変動の60%を説明する。
大学 モデルの検証:残差分析 直線を当てはめるのは簡単だが、それを信頼するにはモデルの仮定が実際に成り立っているかを確認する必要がある。残差 e i = y i − y ^ i e_i=y_i-\hat y_i e i = y i − y ^ i を x i x_i x i (あるいは y ^ i \hat y_i y ^ i )に対してプロットするのが標準的な診断法である:線形モデルが適切であれば、この残差プロット は0を中心に構造のないランダムな散らばりに見え、広がりもほぼ一定であるはずである。
残差プロットの読み方 残差プロットのパターン 示唆すること 0を中心にランダムに散らばり、広がりが一定 線形モデルと分散一定の仮定は妥当と考えられる 扇形(広がりが x x x とともに増大) 不均一分散:分散一定という仮定に反する 曲線状(U字型や弧状)のパターン 真の関係は非線形であり、直線は形として不適切
よくある誤り. 高い R 2 R^2 R 2 は関係が線形であることを証明しない し、相関は因果関係ではない 。非線形のデータに当てはめた回帰直線でも、観測範囲内で曲がりが緩やかであれば大きな R 2 R^2 R 2 を示すことがあり、x x x と y y y の間に完璧な線形の当てはまりがあっても、どちらか(あるいはどちらも)が他方の原因であるとは何も言えない——両者とも、測定されていない第三の変数によって動かされている可能性がある。当てはめた直線を観測された x i x_i x i の範囲を大きく超えて外挿することも危険である:データ内で成り立っていた線形パターンが、その外でも成り立つ保証はない。 歴史的ノート
最小二乗法は1805年、アドリアン=マリ・ルジャンドルによって、彗星の軌道決定に関する付録の中で最初に発表された。カール・フリードリヒ・ガウスは1795年からこの方法を使っていたと主張し、1809年には誤差の正規分布と結び付けた確率論的な正当化を与えた——この優先権論争は完全には決着しなかったが、この手法自体はデータに直線や曲線を当てはめる標準的な方法となった。
カール・フリードリヒ・ガウス
大学 実世界での応用と具体例 回帰は応用科学において最も広く使われる手法の一つである:経済学者はそれを使って、ある株式が市場全体とどれほど強く連動するかを推定し、生物学者はそれを使って動物の体サイズと代謝率を関連付け、技術者はそれを使って未知の測定器を既知の基準に対して較正し、疫学者はそれを使って薬の用量と測定された反応を関連付ける。どの場合でも、同じ2つの問いが生じる:当てはまりはどれほど良いか(R 2 R^2 R 2 )、そして残差プロットは何か隠れた問題を明らかにしていないか?
例: 気温からアイスクリーム売上を予測する
ある店が5日間の気温 x x x (°C)とアイスクリームの売上 y y y (個)を記録した:x = ( 20 , 25 , 30 , 35 , 40 ) x=(20,25,30,35,40) x = ( 20 , 25 , 30 , 35 , 40 ) 、y = ( 30 , 45 , 55 , 65 , 80 ) y=(30,45,55,65,80) y = ( 30 , 45 , 55 , 65 , 80 ) 。回帰直線を当てはめ、それを使って x = 32 x=32 x = 32 °Cでの売上を予測せよ。
解答 平均は x ˉ = 30 \bar x=30 x ˉ = 30 、y ˉ = 55 \bar y=55 y ˉ = 55 。偏差より S x y = ( − 10 ) ( − 25 ) + ( − 5 ) ( − 10 ) + 0 + 5 × 10 + 10 × 25 = 250 + 50 + 0 + 50 + 250 = 600 S_{xy}=(-10)(-25)+(-5)(-10)+0+5\times10+10\times25=250+50+0+50+250=600 S x y = ( − 10 ) ( − 25 ) + ( − 5 ) ( − 10 ) + 0 + 5 × 10 + 10 × 25 = 250 + 50 + 0 + 50 + 250 = 600 、S x x = 100 + 25 + 0 + 25 + 100 = 250 S_{xx}=100+25+0+25+100=250 S xx = 100 + 25 + 0 + 25 + 100 = 250 となり、β ^ 1 = 600 / 250 = 2.4 \hat\beta_1=600/250=2.4 β ^ 1 = 600/250 = 2.4 、β ^ 0 = 55 − 2.4 × 30 = − 17 \hat\beta_0=55-2.4\times30=-17 β ^ 0 = 55 − 2.4 × 30 = − 17 :当てはめ直線は y ^ = 2.4 x − 17 \hat y=2.4x-17 y ^ = 2.4 x − 17 。
x = 32 x=32 x = 32 のとき:y ^ = 2.4 × 32 − 17 = 76.8 − 17 = 59.8 \hat y=2.4\times32-17=76.8-17=59.8 y ^ = 2.4 × 32 − 17 = 76.8 − 17 = 59.8 なので、店はおよそ60個の販売を見込める。
当てはまりの確認:S S T = 625 + 100 + 0 + 100 + 625 = 1450 SST=625+100+0+100+625=1450 S S T = 625 + 100 + 0 + 100 + 625 = 1450 、S S R = β ^ 1 2 S x x = 5.76 × 250 = 1440 SSR=\hat\beta_1^2S_{xx}=5.76\times250=1440 S S R = β ^ 1 2 S xx = 5.76 × 250 = 1440 なので R 2 = 1440 / 1450 ≈ 0.993 R^2=1440/1450\approx0.993 R 2 = 1440/1450 ≈ 0.993 ——ここでは気温が売上の変動の約99.3%を説明しており、現実のデータとしては異例に良い当てはまりである。
例: 高いR 2 R^2 R 2 がなお問題を隠している例
あるエンジニアが、多数の圧力値にわたって基準測定器に対し reading = β 0 + β 1 ⋅ true pressure \text{reading}=\beta_0+\beta_1\cdot\text{true pressure} reading = β 0 + β 1 ⋅ true pressure を当てはめて新しい圧力センサーを較正したところ、R 2 = 0.95 R^2=0.95 R 2 = 0.95 という一見すばらしい結果が得られた。しかし残差を真の圧力に対してプロットすると、低圧と高圧では正、中間では負という明確なU字型の曲線が現れた。これは何を意味し、エンジニアは何をすべきか?
解答 高い R 2 R^2 R 2 は直線が全体的な 傾向をよく捉えていることしか示さず、関係が線形であることを保証するものではない。この系統的なU字型の残差パターンは、上の診断表にある「曲線状パターン」の兆候そのものである:これは、測定値と圧力の真の関係に、直線では捉えきれない曲がりがあることを意味する——センサーにはおそらく本物の二次(あるいは他の非線形)応答がある。
このパターンはランダムではなく系統的であるため、同じ圧力でデータを増やしても解決しない——ノイズが多いのではなく、モデル自体の指定が誤っているのである。残差が(明確なパターンを持つという意味で)有益でありながら、(高い R 2 R^2 R 2 を与えるという意味で)数値的には小さいという事実は、精度こそが目的である較正アプリケーションにおいて R 2 R^2 R 2 だけに頼るのが誤りである理由を示している。
解決策は直線を当て直すことではなく、モデル自体を変えることである:二次項を加える(reading = β 0 + β 1 ⋅ pressure + β 2 ⋅ pressure 2 \text{reading}=\beta_0+\beta_1\cdot\text{pressure}+\beta_2\cdot\text{pressure}^2 reading = β 0 + β 1 ⋅ pressure + β 2 ⋅ pressure 2 を当てはめる)か、センサー応答の既知の物理的変換を適用し、その後、新しい残差プロットが構造のないノイズに見えることを確認してから較正を信頼すべきである。
あるデータで S x y = 50 S_{xy}=50 S x y = 50 、S x x = 25 S_{xx}=25 S xx = 25 のとき、β ^ 1 \hat\beta_1 β ^ 1 はいくらか?
ある回帰で R 2 = 0.81 R^2=0.81 R 2 = 0.81 のとき、線形モデルによって説明されない y y y の変動の割合はどれだけか?
81% 19% 90% 9%
残差プロットが x x x の増加とともに広がる明確な扇形を示している。これは何を示すか?
不均一分散:誤差の分散が一定でない 完全な線形適合 R 2 R^2 R 2 が負でなければならないこと切片が0であること ある不動産モデルが price = β ^ 0 + β ^ 1 ⋅ sqft \text{price}=\hat\beta_0+\hat\beta_1\cdot\text{sqft} price = β ^ 0 + β ^ 1 ⋅ sqft (価格は千ドル単位)を β ^ 0 = 20 \hat\beta_0=20 β ^ 0 = 20 、β ^ 1 = 0.15 \hat\beta_1=0.15 β ^ 1 = 0.15 で当てはめている。1500平方フィートの住宅に対して予測される価格はいくらか?
245 225 20 200