← 返回 资料库 › 概率与统计 › 统计学 概率与统计
回归分析 对变量之间的关系建模,以便由其他变量预测某一变量。
直观 从一个变量预测另一个变量 假设你把一组学生的学习时长与他们的考试成绩画成散点图。这些点并不完全落在一条直线上,但明显呈上升趋势:学习时间越长,分数往往越高。回归 正是把这团漂移的点云,变成一条拟合最好的直线(或曲线)的工具,从而总结趋势,并对新的学习时长预测出对应的分数。
普通最小二乘线性回归:橙色直线使各观测数据点到直线的竖直残差(虚线)平方和达到最小。 大学 简单线性回归模型 定义: 简单线性回归
给定成对数据 ( x 1 , y 1 ) , … , ( x n , y n ) (x_1,y_1),\dots,(x_n,y_n) ( x 1 , y 1 ) , … , ( x n , y n ) ,简单线性回归模型假设 y y y 通过一条直线加随机噪声依赖于 x x x :y = β 0 + β 1 x + ϵ y=\beta_0+\beta_1x+\epsilon y = β 0 + β 1 x + ϵ ,其中 β 0 \beta_0 β 0 是截距,β 1 \beta_1 β 1 是斜率,ϵ \epsilon ϵ 是均值为0的随机误差项,吸收了直线未能捕捉到的一切。
y = β 0 + β 1 x + ϵ y=\beta_0+\beta_1x+\epsilon y = β 0 + β 1 x + ϵ 截距 β 0 \beta_0 β 0 与斜率 β 1 \beta_1 β 1 是未知的总体参数 :我们永远无法直接观测到的固定数值。我们拥有的是 n n n 个数据点组成的样本,由此计算出估计量 β ^ 0 \hat\beta_0 β ^ 0 与 β ^ 1 \hat\beta_1 β ^ 1 。拟合直线 y ^ = β ^ 0 + β ^ 1 x \hat y=\hat\beta_0+\hat\beta_1x y ^ = β ^ 0 + β ^ 1 x 是我们对真实直线的最佳猜测,而对每个数据点,残差 e i = y i − y ^ i e_i=y_i-\hat y_i e i = y i − y ^ i 衡量拟合直线偏离该观测值的程度。
β ^ 1 = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) ∑ i = 1 n ( x i − x ˉ ) 2 , β ^ 0 = y ˉ − β ^ 1 x ˉ \hat\beta_1=\dfrac{\sum_{i=1}^n (x_i-\bar x)(y_i-\bar y)}{\sum_{i=1}^n (x_i-\bar x)^2},\qquad \hat\beta_0=\bar y-\hat\beta_1\bar x β ^ 1 = ∑ i = 1 n ( x i − x ˉ ) 2 ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) , β ^ 0 = y ˉ − β ^ 1 x ˉ 在所有直线 y = b 0 + b 1 x y=b_0+b_1x y = b 0 + b 1 x 中,使残差平方和 ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 \sum_{i=1}^n (y_i-b_0-b_1x_i)^2 ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 最小的选择是 b 1 = β ^ 1 = S x y S x x b_1=\hat\beta_1=\dfrac{S_{xy}}{S_{xx}} b 1 = β ^ 1 = S xx S x y 与 b 0 = β ^ 0 = y ˉ − β ^ 1 x ˉ b_0=\hat\beta_0=\bar y-\hat\beta_1\bar x b 0 = β ^ 0 = y ˉ − β ^ 1 x ˉ ,其中 S x y = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) S_{xy}=\sum_{i=1}^n(x_i-\bar x)(y_i-\bar y) S x y = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) ,S x x = ∑ i = 1 n ( x i − x ˉ ) 2 S_{xx}=\sum_{i=1}^n(x_i-\bar x)^2 S xx = ∑ i = 1 n ( x i − x ˉ ) 2 。
为什么成立? 残差平方和是关于 b 0 b_0 b 0 与 b 1 b_1 b 1 的光滑(二次、凸)函数,因此其最小值恰好出现在两个偏导数同时为零之处——这与通过让碗在各个方向上的坡度都为零来找到碗底是同一个思路。
证明 记 Q ( b 0 , b 1 ) = ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 Q(b_0,b_1)=\sum_{i=1}^n (y_i-b_0-b_1x_i)^2 Q ( b 0 , b 1 ) = ∑ i = 1 n ( y i − b 0 − b 1 x i ) 2 。对 b 0 b_0 b 0 求偏导并令其为零:∂ Q ∂ b 0 = − 2 ∑ i = 1 n ( y i − b 0 − b 1 x i ) = 0 \dfrac{\partial Q}{\partial b_0}=-2\sum_{i=1}^n(y_i-b_0-b_1x_i)=0 ∂ b 0 ∂ Q = − 2 ∑ i = 1 n ( y i − b 0 − b 1 x i ) = 0 ,化简得第一正规方程 ∑ i = 1 n y i = n b 0 + b 1 ∑ i = 1 n x i \sum_{i=1}^n y_i = nb_0+b_1\sum_{i=1}^n x_i ∑ i = 1 n y i = n b 0 + b 1 ∑ i = 1 n x i ,即 b 0 = y ˉ − b 1 x ˉ b_0=\bar y-b_1\bar x b 0 = y ˉ − b 1 x ˉ 。
对 b 1 b_1 b 1 求偏导并令其为零:∂ Q ∂ b 1 = − 2 ∑ i = 1 n x i ( y i − b 0 − b 1 x i ) = 0 \dfrac{\partial Q}{\partial b_1}=-2\sum_{i=1}^n x_i(y_i-b_0-b_1x_i)=0 ∂ b 1 ∂ Q = − 2 ∑ i = 1 n x i ( y i − b 0 − b 1 x i ) = 0 ,即第二正规方程 ∑ i = 1 n x i y i = b 0 ∑ i = 1 n x i + b 1 ∑ i = 1 n x i 2 \sum_{i=1}^n x_iy_i = b_0\sum_{i=1}^n x_i+b_1\sum_{i=1}^n x_i^2 ∑ i = 1 n x i y i = b 0 ∑ i = 1 n x i + b 1 ∑ i = 1 n x i 2 。
将第一式 b 0 = y ˉ − b 1 x ˉ b_0=\bar y-b_1\bar x b 0 = y ˉ − b 1 x ˉ 代入第二式:∑ i = 1 n x i y i = ( y ˉ − b 1 x ˉ ) n x ˉ + b 1 ∑ i = 1 n x i 2 = n x ˉ y ˉ + b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) \sum_{i=1}^n x_iy_i = (\bar y-b_1\bar x)n\bar x+b_1\sum_{i=1}^n x_i^2 = n\bar x\bar y+b_1\left(\sum_{i=1}^n x_i^2-n\bar x^2\right) ∑ i = 1 n x i y i = ( y ˉ − b 1 x ˉ ) n x ˉ + b 1 ∑ i = 1 n x i 2 = n x ˉ y ˉ + b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) 。整理分离出 b 1 b_1 b 1 :b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) = ∑ i = 1 n x i y i − n x ˉ y ˉ b_1\left(\sum_{i=1}^n x_i^2-n\bar x^2\right)=\sum_{i=1}^n x_iy_i-n\bar x\bar y b 1 ( ∑ i = 1 n x i 2 − n x ˉ 2 ) = ∑ i = 1 n x i y i − n x ˉ y ˉ 。
直接的代数展开表明 ∑ i = 1 n x i 2 − n x ˉ 2 = ∑ i = 1 n ( x i − x ˉ ) 2 = S x x \sum_{i=1}^n x_i^2-n\bar x^2=\sum_{i=1}^n(x_i-\bar x)^2=S_{xx} ∑ i = 1 n x i 2 − n x ˉ 2 = ∑ i = 1 n ( x i − x ˉ ) 2 = S xx ,∑ i = 1 n x i y i − n x ˉ y ˉ = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) = S x y \sum_{i=1}^n x_iy_i-n\bar x\bar y=\sum_{i=1}^n(x_i-\bar x)(y_i-\bar y)=S_{xy} ∑ i = 1 n x i y i − n x ˉ y ˉ = ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) = S x y ,故 b 1 = S x y / S x x b_1=S_{xy}/S_{xx} b 1 = S x y / S xx 。代回即得 b 0 = y ˉ − b 1 x ˉ b_0=\bar y-b_1\bar x b 0 = y ˉ − b 1 x ˉ 。由于 Q Q Q 是当 ∣ b 0 ∣ , ∣ b 1 ∣ → ∞ |b_0|,|b_1|\to\infty ∣ b 0 ∣ , ∣ b 1 ∣ → ∞ 时无限增长的二次型平方和,这个唯一的驻点必是全局最小值。
大学 拟合优度:决定系数 R 2 = 1 − S S E S S T R^2=1-\dfrac{SSE}{SST} R 2 = 1 − S S T S S E 定义: 平方和与R 2 R^2 R 2
把 y y y 的总变差分解为三个平方和:S S T = ∑ i = 1 n ( y i − y ˉ ) 2 SST=\sum_{i=1}^n(y_i-\bar y)^2 S S T = ∑ i = 1 n ( y i − y ˉ ) 2 (总平方和)、S S R = ∑ i = 1 n ( y ^ i − y ˉ ) 2 SSR=\sum_{i=1}^n(\hat y_i-\bar y)^2 S S R = ∑ i = 1 n ( y ^ i − y ˉ ) 2 (回归解释的部分)与 S S E = ∑ i = 1 n ( y i − y ^ i ) 2 SSE=\sum_{i=1}^n(y_i-\hat y_i)^2 S S E = ∑ i = 1 n ( y i − y ^ i ) 2 (残留的残差部分)。决定系数 R 2 = S S R / S S T = 1 − S S E / S S T R^2=SSR/SST=1-SSE/SST R 2 = S S R / S S T = 1 − S S E / S S T 就是直线所解释的 y y y 变动所占的比例。
在简单线性回归中,S S T = S S R + S S E SST=SSR+SSE S S T = S S R + S S E ,因此 0 ≤ R 2 ≤ 1 0\le R^2\le 1 0 ≤ R 2 ≤ 1 ;此外 R 2 R^2 R 2 等于 x x x 与 y y y 的样本相关系数 r r r 的平方:R 2 = r 2 R^2=r^2 R 2 = r 2 。
为什么成立? 最小二乘拟合的残差总是与拟合值不相关,因为定义 β ^ 0 , β ^ 1 \hat\beta_0,\hat\beta_1 β ^ 0 , β ^ 1 的正规方程恰恰就是强制这一点成立的条件。正是这种正交性,使得总变差能干净地分解为"被解释"部分与"剩余"部分,而没有交叉项。
证明 上面最小二乘定理给出的两个正规方程为 ∑ i = 1 n e i = 0 \sum_{i=1}^n e_i=0 ∑ i = 1 n e i = 0 与 ∑ i = 1 n x i e i = 0 \sum_{i=1}^n x_ie_i=0 ∑ i = 1 n x i e i = 0 ,其中 e i = y i − y ^ i e_i=y_i-\hat y_i e i = y i − y ^ i 。由于 y ^ i = β ^ 0 + β ^ 1 x i \hat y_i=\hat\beta_0+\hat\beta_1x_i y ^ i = β ^ 0 + β ^ 1 x i 是 1 1 1 与 x i x_i x i 的线性组合,两个正规方程结合给出 ∑ i = 1 n e i y ^ i = β ^ 0 ∑ i = 1 n e i + β ^ 1 ∑ i = 1 n x i e i = 0 \sum_{i=1}^n e_i\hat y_i=\hat\beta_0\sum_{i=1}^n e_i+\hat\beta_1\sum_{i=1}^n x_ie_i=0 ∑ i = 1 n e i y ^ i = β ^ 0 ∑ i = 1 n e i + β ^ 1 ∑ i = 1 n x i e i = 0 。再结合 ∑ e i = 0 \sum e_i=0 ∑ e i = 0 ,得到 ∑ i = 1 n e i ( y ^ i − y ˉ ) = ∑ e i y ^ i − y ˉ ∑ e i = 0 \sum_{i=1}^n e_i(\hat y_i-\bar y)=\sum e_i\hat y_i-\bar y\sum e_i=0 ∑ i = 1 n e i ( y ^ i − y ˉ ) = ∑ e i y ^ i − y ˉ ∑ e i = 0 。
现在展开 S S T = ∑ i = 1 n ( y i − y ˉ ) 2 = ∑ i = 1 n ( ( y i − y ^ i ) + ( y ^ i − y ˉ ) ) 2 = ∑ e i 2 + 2 ∑ e i ( y ^ i − y ˉ ) + ∑ ( y ^ i − y ˉ ) 2 SST=\sum_{i=1}^n(y_i-\bar y)^2=\sum_{i=1}^n\big((y_i-\hat y_i)+(\hat y_i-\bar y)\big)^2=\sum e_i^2+2\sum e_i(\hat y_i-\bar y)+\sum(\hat y_i-\bar y)^2 S S T = ∑ i = 1 n ( y i − y ˉ ) 2 = ∑ i = 1 n ( ( y i − y ^ i ) + ( y ^ i − y ˉ ) ) 2 = ∑ e i 2 + 2 ∑ e i ( y ^ i − y ˉ ) + ∑ ( y ^ i − y ˉ ) 2 。交叉项由刚证明的正交性消去,剩下 S S T = S S E + S S R SST=SSE+SSR S S T = S S E + S S R 。
由于 S S E = ∑ e i 2 ≥ 0 SSE=\sum e_i^2\ge0 S S E = ∑ e i 2 ≥ 0 且 S S R = ∑ ( y ^ i − y ˉ ) 2 ≥ 0 SSR=\sum(\hat y_i-\bar y)^2\ge0 S S R = ∑ ( y ^ i − y ˉ ) 2 ≥ 0 ,将 S S T = S S R + S S E SST=SSR+SSE S S T = S S R + S S E 除以 S S T > 0 SST>0 S S T > 0 得 R 2 = S S R / S S T ∈ [ 0 , 1 ] R^2=SSR/SST\in[0,1] R 2 = S S R / S S T ∈ [ 0 , 1 ] 。
最后,y ^ i − y ˉ = β ^ 1 ( x i − x ˉ ) \hat y_i-\bar y=\hat\beta_1(x_i-\bar x) y ^ i − y ˉ = β ^ 1 ( x i − x ˉ ) (因为 y ^ i = β ^ 0 + β ^ 1 x i \hat y_i=\hat\beta_0+\hat\beta_1x_i y ^ i = β ^ 0 + β ^ 1 x i 且 y ˉ = β ^ 0 + β ^ 1 x ˉ \bar y=\hat\beta_0+\hat\beta_1\bar x y ˉ = β ^ 0 + β ^ 1 x ˉ ),故 S S R = β ^ 1 2 S x x SSR=\hat\beta_1^2S_{xx} S S R = β ^ 1 2 S xx 。代入 β ^ 1 = S x y / S x x \hat\beta_1=S_{xy}/S_{xx} β ^ 1 = S x y / S xx 得 S S R = S x y 2 / S x x SSR=S_{xy}^2/S_{xx} S S R = S x y 2 / S xx ,又 S S T = S y y = ∑ ( y i − y ˉ ) 2 SST=S_{yy}=\sum(y_i-\bar y)^2 S S T = S y y = ∑ ( y i − y ˉ ) 2 ,故 R 2 = S x y 2 S x x S y y = ( S x y S x x S y y ) 2 = r 2 R^2=\dfrac{S_{xy}^2}{S_{xx}S_{yy}}=\left(\dfrac{S_{xy}}{\sqrt{S_{xx}S_{yy}}}\right)^2=r^2 R 2 = S xx S y y S x y 2 = ( S xx S y y S x y ) 2 = r 2 ,即样本相关系数的平方。
例题: 为五个数据点拟合直线
一个小数据集为 x = ( 1 , 2 , 3 , 4 , 5 ) x=(1,2,3,4,5) x = ( 1 , 2 , 3 , 4 , 5 ) ,y = ( 2 , 4 , 5 , 4 , 5 ) y=(2,4,5,4,5) y = ( 2 , 4 , 5 , 4 , 5 ) 。求最小二乘直线并计算 R 2 R^2 R 2 。
解答 均值为 x ˉ = 3 \bar x=3 x ˉ = 3 ,y ˉ = 4 \bar y=4 y ˉ = 4 。偏差 ( x i − x ˉ , y i − y ˉ ) (x_i-\bar x, y_i-\bar y) ( x i − x ˉ , y i − y ˉ ) 为 ( − 2 , − 2 ) , ( − 1 , 0 ) , ( 0 , 1 ) , ( 1 , 0 ) , ( 2 , 1 ) (-2,-2),(-1,0),(0,1),(1,0),(2,1) ( − 2 , − 2 ) , ( − 1 , 0 ) , ( 0 , 1 ) , ( 1 , 0 ) , ( 2 , 1 ) ,故 S x y = 4 + 0 + 0 + 0 + 2 = 6 S_{xy}=4+0+0+0+2=6 S x y = 4 + 0 + 0 + 0 + 2 = 6 ,S x x = 4 + 1 + 0 + 1 + 4 = 10 S_{xx}=4+1+0+1+4=10 S xx = 4 + 1 + 0 + 1 + 4 = 10 。
由此 β ^ 1 = S x y / S x x = 6 / 10 = 0.6 \hat\beta_1=S_{xy}/S_{xx}=6/10=0.6 β ^ 1 = S x y / S xx = 6/10 = 0.6 ,β ^ 0 = y ˉ − β ^ 1 x ˉ = 4 − 0.6 × 3 = 2.2 \hat\beta_0=\bar y-\hat\beta_1\bar x=4-0.6\times3=2.2 β ^ 0 = y ˉ − β ^ 1 x ˉ = 4 − 0.6 × 3 = 2.2 ,拟合直线为 y ^ = 0.6 x + 2.2 \hat y=0.6x+2.2 y ^ = 0.6 x + 2.2 。
关于 R 2 R^2 R 2 :S S T = ∑ ( y i − y ˉ ) 2 = 4 + 0 + 1 + 0 + 1 = 6 SST=\sum(y_i-\bar y)^2=4+0+1+0+1=6 S S T = ∑ ( y i − y ˉ ) 2 = 4 + 0 + 1 + 0 + 1 = 6 ,S S R = β ^ 1 2 S x x = 0.36 × 10 = 3.6 SSR=\hat\beta_1^2S_{xx}=0.36\times10=3.6 S S R = β ^ 1 2 S xx = 0.36 × 10 = 3.6 ,故 R 2 = S S R / S S T = 3.6 / 6 = 0.6 R^2=SSR/SST=3.6/6=0.6 R 2 = S S R / S S T = 3.6/6 = 0.6 ——该直线解释了 y y y 变动的60%。
大学 检验模型:残差分析 拟合一条直线很容易;要信任它则需要检验模型的假设是否真的成立。将残差 e i = y i − y ^ i e_i=y_i-\hat y_i e i = y i − y ^ i 对 x i x_i x i (或对 y ^ i \hat y_i y ^ i )作图是标准的诊断方法:如果线性模型合适,这张残差图 应呈现出围绕0的、无结构的随机散布,且波动幅度大致恒定。
解读残差图 残差图中的模式 所提示的问题 围绕0随机散布,波动幅度恒定 线性模型与方差恒定的假设看起来是合理的 喇叭/扇形(波动随 x x x 增大) 异方差性:方差恒定的假设被违反 弯曲(U形或弧形)模式 真实关系是非线性的;直线的形状不对
常见错误. 较高的 R 2 R^2 R 2 并不能 证明关系是线性的,相关性也不是 因果关系。即使数据本身是非线性的,只要观测范围内的弯曲较为温和,拟合的回归直线仍可能报告很大的 R 2 R^2 R 2 ;即便 x x x 与 y y y 之间存在完美的线性拟合,也说不明是哪一个(如果有的话)导致了另一个——两者都可能是由某个未测量的第三变量驱动的。把拟合直线外推到远超观测 x i x_i x i 范围之外同样有风险:数据内部成立的线性模式,在此范围之外并不保证依然成立。 历史注记
最小二乘法最早由阿德里安-马里·勒让德于1805年在一篇关于确定彗星轨道的附录中发表。卡尔·弗里德里希·高斯声称自己从1795年起就已使用该方法,并于1809年给出了一个概率论证明,将其与误差的正态分布联系起来——这场优先权之争从未完全解决,但这一技术本身成为了对数据拟合直线与曲线的标准方法。
卡尔·弗里德里希·高斯
大学 实际应用与典型例题 回归是应用科学中使用最广泛的工具之一:经济学家用它估计一只股票与整体市场联动的强弱,生物学家用它把动物的体型与代谢率联系起来,工程师用它把仪器与已知基准进行校准,流行病学家用它把药物剂量与所测反应联系起来。在每一种情形下,都会出现同样的两个问题:拟合有多好(R 2 R^2 R 2 ),以及残差图是否暴露了某种隐藏的问题?
例题: 根据气温预测冰淇淋销量
某商店记录了五天的日气温 x x x (°C)与冰淇淋销量 y y y (件):x = ( 20 , 25 , 30 , 35 , 40 ) x=(20,25,30,35,40) x = ( 20 , 25 , 30 , 35 , 40 ) ,y = ( 30 , 45 , 55 , 65 , 80 ) y=(30,45,55,65,80) y = ( 30 , 45 , 55 , 65 , 80 ) 。拟合一条回归直线,并用它预测 x = 32 x=32 x = 32 °C 时的销量。
解答 均值为 x ˉ = 30 \bar x=30 x ˉ = 30 ,y ˉ = 55 \bar y=55 y ˉ = 55 。由偏差得 S x y = ( − 10 ) ( − 25 ) + ( − 5 ) ( − 10 ) + 0 + 5 × 10 + 10 × 25 = 250 + 50 + 0 + 50 + 250 = 600 S_{xy}=(-10)(-25)+(-5)(-10)+0+5\times10+10\times25=250+50+0+50+250=600 S x y = ( − 10 ) ( − 25 ) + ( − 5 ) ( − 10 ) + 0 + 5 × 10 + 10 × 25 = 250 + 50 + 0 + 50 + 250 = 600 ,S x x = 100 + 25 + 0 + 25 + 100 = 250 S_{xx}=100+25+0+25+100=250 S xx = 100 + 25 + 0 + 25 + 100 = 250 ,故 β ^ 1 = 600 / 250 = 2.4 \hat\beta_1=600/250=2.4 β ^ 1 = 600/250 = 2.4 ,β ^ 0 = 55 − 2.4 × 30 = − 17 \hat\beta_0=55-2.4\times30=-17 β ^ 0 = 55 − 2.4 × 30 = − 17 :拟合直线为 y ^ = 2.4 x − 17 \hat y=2.4x-17 y ^ = 2.4 x − 17 。
当 x = 32 x=32 x = 32 时:y ^ = 2.4 × 32 − 17 = 76.8 − 17 = 59.8 \hat y=2.4\times32-17=76.8-17=59.8 y ^ = 2.4 × 32 − 17 = 76.8 − 17 = 59.8 ,商店应预计卖出约60件。
检验拟合优度:S S T = 625 + 100 + 0 + 100 + 625 = 1450 SST=625+100+0+100+625=1450 S S T = 625 + 100 + 0 + 100 + 625 = 1450 ,S S R = β ^ 1 2 S x x = 5.76 × 250 = 1440 SSR=\hat\beta_1^2S_{xx}=5.76\times250=1440 S S R = β ^ 1 2 S xx = 5.76 × 250 = 1440 ,故 R 2 = 1440 / 1450 ≈ 0.993 R^2=1440/1450\approx0.993 R 2 = 1440/1450 ≈ 0.993 ——此处气温解释了销量约99.3%的变动,这是现实数据中异常紧密的拟合。
例题: 高R 2 R^2 R 2 仍掩盖着问题的例子
一位工程师通过在多个压力值下,将 reading = β 0 + β 1 ⋅ true pressure \text{reading}=\beta_0+\beta_1\cdot\text{true pressure} reading = β 0 + β 1 ⋅ true pressure 与参考仪器拟合来校准一个新的压力传感器,得到 R 2 = 0.95 R^2=0.95 R 2 = 0.95 ——看起来非常出色。但把残差对真实压力作图后,却出现明显的U形曲线:低压和高压处残差为正,中间处残差为负。这说明了什么?工程师该怎么做?
解答 高 R 2 R^2 R 2 只能说明直线很好地跟随了总体 趋势,并不能证明关系是线性的。这种系统性的U形残差模式,正是上面诊断表中"弯曲模式"的标志:它意味着读数与压力之间的真实关系存在直线未能捕捉到的弯曲——传感器很可能确实存在二次(或其他非线性)响应。
由于这种模式是系统性的而非随机的,在相同压力下再收集更多数据也无法解决问题——出问题的是模型本身设定错误,而不只是噪声。残差既(因具有明显模式而)有信息量,数值上又(因给出高 R 2 R^2 R 2 而)偏小,这说明在以精度为核心目标的校准应用中,仅依赖 R 2 R^2 R 2 是一个错误。
解决办法是更换模型,而不仅仅是重新拟合直线:加入二次项(拟合 reading = β 0 + β 1 ⋅ pressure + β 2 ⋅ pressure 2 \text{reading}=\beta_0+\beta_1\cdot\text{pressure}+\beta_2\cdot\text{pressure}^2 reading = β 0 + β 1 ⋅ pressure + β 2 ⋅ pressure 2 ),或对传感器响应应用某种已知的物理变换,然后再检查新的残差图是否呈现无结构的噪声,之后才能信任这次校准。
某数据集有 S x y = 50 S_{xy}=50 S x y = 50 ,S x x = 25 S_{xx}=25 S xx = 25 ,求 β ^ 1 \hat\beta_1 β ^ 1 。
若某回归的 R 2 = 0.81 R^2=0.81 R 2 = 0.81 ,线性模型未能解释 的 y y y 变动比例是多少?
81% 19% 90% 9%
一张残差图呈现出随 x x x 增大而变宽的明显喇叭形。这说明了什么?
异方差性:误差方差不恒定 完美的线性拟合 R 2 R^2 R 2 必然为负截距为零 某房地产模型拟合 price = β ^ 0 + β ^ 1 ⋅ sqft \text{price}=\hat\beta_0+\hat\beta_1\cdot\text{sqft} price = β ^ 0 + β ^ 1 ⋅ sqft (价格单位为千美元),其中 β ^ 0 = 20 \hat\beta_0=20 β ^ 0 = 20 ,β ^ 1 = 0.15 \hat\beta_1=0.15 β ^ 1 = 0.15 。对一栋1500平方英尺的房屋,该模型预测的价格是多少?
245 225 20 200