25-第26讲-线性回归


1. 本讲内容

  • 为二元数据拟合曲线;
  • 衡量拟合优度;
  • 拟合程度与模型复杂度之间的权衡;
  • 均值回归;
  • 多元线性回归。

课程通知:期末考试复习题已经发布,本周答疑时间将在 Canvas 上公布。

2. R 测验回顾

全班整体表现很好,平均分为 47/50,中位数为 50/50。

标准化样本均值时要注意标准误为

贝叶斯更新的 R 代码框架为:

likelihood = dbinom(
  num_cured,
  num_patients,
  theta_values
)
bayes_numerator = likelihood * prior
posterior = bayes_numerator / sum(bayes_numerator)

3. 用“函数 + 噪声”建模二元数据

给定二元数据

模型写为

其中:

  • 是选定的模型函数;
  • 是随机误差;
  • 称为自变量、解释变量或预测变量;
  • 称为因变量或响应变量。

模型在给定 时预测或解释 的取值。误差通常来自模型不完美或测量不精确。

总平方误差为

可选模型包括:

以及

4. 简单线性回归

简单线性回归用一条直线拟合数据:

这里假设所有数据点具有相同的固定误差标准差

残差为

总平方误差为

最小二乘拟合选择使总平方误差最小的

5. 多项式回归

例如,用抛物线拟合:

要最小化

类似地也可拟合更高次多项式。

“线性回归”中的“线性”是指模型对未知参数线性。例如

虽然对 是二次函数,但对参数 是线性的,所以仍属于线性回归。

6. 拟合实例

讲义展示了两幅图:

  • 以 1960 年后的年数为 、邮票价格(美分)为 的线性拟合。模型预测 2021 年邮票价格为 53.6 美分,实际价格为 55 美分;
  • 一组散点数据的抛物线拟合。

这些例子说明,模型函数不一定必须是一条直线。

7. 课堂题:让模型拟合数据

给定数据

7.1 最佳拟合直线

模型为

总平方误差:

令偏导数为零:

得到正规方程

解得

因此最佳拟合直线为

7.2 最佳拟合抛物线

目标函数为

即可得到关于 的线性方程组。

由于三个 值互异,二次多项式可以精确通过三个点;解为

所以

的残差平方和为 0。

7.3 最佳拟合指数曲线

要拟合

对响应变量取对数:

于是对变换后的数据

进行简单线性回归,最小化

注意:这最小化的是对数尺度上的平方误差,并不等价于最小化原始 尺度上的平方误差。

7.4 最佳拟合三次函数

对一般数据

求使

最小的

8. 同方差与异方差

经典模型作出了重要假设:

如果残差在回归线周围的散布宽度大致均匀,称为同方差

如果残差散布随 或拟合值改变,例如呈漏斗形,则称为异方差。异方差会使经典标准误、置信区间和显著性检验失真,通常需要变换、加权最小二乘或稳健标准误等方法处理。

9. 简单线性回归公式

定义

则最小二乘估计为

这些公式只适用于带截距的简单线性回归。多项式和其他模型需要相应的正规方程或矩阵公式。

10. 课堂题:使用回归公式

仍使用数据

样本均值为

计算得

所以

这与直接用微积分得到的结果一致。

10.1 回归线通过中心点

由截距公式

可得

因此点

总在带截距的最小二乘回归线上。

10.2 最小二乘与最大似然

且误差相互独立、 固定的假设下,似然为

对数似然中与 有关的部分是

最大化似然等价于最小化残差平方和。因此,在正态同方差误差模型下,最小二乘估计就是 的最大似然估计。

11. 衡量拟合优度

这一部分不属于期末考试要求。

为响应变量观测值,

为拟合值。

总平方和为

表示响应变量的总变异。

残差平方和为

表示模型未解释的平方误差。

未解释变异所占比例为

决定系数为

可解释为模型所解释的 变异比例。

12. 过拟合与模型复杂度

  • 增加多项式次数不会降低训练数据上的
  • 但次数越高,模型越复杂;
  • 最合适的次数需要在拟合程度与复杂度之间权衡;
  • 若拟合曲线通过全部数据点,则 ,从而

训练数据上的完美拟合不保证对新数据预测良好。高次模型可能把随机噪声当作真实结构,这就是过拟合

13. 离群点和其他问题

单个离群点可能显著改变回归线,特别是当该点的 值远离其他观测时。这样的点具有较高杠杆,有时同时具有很大影响力。

因此,不能只查看回归系数;还应检查散点图、残差图和影响诊断。

14. 均值回归

假设一组儿童在 4 岁时接受智商测试,一年后再次测试。两次分数应当正相关,但不会完全相关。

  • 第一次处于最低 10% 的儿童,第二次通常会有所提高,即向总体均值回归;
  • 对这些儿童施加完全无效的干预,也可能被误认为提高了分数;
  • 第一次表现最好的儿童第二次往往有所下降,给予他们的奖励也可能被误认为导致成绩下降。

均值回归并不表示个体必然变得普通,而是说:在有随机波动的重复测量中,按一次极端结果筛选的群体,其下一次平均结果通常没那么极端。

15. 多元线性回归

对第 个观测,有 个预测变量:

模型为

其中 是解释变量或预测变量, 是响应变量。拟合值为

最小二乘法选择参数,使

最小。

实际模型通常还包括截距项;也可通过加入一列恒为 1 的预测变量把截距写入同一形式。

16. 本讲要点

  • 回归把响应变量表示为模型函数与随机误差之和;
  • 最小二乘法通过最小化残差平方和选择参数;
  • “线性”指模型对参数线性,而不要求拟合曲线是直线;
  • 简单线性回归的斜率为 ,回归线通过
  • 在独立正态同方差误差模型下,最小二乘估计等于最大似然估计;
  • 衡量样本内被解释的变异比例,但不能单独证明模型合理;
  • 需要警惕异方差、离群点、过拟合及均值回归;
  • 多元线性回归把同一思想扩展到多个预测变量。

文章作者: Gustavo
版权声明: 本博客所有文章除特別声明外,均采用 CC BY-NC 4.0 许可协议。转载请注明来源 Gustavo !
评论
  目录