05-回归分析


Dr. Kempthorne
2013 年秋

回归分析

1. 回归分析

  • 线性回归概述;
  • 普通最小二乘法(OLS);
  • Gauss–Markov 定理;
  • 广义最小二乘法(GLS);
  • 分布理论:正态回归模型;
  • 最大似然估计;
  • 广义 M 估计。

数据集

共有 个观测案例:

每个案例包含:

  • 一个响应变量(因变量)
  • 个解释变量(自变量)

回归分析的目标

提取并利用 之间的关系。主要用途包括:

  • 预测;
  • 因果推断;
  • 近似;
  • 描述函数关系。

对每个案例 ,条件分布 由下式描述:

其中拟合值为

回归参数向量为

这些参数对所有案例保持不变;而残差或误差变量 会随案例变化。

一般线性模型涵盖范围很广:

多项式近似

若解释变量是同一个变量 的不同幂,可令

Fourier 级数

可令

即把 Fourier 展开的不同正弦、余弦项作为解释变量。

时间序列回归

表示时间,并在解释变量中加入响应变量的滞后值。

需要注意:即使解释变量由 的非线性函数构成,只要 对回归参数 仍是线性的,该模型就仍属于线性回归模型。

  1. 提出模型。
    • 明确响应变量 ,包括其度量尺度;
    • 确定解释变量
    • 必要时加入解释变量的不同函数;
    • 对各案例上的误差 分布作出假设。
  2. 规定评价准则。 定义如何判断不同估计量的优劣。
  3. 求出并应用最佳估计量。 刻画在所选准则下的最佳估计量,并把它用于数据。
  4. 检查第 1 步中的假设。
  5. 修正并迭代。 必要时修改模型或假设,然后返回第 1 步。

第 1 步中可以采用不同层次的误差分布假设。

Gauss–Markov 假设

  • 均值为零;
  • 方差恒定;
  • 不同案例的误差不相关。

正态线性模型

即各误差相互独立、同分布,均服从均值为 0、方差为 的正态分布。

广义 Gauss–Markov 假设

  • 均值为零;
  • 允许一般形式的协方差矩阵;
  • 误差可以相关;
  • 方差可以不齐,即存在异方差。

非正态或非高斯分布

例如:

  • Laplace 分布;
  • Pareto 分布;
  • 污染正态分布。

在污染正态模型中,占比 的误差满足

其余占比 的误差服从某种污染分布,用于描述异常值或厚尾现象。

第 2 步中的估计量准则

  • 最小二乘;
  • 最大似然;
  • 稳健方法,即抵抗污染分布和异常值;
  • Bayes 方法:把 视为具有已知先验分布的随机变量;
  • 能够处理不完整或缺失数据的方法。

第 4 步中的案例分析

残差分析

模型误差 无法直接观测。若拟合得到回归参数

则模型残差为

影响诊断

识别哪些观测案例会对拟合结果产生特别大的影响。

异常值检测

查找明显偏离模型总体规律的观测。

本讲将依次讨论:

  1. 线性回归概述;
  2. 普通最小二乘法;
  3. Gauss–Markov 定理;
  4. 广义最小二乘法;
  5. 正态回归模型的分布理论;
  6. 最大似然估计;
  7. 广义 M 估计。

给定

定义最小二乘准则

普通最小二乘估计 是使 最小的参数向量。

矩阵记号

因此, 向量, 设计矩阵,而 向量。

拟合值向量为

于是

OLS 解 满足一阶条件

对第 个参数求偏导:

其中 表示 的第 列。

把所有参数的偏导数组合成梯度:

因此,OLS 估计 满足“正规方程”

等价地,

可逆,则

OLS 解唯一存在的条件为

OLS 参数估计为

拟合值为

用矩阵表示,

其中

帽子矩阵(hat matrix)。它把观测响应向量 映射为拟合值 ,仿佛给 “戴上一顶帽子”。

帽子矩阵 正交投影到设计矩阵 的列空间。

各观测的残差为

残差向量为

正规方程意味着

因此,最小二乘残差向量 的列空间正交。

本节转入 Gauss–Markov 定理,随后讨论广义最小二乘与正态回归模型的分布理论。

观测向量与设计矩阵为

是随机向量

的一次观测,且满足以下条件,则称数据服从满足 Gauss–Markov 假设的线性模型:

其中

维回归参数向量;并且存在 ,使

也就是说,在给定 后,产生各观测的随机变量互不相关,并具有相同方差

给定已知常数 ,考虑估计

在 Gauss–Markov 假设下,以最小二乘估计代入得到

这个估计量具有两个性质:

  1. 它是 的无偏估计量;
  2. 它是 的线性估计量,即存在只由 决定的已知常数 ,使

Gauss–Markov 定理
在 Gauss–Markov 假设下, 的所有线性无偏估计量中具有最小方差。因此它是 BLUE

Best Linear Unbiased Estimator,即最佳线性无偏估计量。

不失一般性,令 ,并定义

其最小二乘估计为

其中

所以 的线性估计。

考虑另一个线性估计量

其中 为固定系数。定义

无偏,因为 也无偏,所以

因此 的列空间正交。而 属于 的列空间,所以

正交,

利用

在所有线性无偏估计量中方差最小。证毕。

本节进入广义最小二乘法(GLS)。

把线性回归模型的 Gauss–Markov 假设推广为

其中随机 维误差向量满足

这里:

  • 是未知尺度参数;
  • 是已知的 正定矩阵;
  • 描述各观测的相对方差及相关关系。

对白化后的数据定义

模型变为

其中

由 Gauss–Markov 定理, 的最佳线性无偏估计,即 GLS 估计为

时,GLS 退化为普通最小二乘法。

本节进入正态线性回归模型的分布理论。

对每个观测

假设

则在给定 后,

并且各 之间相互独立。

使用向量形式:

其中

响应向量的条件均值为

响应向量的条件协方差矩阵为

逐元素写成

其中 Kronecker delta 满足

接下来将使用矩母函数推导:

  • 的联合分布;
  • 的联合分布。

维随机向量 和常数向量

其多元矩母函数为

因此

服从均值向量为 、协方差矩阵为 元正态分布。

维随机向量 与常数向量

定义

因此

代入

可得

以及

所以

这是多元正态分布的矩母函数,因而

因为

每个分量 的边际分布为

其中

考虑把 解释变量矩阵写成

其中:

  • 列正交矩阵,满足
  • 上三角矩阵。

的各列可以通过对

的列执行 Gram–Schmidt 标准正交化得到。

第一列满足

所以

第二列满足

左乘 ,利用列正交性:

因此 可由已知的 直接计算。

已知后,

对两边取平方范数:

右侧各项均已知。求得 后,

按同样方式继续,可逐列求出 的元素和 的列。

利用

可以把 OLS 公式化简为

参数估计的协方差为

帽子矩阵变为

因而

QR 分解既揭示了投影结构,也提供了比显式计算 更稳定的数值求解方法。

假设

定理
是秩为 矩阵。若

仍为正态随机向量:

其中

前面取 ,即可得到 的分布。下面换一种 来证明更完整的回归分布定理。

其中 为秩 矩阵,并且

则:

1.

相互独立;
2.

3.

4. 对

其中

原幻灯片的分母文字层遗漏了 ;按照 的标准误公式恢复为

结论 4 可由结论 1—3 与 Student 分布定义直接推出。

是约化 QR 分解。构造

使 正交矩阵,即

可通过继续 Gram–Schmidt 标准正交化得到:在构造完 后,以 的其余列补齐 的标准正交基。

考虑变换

其中 向量, 向量。

因为

又因为 正交,

因此

从而

相互独立。

只需进一步说明:

1.

因此二者分别是两个独立随机向量的函数,故相互独立。
2. 对 应用正态向量线性变换定理,即得

3.

右侧是 个独立 随机变量的平方和,所以

对于残差,

又因 正交且其行由 构成,

于是

本节进入最大似然估计。

考虑正态线性回归模型

似然函数定义为

其中右侧是:在已知数据矩阵 ,给定未知参数 时,观测向量 的条件联合概率密度。

参数的最大似然估计是使

达到最大的 取值;换言之,它们使实际观测到的数据 在模型下具有最大的密度。

因为各 独立,且

所以

忽略与参数无关的常数,对数似然为

其中

正是最小二乘准则。因此, 的 OLS 估计也是最大似然估计。

求导并令其为零,得到

该估计有偏。因为

所以无偏估计应使用

本节进入广义 M 估计。

给定数据 ,拟合线性回归模型

可以把 定义为使下列目标最小的参数:

不同的损失函数 产生不同估计量。

1. 最小二乘

2. 平均绝对偏差(MAD)

3. 最大似然

假设 独立,密度为

则负对数似然损失为

4. 稳健 M 估计

其中 为偶函数,并在 上单调递增。通过让大残差的损失增长慢于平方损失,可以降低异常值的影响。

给定固定分位数水平

采用不对称绝对损失:

  • 对应第 90 百分位数,即上十分位点;
  • 时两侧权重相同,对应绝对偏差估计,也就是中位数回归。

分位数回归不只估计条件均值,而能刻画响应变量条件分布的不同位置。


文章作者: Gustavo
版权声明: 本博客所有文章除特別声明外,均采用 CC BY-NC 4.0 许可协议。转载请注明来源 Gustavo !
评论
  目录