Dr. Kempthorne
2013 年秋
回归分析
1. 回归分析
- 线性回归概述;
- 普通最小二乘法(OLS);
- Gauss–Markov 定理;
- 广义最小二乘法(GLS);
- 分布理论:正态回归模型;
- 最大似然估计;
- 广义 M 估计。
数据集
共有
每个案例包含:
- 一个响应变量(因变量)
个解释变量(自变量)
回归分析的目标
提取并利用
- 预测;
- 因果推断;
- 近似;
- 描述函数关系。
对每个案例
其中拟合值为
回归参数向量为
这些参数对所有案例保持不变;而残差或误差变量
一般线性模型涵盖范围很广:
多项式近似
若解释变量是同一个变量
Fourier 级数
可令
即把 Fourier 展开的不同正弦、余弦项作为解释变量。
时间序列回归
以
需要注意:即使解释变量由
- 提出模型。
- 明确响应变量
,包括其度量尺度; - 确定解释变量
; - 必要时加入解释变量的不同函数;
- 对各案例上的误差
分布作出假设。
- 明确响应变量
- 规定评价准则。 定义如何判断不同估计量的优劣。
- 求出并应用最佳估计量。 刻画在所选准则下的最佳估计量,并把它用于数据。
- 检查第 1 步中的假设。
- 修正并迭代。 必要时修改模型或假设,然后返回第 1 步。
第 1 步中可以采用不同层次的误差分布假设。
Gauss–Markov 假设
- 均值为零;
- 方差恒定;
- 不同案例的误差不相关。
正态线性模型
即各误差相互独立、同分布,均服从均值为 0、方差为
广义 Gauss–Markov 假设
- 均值为零;
- 允许一般形式的协方差矩阵;
- 误差可以相关;
- 方差可以不齐,即存在异方差。
非正态或非高斯分布
例如:
- Laplace 分布;
- Pareto 分布;
- 污染正态分布。
在污染正态模型中,占比
其余占比
第 2 步中的估计量准则
- 最小二乘;
- 最大似然;
- 稳健方法,即抵抗污染分布和异常值;
- Bayes 方法:把
视为具有已知先验分布的随机变量; - 能够处理不完整或缺失数据的方法。
第 4 步中的案例分析
残差分析
模型误差
则模型残差为
影响诊断
识别哪些观测案例会对拟合结果产生特别大的影响。
异常值检测
查找明显偏离模型总体规律的观测。
本讲将依次讨论:
- 线性回归概述;
- 普通最小二乘法;
- Gauss–Markov 定理;
- 广义最小二乘法;
- 正态回归模型的分布理论;
- 最大似然估计;
- 广义 M 估计。
给定
定义最小二乘准则
普通最小二乘估计
矩阵记号
因此,
拟合值向量为
于是
OLS 解
对第
其中
把所有参数的偏导数组合成梯度:
因此,OLS 估计
等价地,
若
OLS 解唯一存在的条件为
OLS 参数估计为
拟合值为
用矩阵表示,
其中
是
帽子矩阵
各观测的残差为
残差向量为
正规方程意味着
因此,最小二乘残差向量
本节转入 Gauss–Markov 定理,随后讨论广义最小二乘与正态回归模型的分布理论。
观测向量与设计矩阵为
若
的一次观测,且满足以下条件,则称数据服从满足 Gauss–Markov 假设的线性模型:
其中
是
也就是说,在给定
给定已知常数
在 Gauss–Markov 假设下,以最小二乘估计代入得到
这个估计量具有两个性质:
- 它是
的无偏估计量; - 它是
的线性估计量,即存在只由 决定的已知常数 ,使
Gauss–Markov 定理
在 Gauss–Markov 假设下,
Best Linear Unbiased Estimator,即最佳线性无偏估计量。
不失一般性,令
对
其最小二乘估计为
其中
所以
考虑另一个线性估计量
其中
则
若
因此
由
利用
故
本节进入广义最小二乘法(GLS)。
把线性回归模型的 Gauss–Markov 假设推广为
其中随机
这里:
是未知尺度参数; 是已知的 正定矩阵; 描述各观测的相对方差及相关关系。
对白化后的数据定义
模型变为
其中
由 Gauss–Markov 定理,
当
本节进入正态线性回归模型的分布理论。
对每个观测
假设
则在给定
并且各
使用向量形式:
其中
响应向量的条件均值为
响应向量的条件协方差矩阵为
逐元素写成
其中 Kronecker delta 满足
接下来将使用矩母函数推导:
的联合分布; 的联合分布。
对
其多元矩母函数为
因此
即
对
定义
则
因此
代入
可得
以及
所以
这是多元正态分布的矩母函数,因而
因为
每个分量
其中
考虑把
其中:
是 列正交矩阵,满足 是 上三角矩阵。
记
则
的列执行 Gram–Schmidt 标准正交化得到。
设
第一列满足
所以
第二列满足
左乘
因此
在
对两边取平方范数:
右侧各项均已知。求得
按同样方式继续,可逐列求出
利用
可以把 OLS 公式化简为
参数估计的协方差为
帽子矩阵变为
因而
QR 分解既揭示了投影结构,也提供了比显式计算
假设
即
定理
设
则
其中
前面取
设
其中
则:
1.
相互独立;
2.
3.
4. 对
其中
原幻灯片的分母文字层遗漏了
;按照 的标准误公式恢复为 。
结论 4 可由结论 1—3 与 Student
设
使
考虑变换
其中
因为
又因为
因此
从而
且
只需进一步说明:
1.
因此二者分别是两个独立随机向量的函数,故相互独立。
2. 对
3.
右侧是
由
对于残差,
又因
于是
本节进入最大似然估计。
考虑正态线性回归模型
即
似然函数定义为
其中右侧是:在已知数据矩阵
参数的最大似然估计是使
达到最大的
因为各
所以
忽略与参数无关的常数,对数似然为
其中
正是最小二乘准则。因此,
对
该估计有偏。因为
所以无偏估计应使用
本节进入广义 M 估计。
给定数据
可以把
不同的损失函数
1. 最小二乘
2. 平均绝对偏差(MAD)
3. 最大似然
假设
则负对数似然损失为
4. 稳健 M 估计
其中
给定固定分位数水平
采用不对称绝对损失:
对应第 90 百分位数,即上十分位点; 时两侧权重相同,对应绝对偏差估计,也就是中位数回归。
分位数回归不只估计条件均值,而能刻画响应变量条件分布的不同位置。