17-第17讲-频率学派统计与假设检验


1. 频率学派统计

频率学派是 20 世纪占主导地位的统计学流派,其常用工具包括:

  • 值;
  • 检验;
  • 检验;
  • 置信区间。

频率学派把概率解释为可重复随机试验中的长期频率。因此可以讨论:

  • 硬币正面的概率;
  • 某治疗治愈特定疾病的概率;
  • 测量误差的概率分布。

传统频率学派不使用概率表示对固定但未知参数或假设的主观不完全知识,因而通常不讨论:

  • 未知硬币正面概率本身的先验概率;
  • 治疗效力参数的先验分布;
  • 未知正态均值的概率分布。

在这种框架中,参数是固定未知量,随机性来自重复抽样的数据。

2. 贝叶斯与频率学派的分岔

贝叶斯公式为

当先验 已知时,所有流派都可以使用该公式。

当先验未知时:

  • 贝叶斯方法根据可用知识构造先验,再计算后验;
  • 频率学派避免给假设赋概率,主要依据似然和统计量的重复抽样分布作推断。

两条路径面对的是同一数据,但对“概率能否描述未知假设”的哲学解释不同。

3. 疾病筛查:已知与未知基准率

假设:

若基准率已知,可直接使用贝叶斯定理:

如果患病先验比例未知:

  • 贝叶斯方法可以提出主观或层级先验;
  • 传统频率方法只把

视为合法概率对象,而不直接给出

4. 频率学派如何看待先验、似然与后验

Jaam 每天迟到 小时,模型为

其中 未知。Jon 构造先验 ,观察迟到 后计算似然和后验。

传统频率学派认可:

因为它是给定固定参数后数据的抽样分布。

它不把先验 或后验 解释为固定参数的概率。因此概念题答案是“只认可似然”。

5. 统计量

工作定义:

统计量是可以完全由随机数据和已知常数计算出来的量。

统计量:

  • 不能依赖未知参数的真值;
  • 可以依赖检验中明确给定的假设参数值;
  • 因数据随机而本身也是随机变量。

例子:

  • 样本均值;
  • 样本最大值或最小值;
  • 最大似然估计;
  • 由数据计算的区间。

6. 哪些量是统计量

来自 ,而 未知。

(a) 样本中位数

完全由数据计算,是统计量。

(b) 的 0.25 至 0.75 分位区间

依赖未知真值 ,不是统计量。

(c) 真参数标准化均值

依赖未知真值,不是统计量。

(d) 与样本均值相差不到 1 的样本值集合

完全由数据计算,是统计量。

(e) 使用已知常数 5 与 3

是统计量。

(f) 使用给定假设值

其中 是检验中给定的值,所以也是统计量。

7. 零假设显著性检验

零假设显著性检验(NHST)的基本成分:

  • 零假设
  • 备择假设
  • 由数据计算的检验统计量
  • 的零分布;
  • 拒绝域;
  • 显著性水平

若观察到的统计量落入拒绝域,就拒绝 ,转而支持

显著性水平定义为

即当 真实时错误拒绝它的概率。

所有拒绝域和 值计算都基于“假设 成立”。

8. 公平硬币的双侧检验

未知正面概率为 ,抛 10 次。令

检验

下,

概率近似为:

0 1 2 3 4 5 6 7 8 9 10
.001 .010 .044 .117 .205 .246 .205 .117 .044 .010 .001

若拒绝域为

若目标显著性水平不超过 ,可使用

实际显著性水平约为

离散分布不能总构造恰好等于指定 的非随机拒绝域,因此通常选择不超过目标值的保守区域。

9. 图形中的显著性

若图上同时画出 下统计量的密度,显著性水平只由:

决定。

它不是备择密度下的面积,也不是两条曲线重叠区域。阴影必须按照零分布计算。

10. 双侧 检验

设独立数据

其中总体标准差 已知,均值 未知。检验

检验统计量为

下,

显著性水平为 的双侧拒绝域为

双侧 值为

,拒绝

11. 右侧 检验

若备择为

则拒绝域在右尾:

右侧 值为

检验方向必须在查看数据前由科学问题确定,不能根据观察结果临时选择单侧方向。

12. 可视化例题

数据来自

检验

收集 个数据,样本均值为

标准化:

时,右尾临界值为

由于

拒绝 。右尾 值约为

13. 双侧 统计量例题

已知:

个数据,样本均值为

显著性水平

拒绝域

观察到的

标准误为

所以

决策

所以不拒绝

未落入拒绝域与 是同一决策规则的两种等价表达。

14. 两枚硬币的简单假设

两枚硬币:

随机选中一枚,抛 8 次得到 6 次正面。

(a)

较大的正面次数支持 ,所以是右侧检验。

下,为使显著性不超过 ,拒绝域可取

因为

观察到 不在拒绝域,所以不拒绝

对应右尾 值约为

(b)

较小的正面次数支持 ,所以是左侧检验。

下,可取拒绝域

其概率约为

观察到 不在拒绝域,因此同样不拒绝

左尾 值约为

(c) 是否矛盾

不矛盾。“不拒绝 ”并不表示证明 为真;“不拒绝 ”也不表示证明 为真。数据量不足以在 5% 显著性水平下排除任一假设。

NHST 的结论是“拒绝”或“不拒绝”,不是“接受零假设”。

15. 简单假设与复合假设

  • 简单假设完全指定数据分布,例如
  • 复合假设包含多个参数值,例如

拒绝域应使所有零假设参数值下的第一类错误都得到控制。简单零假设只需一个零分布;复合零假设可能需要考虑最不利参数值。

16. 值不是什么

值是:

它不是:

  • 为真的概率;
  • 结果由随机偶然造成的概率;
  • 效应大小;
  • 研究可重复成功的概率。

值表示数据与零假设预测不协调,但不自动说明备择假设重要、模型正确或研究设计无偏。

本讲要点

  1. 频率学派把参数视为固定未知量,把概率用于重复抽样;
  2. 统计量只能依赖数据、已知常数和明确假设值;
  3. 显著性水平是 为真时落入拒绝域的概率;
  4. 拒绝域和 值都必须依据零分布计算;
  5. 检验方向由备择假设决定;
  6. 与统计量落入拒绝域等价;
  7. 不拒绝零假设不等于接受或证明零假设;
  8. 值不是零假设的后验概率。

文章作者: Gustavo
版权声明: 本博客所有文章除特別声明外,均采用 CC BY-NC 4.0 许可协议。转载请注明来源 Gustavo !
评论
  目录