19-第19讲-卡方检验ANOVA与多重检验


1. 显著性检验的共同模式

不同检验遵循同一框架,差别主要在检验统计量的构造和零分布。

设计阶段

  1. 设计能够区分 的实验;
  2. 选择检验统计量
  3. 确定 下的分布;
  4. 预先选择显著性水平 和拒绝域;
  5. 若备择为简单假设,计算功效;
  6. 也可同时设定目标显著性与功效,再反推样本量。

实施阶段

  1. 收集数据;
  2. 计算观察统计量;
  3. 计算 值;
  4. ,拒绝

2. 模拟的作用

模拟用伪随机数据重复运行一个虚拟实验。大量重复后,可估计:

模拟有助于:

  • 检查理论公式;
  • 研究难以解析计算的统计量;
  • 估计有限样本误差率;
  • 比较不同实验设计。

但模拟中的模型和参数是研究者设定的,不能自动代表现实。

3. 为什么 值不能给出假设概率

Studio 7 的模拟分别记录:

  • 拒绝且 为真;
  • 拒绝且 为真;
  • 不拒绝且 为真;
  • 不拒绝且 为真。

模拟验证:

取决于模拟中 出现的比例,也就是假设的基准率。它可以接近 0、接近 1 或位于二者之间。

因此,两样本 检验得到

并不能推出“两组均值相同”的赔率为 或其他确定值。答案是未知,因为没有假设先验概率和备择下的似然。

4. 齐性卡方检验

有若干独立数据集,例如多个治疗组或多个地区的调查结果。零假设“齐性”表示各数据集来自相同的分类分布。

三种治疗

治疗 1 治疗 2 治疗 3 合计
治愈 50 30 12 92
未治愈 100 80 18 198
合计 150 110 30 290

检验

下,共同治愈率的 MLE 为

期望频数由

计算:

治疗 1 治疗 2 治疗 3
治愈期望 47.6 34.9 9.5
未治愈期望 102.4 75.1 20.5

5. Pearson 与似然比卡方统计量

Pearson 统计量为

似然比统计量为

并约定 的项贡献为 0。

本例中:

自由度为

下,两统计量均近似服从

右尾 值约为

所以不拒绝三种治疗具有相同治愈率的零假设。

6. 拟合优度检验:餐厅客流

店主声称周一至周六顾客比例为

Sal 观察到

总数为 200。

零假设:

期望频数为

计算得到

因为六类概率已完全给定、没有从数据估计参数,自由度为

Pearson 统计量的右尾 值约为 ,似然比统计量给出相近结果。因此若预先设定 ,会刚好拒绝店主分布;若使用更严格水平,则不拒绝。

7. 遗传连锁的拟合优度检验

甜豌豆中:

  • 紫花 对红花 显性;
  • 长花粉 对圆花粉 显性。

杂交:

产生 ,再作

若颜色与形状独立分配,则 表型比例应为

总数 2132,因此期望频数为:

表型 紫长 紫圆 红长 红圆
期望 1199.25 399.75 399.75 133.25
观察 1528 106 117 381

Pearson 统计量为

自由度为

值极接近 0,强烈拒绝独立分配。

观察中亲本组合“紫长”和“红圆”远多于预期,重组组合“紫圆”和“红长”远少于预期。这说明控制花色与花粉形状的基因在染色体上连锁,而不是独立遗传。

8. 分布

分布记为

其中 是两个自由度参数。

性质:

  • 由正态样本的方差比构造;
  • 取值范围为
  • 通常右偏;
  • 自由度较大时集中在 1 附近。

不同自由度组合,例如 ,曲线形状不同。

9. 单因素方差分析

单因素 ANOVA 检验多个组的均值是否相同。

设第 组第 个观测为

所有观测独立,且各组方差相同。

零假设:

设第 组样本量为 ,组均值为 ,总均值为 。组间平方和:

组内平方和:

均方为

检验统计量:

下,

若组均值确实相同,组间与组内均方都估计同一个 ,所以比值应接近 1;很大的 支持均值不全相等。

10. 三种治疗的恢复时间

数据:

治疗 1 治疗 2 治疗 3
6 8 13
8 12 9
4 9 11
5 11 8
3 6 7
4 8 12

三组均值为

总均值为

计算:

所以

时,讲义给出临界值

因为

拒绝三组平均恢复时间相等的零假设。数据提示至少一种治疗的平均恢复时间不同;从样本均值看,治疗 1 恢复最快。

ANOVA 本身不说明哪些具体组对不同,还需要经多重比较校正的事后检验。

11. 多重检验

六种治疗两两比较,需要

个双样本 检验。

若每个检验都用 ,并粗略假设各检验独立,则至少一次错误拒绝的概率为

所以最佳选项为“大于 0.25”。

实际两两检验共享数据,并不独立,但不作调整时整体第一类错误仍会显著膨胀。

ANOVA 的优势:

  • 用一个总体检验控制整体显著性;
  • 无需先运行所有成对检验。

局限:

  • 只回答“是否所有均值都相同”;
  • 拒绝后不能直接指出哪些组不同。

后续成对比较应使用 Bonferroni、Tukey 等方法控制家族错误率。

12. 独立性卡方检验

列联表:

教育 结婚一次 多次结婚 合计
大学 550 61 611
未上大学 681 144 825
合计 1231 205 1436

检验

独立性下的期望频数为:

教育 结婚一次 多次结婚
大学 523.775 87.225
未上大学 707.225 117.775

Pearson 统计量为

自由度为

时, 临界值约为 6.635。因为

拒绝独立性零假设; 值约为

该结果说明表中存在统计关联,不单独证明教育导致婚姻次数变化。年龄、队列、社会经济状况等变量都可能混杂。

13. 三类卡方检验的关系

  • 拟合优度检验:一个样本是否符合给定分类分布;
  • 齐性检验:多个总体是否共享同一分类分布;
  • 独立性检验:一个总体中的两个分类变量是否独立。

三者都使用观察频数、零假设期望频数和近似 零分布,但研究设计与假设解释不同。

常用条件包括:

  • 观测相互独立;
  • 分类互斥且完备;
  • 期望频数不能过小;
  • 自由度应扣除从数据估计的参数数目。

本讲要点

  1. 所有 NHST 方法都由统计量、零分布、拒绝域和 值组成;
  2. 值不能给出零假设为真的赔率;
  3. Pearson 与似然比 用于分类频数检验;
  4. 拟合优度、齐性和独立性检验有相同数学骨架;
  5. 单因素 ANOVA 用 比率检验多个均值是否全相同;
  6. 显著 ANOVA 需要后续校正比较才能定位组间差异;
  7. 多重检验会膨胀至少一次假阳性的概率;
  8. 统计关联不自动证明因果关系。

文章作者: Gustavo
版权声明: 本博客所有文章除特別声明外,均采用 CC BY-NC 4.0 许可协议。转载请注明来源 Gustavo !
评论
  目录