1. 显著性检验的共同模式
不同检验遵循同一框架,差别主要在检验统计量的构造和零分布。
设计阶段
- 设计能够区分
的实验; - 选择检验统计量
; - 确定
在 下的分布; - 预先选择显著性水平
和拒绝域; - 若备择为简单假设,计算功效;
- 也可同时设定目标显著性与功效,再反推样本量。
实施阶段
- 收集数据;
- 计算观察统计量;
- 计算
值; - 若
,拒绝 。
2. 模拟的作用
模拟用伪随机数据重复运行一个虚拟实验。大量重复后,可估计:
模拟有助于:
- 检查理论公式;
- 研究难以解析计算的统计量;
- 估计有限样本误差率;
- 比较不同实验设计。
但模拟中的模型和参数是研究者设定的,不能自动代表现实。
3. 为什么 值不能给出假设概率
Studio 7 的模拟分别记录:
- 拒绝且
为真; - 拒绝且
为真; - 不拒绝且
为真; - 不拒绝且
为真。
模拟验证:
和
但
取决于模拟中
因此,两样本
并不能推出“两组均值相同”的赔率为
4. 齐性卡方检验
有若干独立数据集,例如多个治疗组或多个地区的调查结果。零假设“齐性”表示各数据集来自相同的分类分布。
三种治疗
| 治疗 1 | 治疗 2 | 治疗 3 | 合计 | |
|---|---|---|---|---|
| 治愈 | 50 | 30 | 12 | 92 |
| 未治愈 | 100 | 80 | 18 | 198 |
| 合计 | 150 | 110 | 30 | 290 |
检验
在
期望频数由
计算:
| 治疗 1 | 治疗 2 | 治疗 3 | |
|---|---|---|---|
| 治愈期望 | 47.6 | 34.9 | 9.5 |
| 未治愈期望 | 102.4 | 75.1 | 20.5 |
5. Pearson 与似然比卡方统计量
Pearson 统计量为
似然比统计量为
并约定
本例中:
自由度为
在
右尾
所以不拒绝三种治疗具有相同治愈率的零假设。
6. 拟合优度检验:餐厅客流
店主声称周一至周六顾客比例为
Sal 观察到
总数为 200。
零假设:
期望频数为
计算得到
因为六类概率已完全给定、没有从数据估计参数,自由度为
Pearson 统计量的右尾
7. 遗传连锁的拟合优度检验
甜豌豆中:
- 紫花
对红花 显性; - 长花粉
对圆花粉 显性。
杂交:
产生
若颜色与形状独立分配,则
总数 2132,因此期望频数为:
| 表型 | 紫长 | 紫圆 | 红长 | 红圆 |
|---|---|---|---|---|
| 期望 | 1199.25 | 399.75 | 399.75 | 133.25 |
| 观察 | 1528 | 106 | 117 | 381 |
Pearson 统计量为
自由度为
观察中亲本组合“紫长”和“红圆”远多于预期,重组组合“紫圆”和“红长”远少于预期。这说明控制花色与花粉形状的基因在染色体上连锁,而不是独立遗传。
8. 分布
其中
性质:
- 由正态样本的方差比构造;
- 取值范围为
; - 通常右偏;
- 自由度较大时集中在 1 附近。
不同自由度组合,例如
9. 单因素方差分析
单因素 ANOVA 检验多个组的均值是否相同。
设第
所有观测独立,且各组方差相同。
零假设:
设第
组内平方和:
均方为
检验统计量:
在
若组均值确实相同,组间与组内均方都估计同一个
10. 三种治疗的恢复时间
数据:
| 治疗 1 | 治疗 2 | 治疗 3 |
|---|---|---|
| 6 | 8 | 13 |
| 8 | 12 | 9 |
| 4 | 9 | 11 |
| 5 | 11 | 8 |
| 3 | 6 | 7 |
| 4 | 8 | 12 |
三组均值为
总均值为
计算:
所以
在
因为
拒绝三组平均恢复时间相等的零假设。数据提示至少一种治疗的平均恢复时间不同;从样本均值看,治疗 1 恢复最快。
ANOVA 本身不说明哪些具体组对不同,还需要经多重比较校正的事后检验。
11. 多重检验
六种治疗两两比较,需要
个双样本
若每个检验都用
所以最佳选项为“大于 0.25”。
实际两两检验共享数据,并不独立,但不作调整时整体第一类错误仍会显著膨胀。
ANOVA 的优势:
- 用一个总体检验控制整体显著性;
- 无需先运行所有成对检验。
局限:
- 只回答“是否所有均值都相同”;
- 拒绝后不能直接指出哪些组不同。
后续成对比较应使用 Bonferroni、Tukey 等方法控制家族错误率。
12. 独立性卡方检验
列联表:
| 教育 | 结婚一次 | 多次结婚 | 合计 |
|---|---|---|---|
| 大学 | 550 | 61 | 611 |
| 未上大学 | 681 | 144 | 825 |
| 合计 | 1231 | 205 | 1436 |
检验
独立性下的期望频数为:
| 教育 | 结婚一次 | 多次结婚 |
|---|---|---|
| 大学 | 523.775 | 87.225 |
| 未上大学 | 707.225 | 117.775 |
Pearson 统计量为
自由度为
在
拒绝独立性零假设;
该结果说明表中存在统计关联,不单独证明教育导致婚姻次数变化。年龄、队列、社会经济状况等变量都可能混杂。
13. 三类卡方检验的关系
- 拟合优度检验:一个样本是否符合给定分类分布;
- 齐性检验:多个总体是否共享同一分类分布;
- 独立性检验:一个总体中的两个分类变量是否独立。
三者都使用观察频数、零假设期望频数和近似
常用条件包括:
- 观测相互独立;
- 分类互斥且完备;
- 期望频数不能过小;
- 自由度应扣除从数据估计的参数数目。
本讲要点
- 所有 NHST 方法都由统计量、零分布、拒绝域和
值组成; 值不能给出零假设为真的赔率; - Pearson
与似然比 用于分类频数检验; - 拟合优度、齐性和独立性检验有相同数学骨架;
- 单因素 ANOVA 用
比率检验多个均值是否全相同; - 显著 ANOVA 需要后续校正比较才能定位组间差异;
- 多重检验会膨胀至少一次假阳性的概率;
- 统计关联不自动证明因果关系。