1. 零假设检验图
典型检验图包含:
- 横轴:检验统计量
; - 蓝色曲线:零假设下的密度
; - 横轴上的指定区域:拒绝域;
- 零分布在拒绝域上的橙色面积:显著性水平。
因此
必须区分“拒绝域”与“曲线下的概率”:拒绝域是统计量可能值的集合,显著性才是零分布赋予该集合的概率。
2. 简单假设与复合假设
简单假设完全指定抽样分布,通常给参数一个具体值。
例如,抛硬币 30 次、正面数为
是简单假设,因为
复合假设包含多个可能分布,通常把参数限制在一个范围:
此时
3. 极端数据与 值
给定
- 从数据计算统计量
; - 在
下确定零分布; 决定单侧或双侧方向; - 选择显著性水平与拒绝域;
- 计算与观察值至少同样极端的零假设概率。
“至少同样极端”必须依照备择方向解释。
若观察值
并拒绝
若
并不拒绝
4. 临界值
拒绝域的边界称为临界值。
讲义用
它与分位数互补:
对标准正态分布:
而左端临界值为
在 R 中:
qnorm(0.975)
返回右尾面积为
5. 双侧 值
若双侧拒绝域把
对关于 0 对称的零分布,这化为
在不对称离散分布中,“双侧同样极端”的定义可能不唯一,应根据具体检验规则明确说明,而不能机械地将某个尾概率乘 2。
6. R 函数概念题
进行左侧
左侧临界值满足
所以使用
qnorm(0.1, 0, 1)
得到
左侧
所以使用
pnorm(1.8, 0, 1)
并得到约
因为观察值在右侧而备择拒绝方向在左侧,
7. 第一类错误、第二类错误与功效
| 真实状态 | 拒绝 |
不拒绝 |
|---|---|---|
| 第一类错误 | 正确决定 | |
| 正确决定 | 第二类错误 |
第一类错误概率为
它也称假阳性率。
第二类错误概率通常记为
检验功效为
因此:
- 显著性是零分布在拒绝域上的面积;
- 功效是备择分布在同一拒绝域上的面积。
功效依赖具体备择参数。对复合备择,功效是参数的函数,而不是单个固定数值。
8. 二项检验中的显著性与功效
设
零假设为
第一类错误概率就是
原幻灯片以橙框标出具体拒绝格子,但 PDF 文本层未保留颜色范围;计算时应对原图中所有橙框列分别使用上述三行概率求和。
通常,若拒绝域位于右尾,则
9. 怎样提高功效
在控制同一显著性水平的前提下,功效通常随以下因素提高:
- 样本量增大;
- 真实效应增大;
- 测量噪声或总体方差减小;
- 使用与科学问题相符的单侧检验;
- 研究设计减少混杂与不必要变异。
扩大拒绝域可提高功效,但同时也会提高第一类错误率。设计检验是在假阳性与假阴性之间权衡。
10. 只有零分布时能否求功效
若检验统计量在零假设下
且拒绝域为
显著性为
但不能仅凭零分布计算功效。还必须指定
11. 检验回顾
数据
检验
当
在
12. 单样本 检验
当
替代总体方差。
学生化均值为
若数据独立且来自正态总体,则在
即自由度
13. 单样本 与 检验例题
数据为
假设独立来自
显著性水平
样本均值为
已知
双侧
因为
未知
离均差为
平方和为
所以
自由度为 3。双侧 5% 临界值约为
因为
所以不拒绝
同一数据在已知方差的
14. 等方差双样本 检验
两组独立数据:
假设两组共享未知方差
合并方差为
检验统计量为
在
如果两组方差不相等,应使用 Welch
15. 两组孕期数据
某产科医院的 1408 名女性分为:
- 医疗原因入院:
, , ; - 未预约急诊入院:
, , 。
检验
在等方差假设下,
均值差的标准误为
因此
自由度为
双侧
估计差为
统计显著不自动意味着临床效应巨大,仍应报告差值与区间。
所作假设包括:
- 两组观测相互独立;
- 组内观测独立;
- 每组总体近似正态,或样本量足够大;
- 两组总体方差相同;
- 样本选择过程允许比较两组目标总体。
16. 发表筛选与第一类错误
只发表 的论文
不能仅由“发表门槛是 0.05”推断已发表论文中 5% 为第一类错误。还需要知道:
- 被检验的零假设有多少实际为真;
- 真效应研究的功效;
- 研究选择与多重检验;
- 分析和发表偏差。
Jerry 的治疗全部无效
Jerry 的所有零假设都真实,并使用
- 约
的实验会偶然得到 并发表; - 所有这些已发表结果都是第一类错误,因此已发表论文中错误比例为
。
Jen 的治疗全部有效
Jen 的所有备择假设都真实:
- 发表比例等于检验功效,必须根据效应大小、样本量和方差计算;
- 已发表论文中第一类错误比例为
,因为零假设从未真实。
她仍可能出现第二类错误,即有效治疗未达到显著而没有发表。
本讲要点
- 临界值是拒绝域边界,分位数与尾概率互补;
值中的“极端”由检验方向定义;- 第一类错误概率是显著性水平;
- 功效是在备择为真时正确拒绝零假设的概率;
- 功效必须针对具体备择分布计算;
- 未知总体方差时,正态均值检验使用
分布; - 等方差双样本
检验使用合并方差; - 显著性不等于效应大小或实际重要性;
- 发表结果中的错误比例不能直接由
推出。