18-第18讲-p值功效与t检验


1. 零假设检验图

典型检验图包含:

  • 横轴:检验统计量
  • 蓝色曲线:零假设下的密度
  • 横轴上的指定区域:拒绝域;
  • 零分布在拒绝域上的橙色面积:显著性水平。

因此

必须区分“拒绝域”与“曲线下的概率”:拒绝域是统计量可能值的集合,显著性才是零分布赋予该集合的概率。

2. 简单假设与复合假设

简单假设完全指定抽样分布,通常给参数一个具体值。

例如,抛硬币 30 次、正面数为

是简单假设,因为

复合假设包含多个可能分布,通常把参数限制在一个范围:

此时 的具体分布仍取决于未知的

3. 极端数据与

给定

  1. 从数据计算统计量
  2. 下确定零分布;
  3. 决定单侧或双侧方向;
  4. 选择显著性水平与拒绝域;
  5. 计算与观察值至少同样极端的零假设概率。

值定义为

“至少同样极端”必须依照备择方向解释。

若观察值 位于右侧拒绝域,则其右尾 值面积小于整个拒绝尾的 ,所以

并拒绝

仍在非拒绝区,则右尾 值面积大于拒绝尾面积,所以

并不拒绝

4. 临界值

拒绝域的边界称为临界值

讲义用 表示右侧面积为 的临界值:

它与分位数互补:

对标准正态分布:

而左端临界值为

在 R 中:

qnorm(0.975)

返回右尾面积为 的正态临界值。

5. 双侧

若双侧拒绝域把 平分在左右两尾,则一般可计算

对关于 0 对称的零分布,这化为

在不对称离散分布中,“双侧同样极端”的定义可能不唯一,应根据具体检验规则明确说明,而不能机械地将某个尾概率乘 2。

6. R 函数概念题

进行左侧 检验:

左侧临界值满足

所以使用

qnorm(0.1, 0, 1)

得到

左侧 值为

所以使用

pnorm(1.8, 0, 1)

并得到约

因为观察值在右侧而备择拒绝方向在左侧, 很大,故不拒绝

7. 第一类错误、第二类错误与功效

真实状态 拒绝 不拒绝
为真 第一类错误 正确决定
为真 正确决定 第二类错误

第一类错误概率为

它也称假阳性率。

第二类错误概率通常记为

检验功效为

因此:

  • 显著性是零分布在拒绝域上的面积;
  • 功效是备择分布在同一拒绝域上的面积。

功效依赖具体备择参数。对复合备择,功效是参数的函数,而不是单个固定数值。

8. 二项检验中的显著性与功效

零假设为 ,备择例子为 。若拒绝域为一组高正面次数 ,则:

第一类错误概率就是 。在给定备择 下,第二类错误概率为

原幻灯片以橙框标出具体拒绝格子,但 PDF 文本层未保留颜色范围;计算时应对原图中所有橙框列分别使用上述三行概率求和。

通常,若拒绝域位于右尾,则 的分布比 更向右移,因而功效更高。

9. 怎样提高功效

在控制同一显著性水平的前提下,功效通常随以下因素提高:

  • 样本量增大;
  • 真实效应增大;
  • 测量噪声或总体方差减小;
  • 使用与科学问题相符的单侧检验;
  • 研究设计减少混杂与不必要变异。

扩大拒绝域可提高功效,但同时也会提高第一类错误率。设计检验是在假阳性与假阴性之间权衡。

10. 只有零分布时能否求功效

若检验统计量在零假设下

且拒绝域为

显著性为

但不能仅凭零分布计算功效。还必须指定 的分布。若备择为复合假设,则应给出功效函数。

11. 检验回顾

数据

检验

已知时,

下严格服从

12. 单样本 检验

未知时,用样本标准差

替代总体方差。

学生化均值为

若数据独立且来自正态总体,则在

即自由度 的 Student 分布。

分布比标准正态尾部更厚,反映用样本估计 带来的额外不确定性。自由度增大时, 分布趋近

13. 单样本 检验例题

数据为

假设独立来自 。检验

显著性水平 。这是双侧检验。

样本均值为

已知

双侧 值为

因为 ,拒绝

未知

离均差为

平方和为

所以

自由度为 3。双侧 5% 临界值约为

因为

所以不拒绝 ;双侧 值约为

同一数据在已知方差的 检验中显著、在未知方差的小样本 检验中不显著,原因是后者计入了方差估计的不确定性。

14. 等方差双样本 检验

两组独立数据:

假设两组共享未知方差 。检验

合并方差为

检验统计量为

下,

如果两组方差不相等,应使用 Welch 检验而不是强行合并方差。

15. 两组孕期数据

某产科医院的 1408 名女性分为:

  • 医疗原因入院:
  • 未预约急诊入院:

检验

在等方差假设下,

均值差的标准误为

因此

自由度为

双侧 值约为 ,所以在 5% 水平拒绝均值相等的零假设。

估计差为

统计显著不自动意味着临床效应巨大,仍应报告差值与区间。

所作假设包括:

  • 两组观测相互独立;
  • 组内观测独立;
  • 每组总体近似正态,或样本量足够大;
  • 两组总体方差相同;
  • 样本选择过程允许比较两组目标总体。

16. 发表筛选与第一类错误

只发表 的论文

不能仅由“发表门槛是 0.05”推断已发表论文中 5% 为第一类错误。还需要知道:

  • 被检验的零假设有多少实际为真;
  • 真效应研究的功效;
  • 研究选择与多重检验;
  • 分析和发表偏差。

是“在 为真时,单项规范检验被错误发表为显著”的条件概率,不是“已发表显著论文中错误者的比例”。

Jerry 的治疗全部无效

Jerry 的所有零假设都真实,并使用

  • 的实验会偶然得到 并发表;
  • 所有这些已发表结果都是第一类错误,因此已发表论文中错误比例为

Jen 的治疗全部有效

Jen 的所有备择假设都真实:

  • 发表比例等于检验功效,必须根据效应大小、样本量和方差计算;
  • 已发表论文中第一类错误比例为 ,因为零假设从未真实。

她仍可能出现第二类错误,即有效治疗未达到显著而没有发表。

本讲要点

  1. 临界值是拒绝域边界,分位数与尾概率互补;
  2. 值中的“极端”由检验方向定义;
  3. 第一类错误概率是显著性水平;
  4. 功效是在备择为真时正确拒绝零假设的概率;
  5. 功效必须针对具体备择分布计算;
  6. 未知总体方差时,正态均值检验使用 分布;
  7. 等方差双样本 检验使用合并方差;
  8. 显著性不等于效应大小或实际重要性;
  9. 发表结果中的错误比例不能直接由 推出。

文章作者: Gustavo
版权声明: 本博客所有文章除特別声明外,均采用 CC BY-NC 4.0 许可协议。转载请注明来源 Gustavo !
评论
  目录