1. 从概率论进入统计学
统计学研究数据的收集、描述、分析,以及如何根据数据作出推断或决策。它使用概率论的数学工具,但实际结论还依赖模型选择、实验设计和背景判断。
统计工作大致分为:
数据收集
- 非正式调查;
- 观察性研究;
- 正式实验。
描述统计
概括已有数据,例如:
- 样本均值;
- 中位数;
- 样本方差;
- 直方图;
- 箱线图。
推断统计
根据有限样本推断总体、未知参数或未来结果。这是本课程后半部分的重点。
实验设计必须在收集数据之前认真考虑。实验完成后才咨询统计学家,往往只能诊断实验为何未能回答原问题,而无法补救根本性的设计缺陷。
2. 数据会提出什么问题
讲义给出两类数据诊断:
100 次抛硬币
观察一串正反面结果后,问题是:硬币公平吗?
只看序列的“随机外观”并不可靠。需要选定统计量,例如正面次数或正面比例,并在公平硬币模型下判断所观察结果是否异常。
一组连续数据
样本均值为
- 总体均值是否可能为 0?
- 总体形状是否为正态?
- 是否可能来自标准正态
?
样本均值和标准差只能描述部分特征。正态性还涉及分布整体形状,需结合直方图、分位数或后续的统计检验。
3. 什么是统计量
统计量是完全由已收集数据计算出来的量,因此必须可观测。
点统计量
由数据计算出的单个数值,例如样本平均
或样本标准差
区间统计量
由数据计算出的区间
统计量本身是随机变量:如果重新抽样,会得到新的数据和新的统计量值。
灯泡寿命概念题
假设灯泡寿命服从参数为
- 样本平均
完全由数据计算,是统计量; - 总体期望
含未知参数,不是统计量; 也含未知参数,不是统计量。
因此只有样本平均是统计量。
4. 随机变量与数据的记号
大写字母
表示随机变量;小写字母
表示随机变量实际生成的观测数据。
例如抛硬币 10 次:
表示第 次抛掷的结果指标,取 0 或 1; 表示已观察到的具体结果。
一组可能数据为
在收集数据之前,
5. 贝叶斯公式的统计解释
贝叶斯公式写为
即
其中:
是假设; 是数据; 衡量该假设产生所见数据的可能性; 是观察数据前对假设的看法; 是观察数据后的更新结果。
6. 标准统计问题:估计参数
要估计“香菜尝起来像肥皂”的人群比例
- 目标参数:
; - 试验:随机询问
人; - 模型:第
人的回答
其中“像肥皂”记为 1;
- 数据:
; - 推断:用数据估计未知的
; - 假设:可检验
是否为某个具体值或属于某个范围。
若询问 100 人,其中 55 人回答“像肥皂”,则
7. 似然函数
在给定
把已观察数据固定,把上式视为参数
必须区分:
- 概率分布把参数固定、让数据变化;
- 似然把数据固定、比较不同假设参数。
似然不是参数
8. 最大似然估计
最大似然估计(MLE)选择使已观察数据最可能出现的参数值:
寻找最大值的方法包括:
- 对似然求导并检查临界点;
- 若内部没有极值,检查参数范围端点;
- 若参数只有有限个候选值,逐一比较似然。
帽号表示估计值,例如
9. 对数似然
由于对数函数严格递增,最大化
对数把乘积变为和,通常更容易求导,也能避免数值下溢。
香菜例子的对数似然为
求导:
令其为零:
二阶导数
说明这是唯一最大值。
一般地,
10. 三枚候选硬币
盒中三枚硬币的正面概率分别为
随机取出一枚未知硬币,抛 80 次得到 49 次正面和 31 次反面。
三个候选值下的似然分别为
公共组合系数不影响大小比较。49/80 约为 0.6125,在三个候选参数中,
这只是最大似然比较;若三枚硬币被选中的先验概率不同,贝叶斯后验选择还会受到先验权重影响。
11. 弯曲硬币的未知参数
若弯曲硬币的正面概率
求导:
令其为 0,得到
12. 连续数据的似然
对于连续变量,单点概率为 0,因此用密度值构造似然。
假设灯泡寿命独立且
五个具体寿命
观测为
总和为 13。独立性使联合密度为乘积:
对数似然为
求导:
所以
二阶导数
一般五个寿命
若数据为
因此
对一般
本讲要点
- 统计学从有限数据推断总体和未知参数;
- 统计量必须完全由可观测数据计算;
- 似然把数据固定,视为参数的函数;
- 最大似然估计选择使已观察数据最可能的参数;
- 最大化对数似然与最大化原似然等价;
- 伯努利成功概率的 MLE 是样本成功比例;
- 指数分布率参数的 MLE 是样本均值的倒数。