11-第10讲-统计学导论与最大似然估计


1. 从概率论进入统计学

统计学研究数据的收集、描述、分析,以及如何根据数据作出推断或决策。它使用概率论的数学工具,但实际结论还依赖模型选择、实验设计和背景判断。

统计工作大致分为:

数据收集

  • 非正式调查;
  • 观察性研究;
  • 正式实验。

描述统计

概括已有数据,例如:

  • 样本均值;
  • 中位数;
  • 样本方差;
  • 直方图;
  • 箱线图。

推断统计

根据有限样本推断总体、未知参数或未来结果。这是本课程后半部分的重点。

实验设计必须在收集数据之前认真考虑。实验完成后才咨询统计学家,往往只能诊断实验为何未能回答原问题,而无法补救根本性的设计缺陷。

2. 数据会提出什么问题

讲义给出两类数据诊断:

100 次抛硬币

观察一串正反面结果后,问题是:硬币公平吗?

只看序列的“随机外观”并不可靠。需要选定统计量,例如正面次数或正面比例,并在公平硬币模型下判断所观察结果是否异常。

一组连续数据

样本均值为 ,样本标准差为 。问题包括:

  • 总体均值是否可能为 0?
  • 总体形状是否为正态?
  • 是否可能来自标准正态

样本均值和标准差只能描述部分特征。正态性还涉及分布整体形状,需结合直方图、分位数或后续的统计检验。

3. 什么是统计量

统计量是完全由已收集数据计算出来的量,因此必须可观测。

点统计量

由数据计算出的单个数值,例如样本平均

或样本标准差

区间统计量

由数据计算出的区间 ,本质上是一对点统计量,也常写作

统计量本身是随机变量:如果重新抽样,会得到新的数据和新的统计量值。

灯泡寿命概念题

假设灯泡寿命服从参数为 的指数分布,观测 5 个寿命

  • 样本平均 完全由数据计算,是统计量;
  • 总体期望 含未知参数,不是统计量;
  • 也含未知参数,不是统计量。

因此只有样本平均是统计量。

4. 随机变量与数据的记号

大写字母

表示随机变量;小写字母

表示随机变量实际生成的观测数据。

例如抛硬币 10 次:

  • 表示第 次抛掷的结果指标,取 0 或 1;
  • 表示已观察到的具体结果。

一组可能数据为

在收集数据之前, 是随机的;收集之后, 是固定数值。

5. 贝叶斯公式的统计解释

贝叶斯公式写为

其中:

  • 是假设;
  • 是数据;
  • 衡量该假设产生所见数据的可能性;
  • 是观察数据前对假设的看法;
  • 是观察数据后的更新结果。

6. 标准统计问题:估计参数

要估计“香菜尝起来像肥皂”的人群比例

  1. 目标参数
  2. 试验:随机询问 人;
  3. 模型:第 人的回答

其中“像肥皂”记为 1;

  1. 数据
  2. 推断:用数据估计未知的
  3. 假设:可检验 是否为某个具体值或属于某个范围。

若询问 100 人,其中 55 人回答“像肥皂”,则 仍是未知总体参数; 是由样本给出的估计。

7. 似然函数

在给定 时,100 人中恰有 55 人回答“是”的概率为

把已观察数据固定,把上式视为参数 的函数,得到似然:

必须区分:

  • 概率分布把参数固定、让数据变化;
  • 似然把数据固定、比较不同假设参数。

似然不是参数 的概率密度,也不要求对 积分为 1。

8. 最大似然估计

最大似然估计(MLE)选择使已观察数据最可能出现的参数值:

寻找最大值的方法包括:

  1. 对似然求导并检查临界点;
  2. 若内部没有极值,检查参数范围端点;
  3. 若参数只有有限个候选值,逐一比较似然。

帽号表示估计值,例如 是未知真值 的估计。

9. 对数似然

由于对数函数严格递增,最大化 等价于最大化

对数把乘积变为和,通常更容易求导,也能避免数值下溢。

香菜例子的对数似然为

求导:

令其为零:

二阶导数

说明这是唯一最大值。

一般地, 次伯努利试验中出现 次成功时,

10. 三枚候选硬币

盒中三枚硬币的正面概率分别为

随机取出一枚未知硬币,抛 80 次得到 49 次正面和 31 次反面。

三个候选值下的似然分别为

公共组合系数不影响大小比较。49/80 约为 0.6125,在三个候选参数中, 给出最大似然。因此最大似然判断为第三枚硬币。

这只是最大似然比较;若三枚硬币被选中的先验概率不同,贝叶斯后验选择还会受到先验权重影响。

11. 弯曲硬币的未知参数

若弯曲硬币的正面概率 可在 中任取,80 次中观察到 49 次正面,则

求导:

令其为 0,得到

12. 连续数据的似然

对于连续变量,单点概率为 0,因此用密度值构造似然。

假设灯泡寿命独立且

五个具体寿命

观测为

总和为 13。独立性使联合密度为乘积:

对数似然为

求导:

所以

二阶导数 ,故为最大值。

一般五个寿命

若数据为 ,则

因此

对一般 个独立指数寿命,仍有

本讲要点

  1. 统计学从有限数据推断总体和未知参数;
  2. 统计量必须完全由可观测数据计算;
  3. 似然把数据固定,视为参数的函数;
  4. 最大似然估计选择使已观察数据最可能的参数;
  5. 最大化对数似然与最大化原似然等价;
  6. 伯努利成功概率的 MLE 是样本成功比例;
  7. 指数分布率参数的 MLE 是样本均值的倒数。

文章作者: Gustavo
版权声明: 本博客所有文章除特別声明外,均采用 CC BY-NC 4.0 许可协议。转载请注明来源 Gustavo !
评论
  目录