1. 共轭先验的作用
贝叶斯更新广泛用于:
- 贝叶斯深度学习;
- 语音识别与模型训练;
- 医疗诊断;
- 数据可视化;
- 实验设计。
一般的连续贝叶斯更新需要计算
若先验与似然构成共轭组合,后验与先验属于同一分布族,更新便从积分化为参数的代数变化。
2. Beta 分布
若
的密度为
当
前面的系数是唯一的归一化常数,使
因此,只要
的形式,它就是
通过选择
- 分布的中心位置;
- 峰值位置;
- 围绕中心的集中程度;
- 对靠近 0 或 1 的参数值赋予多少先验质量。
3. 平坦先验
若对
这正是
它在
不过“平坦”依赖参数化:对
4. Beta–二项共轭更新
某治疗的未知成功概率为
表示事前认为成功率大约在
测试 25 名患者,观察 20 次成功、5 次失败。
只记录成功次数
二项似然为
先验核为
相乘得到后验核:
因此
记录具体顺序
若记录 20 个
组合系数与
后验预测
下一位患者成功的后验预测概率为
Beta 分布的均值为
5. Beta 更新的一般规则
若
且固定
可以把
例如先验为
7 次抛硬币得到 2 次正面、5 次反面,则
6. 强先验的支持集限制
假设我们确信
并使用
后验核为
若没有截断,似然峰值在
但先验在
这说明:
- 数据不能推翻先验中赋予零概率的可能性;
- 过度自信的硬截断先验可能迫使后验忽略强烈冲突的数据;
- 实务中应谨慎使用精确为零的先验密度。
7. 正态先验与正态似然
数据为
其中
先验为
则后验仍为正态:
定义先验精度与数据精度:
更新公式为
其中精度是方差的倒数。后验均值是先验均值与数据均值的精度加权平均:
- 先验方差越小,先验权重越大;
越大或观测方差越小,数据权重越大;- 后验方差小于先验方差。
8. 单个正态数据点
观测
先验
参数为
贝叶斯更新表中的核为:
精度为
所以
因此
后验均值位于数据 2 与先验均值 4 之间,并更靠近精度较高的先验均值。
9. 多次正态数据的图形直观
讲义用先验曲线和依次出现的数据
- 一次数据后,后验中心从先验均值向该数据移动;
- 三次数据后,后验中心向样本均值移动;
- 每吸收一条独立数据,后验曲线通常变窄;
- 极端观测的影响受其观测方差和已有后验精度调节。
选择正确后验图时,必须同时检查:
- 均值是否位于先验均值与数据均值之间;
- 后验是否比先验更集中;
- 数据量增加后,数据权重是否提高。
10. 篮球罚球率
球队中球员的生涯罚球命中率先验为
某一赛季的命中率满足
Sophie Lie 本赛季命中率为
精度为
后验期望为
后验方差为
本赛季的 85 高于总体先验均值 75,但观测仍有年际波动,因此对生涯水平的估计向总体均值收缩到约 81.9。
11. 似然原则
固定同一个先验,考虑两组数据
如果
作为
更一般地,如果存在与
则归一化时
因此:
- “似然相同则后验相同”正确;
- “似然成比例则后验相同”正确;
- “成比例的似然必然相等”错误。
这就是似然原则的核心形式。
12. 常见共轭组合
Bernoulli–Beta
若先验为
- 观察成功
:
- 观察失败
:
Binomial–Beta
时,
Geometric–Beta
按讲义该处采用的似然约定
与
这里
Normal–Normal
已知观测方差时,
与
共轭,后验仍为正态。
13. 识别新的共轭对
比较以下组合:
指数似然与正态先验
指数率参数的似然含
与正态先验相乘后不是正态核,因此不共轭。
指数似然与 Gamma 先验
若
且
则乘积为
仍是 Gamma 核,所以共轭。
二项似然与正态先验
正态核乘以
后不再是正态核,因此不共轭。
所以只有“指数似然–Gamma 先验”是所列选项中的共轭组合。
本讲要点
- 共轭先验使后验保持在同一分布族;
- Beta 是 Bernoulli、二项似然的共轭先验;
- 成功与失败分别增加 Beta 的两个形状参数;
- 已知观测方差时,正态先验与正态似然共轭;
- 正态后验均值是先验均值和样本均值的精度加权平均;
- 强先验中设为零的区域无法被数据恢复;
- 成比例的似然在固定先验下产生相同后验;
- 判断共轭性可检查“先验核 × 似然核”是否仍属于同一分布族。