矩母函数
设
为随机变量。 的矩母函数定义为 当
为离散随机变量时,可以写成 因此,
是可数多个指数函数的加权平均。 当
为连续随机变量时,可以写成 因此,
是连续统多个指数函数的加权平均。 总有
。 如果
且 ,那么 如果
以正概率同时取正值和负值,那么当 时, 关于 至少以指数速度增长。
矩母函数确实能生成矩
设
为随机变量,并令 那么
特别地,
。 此外,
所以
。同样的论证表明, 在 0 处的第 阶导数是 。 有趣的是:知道
在单个点处的全部导数,就能得到所有整数 对应的矩 。 另一种理解方式是写出
取期望得到
其中
是第 阶矩。在 0 处的第 阶导数就是 。
独立随机变量之和的矩母函数
设
和 为相互独立的随机变量,并令 。 将矩母函数记为
如果已知
和 ,能否计算 ? 由独立性,对所有
, 换言之,相互独立的随机变量相加,对应于它们的矩母函数相乘。
独立同分布随机变量之和的矩母函数
我们已经证明:如果
,且 与 相互独立,那么 如果
是 的独立同分布副本,并且 那么
是什么? 答案:
。这是反复应用上式得到的。 这是研究矩母函数的一个重要理由:它有助于理解大量相互独立、同分布随机变量相加时会发生什么。
其他观察
如果
,能否利用 确定 ? 答:可以。
如果
,能否利用 确定 ? 答:可以。
后一个答案是
的特殊情形,其中 是恒等于 的随机变量。
存在性问题
看来,除非当
时 以超指数速度衰减,否则 不会对所有 都有定义。 如果
服从标准 Cauchy 分布,即 那么
是什么? 答:
(对任何 都如此),但除此之外,对所有 , 都是无穷大。 非正式地说:对于厚尾分布,矩母函数没有定义。
Markov 不等式与 Chebyshev 不等式
Markov 不等式: 设
为非负随机变量。固定 ,则 证明: 考虑随机变量
因为
以概率 1 成立,所以 两边同除以
,即得 Markov 不等式。 Chebyshev 不等式: 如果
的有限均值为 、方差为 ,并且 ,那么 证明: 注意到
是非负随机变量,并且 现在令
,应用 Markov 不等式。
Markov 与 Chebyshev:粗略思想
Markov 不等式: 设
为具有有限均值的非负随机变量。固定常数 ,则 Chebyshev 不等式: 如果
的有限均值为 、方差为 ,并且 ,那么 当我们只知道均值(Markov)或只知道均值和方差(Chebyshev)时,这些不等式可以让我们推断出关于分布的有限信息。
Markov: 如果
很小,那么 取很大值的可能性不会太高。 Chebyshev: 如果
很小,那么 偏离其均值很远的可能性不会太高。
弱大数定律的陈述
假设
是均值为 的独立同分布随机变量。 称
为前
次试验的经验平均值。 我们猜想,当
很大时, 通常接近 。 的确,弱大数定律断言:对所有
, 例:当
时,在 次公平抛硬币中看到超过 次正面的概率趋于零。
有限方差情形下弱大数定律的证明
如上,设
是均值为 的独立同分布随机变量,并记 由期望的可加性,
。 类似地,
由 Chebyshev 不等式,
无论
多小,当 增大时,右侧都趋于零。
弱大数定律
如果
就称
与 不相关。 只要这些变量不相关,Chebyshev/Markov 论证就成立;事实上并不要求独立性。
只用方差界还能做什么?
有“几乎不相关”的
有时就已经足够:只需 的方差趋于零。 把
个箱子投入 个球中。有多少个箱子被填满? 当
很大时,第一个箱子中的球数近似服从期望为 的 Poisson 随机变量。 第一个箱子不含球的概率为
我们可以显式计算不含球的箱子数的方差。这使我们能够证明:不含球的箱子比例集中在其期望
附近。
怎样推广到没有方差的随机变量?
假设
是非负随机变量 的独立同分布副本,并且 具有有限均值。能否为它们证明大数定律? 尝试截断。固定一个很大的
,并写成 从而
。选择 ,使 非常小。大数定律对 成立。
提纲
- 矩母函数
- 弱大数定律:Markov/Chebyshev 方法
- 弱大数定律:特征函数方法
弱大数定律的适用范围
问题:无论
的概率分布是什么,弱大数定律都适用吗? 如果定义
是否总能保证当
很大时, 通常接近某个固定值? 如果
服从 Cauchy 分布呢? 在这个奇特而有趣的情形中,
实际上与 具有相同的概率分布。 特别地,即使
很大, 也不会紧密集中在任何特定值附近。 但是,只要
有限,从而 有良好定义,弱大数定律就成立。 一种标准证明使用特征函数。
特征函数
设
为随机变量。 的特征函数定义为 它就像
,只是多放入了一个 。 回顾定义
特征函数在某些方面与矩母函数相似。
例如,如果
与 相互独立,那么 正如
。 同样,
正如
。 如果
具有第 阶矩,那么 不过特征函数有一个优点:对所有随机变量
,它在所有 处都有良好定义。
连续性定理
设
为随机变量, 为随机变量序列。 如果在
连续的每一个 处都有 就称
依分布收敛或依概率律收敛到 。 弱大数定律可以改述为:
依概率律收敛到 ,也就是收敛到那个以概率 1 等于 的随机变量。 Lévy 连续性定理(稍后讲授): 如果对所有
, 那么
依概率律收敛到 。 利用这个定理,可以通过证明
对所有
成立,来证明弱大数定律。当 时,这等价于证明对所有 , 。 矩母函数的类似结论: 如果矩母函数
对所有 都有定义,并且对所有 , 那么
依概率律收敛到 。
有限均值情形下弱大数定律的证明梗概
如上,设
是均值为 0 的随机变量 的独立同分布副本,并记 对
的独立同分布副本,弱大数定律成立,当且仅当它对 的独立同分布副本成立。因此,只需在均值为 0 的情形下证明弱大数定律。 考虑特征函数
因为
,所以 写成
,从而 。于是 ,并且由链式法则,现在
由于
,当 固定时,因此,对所有
,由 Lévy 连续性定理,
依概率律收敛到 0,也就是收敛到那个以概率 1 等于 0 的随机变量。