随机过程经常由大量随机变量组成,部分和、累积回报、请求总数与随机游走都会随着索引增加而累积新变量。逐项结果仍然不可预测,长期平均和适当缩放后的总和却可能呈现稳定规律。
大数定律(Law of Large Numbers, LLN)回答样本均值是否接近期望值;中心极限定理(Central Limit Theorem, CLT)回答样本均值在期望值附近以多大尺度波动。理解两个定理的差异,是进入随机游走、布朗运动、蒙特卡洛方法与统计推断的必要准备。随机变量与样本路径的关系可以先参考随机过程 1:什么是随机过程。
1. 样本均值为什么可能稳定
1.1 从公平骰子建立问题
令 为独立同分布的公平骰子点数。每个 都可能取 1 到 6,而且 、。前 次结果的样本均值是 。
很小时, 可能明显偏离 3.5。样本数增加后,偏高与偏低的结果会在平均中互相抵消。抵消并非保证每一小段数据都接近 3.5,而是让固定误差门槛被超过的概率逐步下降。
独立性使不同观测不会一起朝同一方向偏移;同分布使所有观测具有相同均值与波动尺度;有限期望或有限方差则限制极端值对平均的影响。不同版本的极限定理可以放宽部分条件,但不能在没有检查假设的情况下直接套用 i.i.d. 结论。
1.2 Markov 与切比雪夫不等式
Markov 不等式指出,非负随机变量 对任意 满足 。把 换成平方偏差 ,便得到切比雪夫不等式(Chebyshev’s inequality):若 且 ,则 。
切比雪夫不等式只使用均值与方差,不要求正态分布,也不要求分布对称。代价是上界通常较宽。若把门槛写成 个标准差,便有 ;不论分布形状,落在均值两个标准差以外的概率最多为 1/4,落在三个标准差以外的概率最多为 1/9。
对 i.i.d. 样本, 且 。把切比雪夫不等式用于样本均值,可得 。右侧随 增加而趋近 0,直接给出有限方差条件下的弱大数定律。
2. 大数定律描述长期平均
2.1 弱大数定律与强大数定律
弱大数定律描述依概率收敛:对任意 ,。固定一个可接受误差后,样本均值超出该误差的概率会随样本数增加而消失。
强大数定律描述几乎必然收敛:。强大数定律从完整无限样本路径的角度陈述结果;除了总概率为 0 的例外路径,样本均值都会收敛到 。
几乎必然收敛比依概率收敛更强。两个版本不能只靠名称互换,因为不同定理使用的矩条件、独立条件与证明工具可能不同。对 i.i.d. 变量,有限绝对一阶矩 已足以支持经典强大数定律;利用切比雪夫不等式完成的简单弱大数证明则使用有限方差。
2.2 一个具有数值尺度的例子
公平骰子的方差为 。若掷 1000 次并要求样本均值与 3.5 的差小于 0.2,切比雪夫不等式给出 。该上界表示偏差至少 0.2 的概率不超过约 7.29%。
真实概率会比切比雪夫上界小得多,因为切比雪夫不等式没有利用骰子分布的有界性和形状。上界虽然保守,却展示了一个不依赖正态近似的结论:固定误差的失败概率至少按 的上界下降。
大数定律不表示单个 会接近 。第 100 万次骰子仍然只能得到 1 到 6;收敛的对象是前 次结果的平均。大数定律也不保证短期平均单调接近期望值,样本均值可以在收敛过程中反复穿越 。
3. 中心极限定理量化剩余波动
3.1 标准化与 尺度
假设 i.i.d.,共同均值为 ,共同方差为有限正数 。经典中心极限定理指出,标准化样本均值 依分布收敛到 。等价地,大样本下可以使用 。
样本均值的标准差 称为均值的标准误(standard error)。如果希望标准误缩小一半,样本量需要增加到四倍;希望标准误缩小到十分之一,样本量需要增加到一百倍。统计实验、A/B test 与蒙特卡洛估计常出现相同的平方根成本。
中心极限定理不要求单个 服从正态分布。Bernoulli 变量、骰子点数与许多偏斜分布的平均,在适当条件下都会逐渐接近正态分布。正态近似描述的是标准化总和或平均的抽样分布,不是把原始数据本身变成正态分布。
3.2 Bernoulli 成功率的近似计算
令 表示第 个请求是否成功,成功记为 1,失败记为 0。样本均值 就是成功比例,并满足 与 。
假设真实成功率 ,观察 个独立请求。标准误为 。CLT 近似表示成功比例大致服从 ,因此约 95% 的样本比例会落在 ,也就是约 。
例子中的 95% 范围描述重复抽取 400 个请求时样本比例的变化。如果 未知,实务上需要用估计值代入标准误,并考虑有限样本与区间方法。
4. 从独立样本走向随机过程
4.1 部分和与随机游走
定义部分和 后, 本身就是随机过程。大数定律研究 ,中心极限定理研究 。LLN 决定一阶的宏观速度 ,CLT 描述该速度周围的 随机波动。
对称随机游走的增量 以相同概率取 或 ,所以 且 。位置 满足 ,但结论不是位置回到原点,而是平均每一步位移趋近 0。CLT 进一步给出 ,说明走 步后的典型距离是 量级。完整路径行为可接着阅读随机过程 7:随机游走。
普通 CLT 只观察终点 。函数型中心极限定理会同时缩放时间与空间,研究整条部分和路径。Donsker 定理指出,适当插值与缩放后的随机游走会收敛到布朗运动。终点的正态极限因此可以扩展成路径空间中的布朗运动极限。
4.2 相依数据需要额外条件
时间序列与随机过程的观测通常相依。若相邻 具有正相关,连续收集 1000 个观测提供的信息量可能远少于 1000 个独立样本。平稳序列的样本均值方差包含所有 lag 的自协方差;正自相关通常放大标准误,负自相关则可能降低标准误。
相依版本的 LLN 与 CLT 需要 ergodicity、mixing、martingale difference 或其他控制长程依赖的条件。只把 i.i.d. 公式中的 换成时间序列长度,可能严重低估不确定性。相关结构可先参考随机过程 2:联合分布、相关性与依赖结构,长期平均与系综平均的关系则在随机过程 14:遍历性中讨论。
5. 使用极限定理时检查什么
5.1 分清楚收敛对象与结论
LLN 描述未缩放的样本均值靠近 ;CLT 描述把平均误差乘以 后的极限分布。LLN 不提供精确的有限样本误差形状,CLT 也不保证任意小样本已接近正态分布。
极端重尾分布可能没有有限方差,甚至没有有限均值。Cauchy 样本的平均不会因样本数增加而稳定到一个有限期望;无限方差分布的标准化总和也可能收敛到非高斯的 stable law。强相依、非平稳与抽样偏差同样会破坏简单版本的定理。
5.2 从宏观稳定走向连续极限
大数定律把理论期望连接到长期经验平均,中心极限定理把剩余误差连接到 尺度与高斯极限。对部分和过程而言,两个定理分别刻画确定性的宏观趋势和随机的次阶波动。
随机游走会把离散增量累积成路径,布朗运动则出现在缩放后的连续极限。掌握 LLN、CLT 与相依数据的限制后,后续的 Markov process、random walk、布朗运动和 stochastic differential equation 会具有清楚的共同基础。