随机过程经常由大量随机变量组成,部分和、累积回报、请求总数与随机游走都会随着索引增加而累积新变量。逐项结果仍然不可预测,长期平均和适当缩放后的总和却可能呈现稳定规律。

大数定律(Law of Large Numbers, LLN)回答样本均值是否接近期望值;中心极限定理(Central Limit Theorem, CLT)回答样本均值在期望值附近以多大尺度波动。理解两个定理的差异,是进入随机游走、布朗运动、蒙特卡洛方法与统计推断的必要准备。随机变量与样本路径的关系可以先参考随机过程 1:什么是随机过程

1. 样本均值为什么可能稳定

1.1 从公平骰子建立问题

X1,X2,X_1,X_2,\dots 为独立同分布的公平骰子点数。每个 XiX_i 都可能取 1 到 6,而且 E[Xi]=3.5E[X_i]=3.5Var(Xi)=35/12\operatorname{Var}(X_i)=35/12。前 nn 次结果的样本均值是 Xˉn=n1i=1nXi\bar X_n=n^{-1}\sum_{i=1}^nX_i

nn 很小时,Xˉn\bar X_n 可能明显偏离 3.5。样本数增加后,偏高与偏低的结果会在平均中互相抵消。抵消并非保证每一小段数据都接近 3.5,而是让固定误差门槛被超过的概率逐步下降。

独立性使不同观测不会一起朝同一方向偏移;同分布使所有观测具有相同均值与波动尺度;有限期望或有限方差则限制极端值对平均的影响。不同版本的极限定理可以放宽部分条件,但不能在没有检查假设的情况下直接套用 i.i.d. 结论。

1.2 Markov 与切比雪夫不等式

Markov 不等式指出,非负随机变量 YY 对任意 a>0a>0 满足 P(Ya)E[Y]/aP(Y\ge a)\le E[Y]/a。把 YY 换成平方偏差 (Xμ)2(X-\mu)^2,便得到切比雪夫不等式(Chebyshev’s inequality):若 E[X]=μE[X]=\muVar(X)=σ2\operatorname{Var}(X)=\sigma^2,则 P(Xμε)σ2/ε2P(|X-\mu|\ge\varepsilon)\le\sigma^2/\varepsilon^2

切比雪夫不等式只使用均值与方差,不要求正态分布,也不要求分布对称。代价是上界通常较宽。若把门槛写成 kk 个标准差,便有 P(Xμkσ)1/k2P(|X-\mu|\ge k\sigma)\le1/k^2;不论分布形状,落在均值两个标准差以外的概率最多为 1/4,落在三个标准差以外的概率最多为 1/9。

对 i.i.d. 样本,E[Xˉn]=μE[\bar X_n]=\muVar(Xˉn)=σ2/n\operatorname{Var}(\bar X_n)=\sigma^2/n。把切比雪夫不等式用于样本均值,可得 P(Xˉnμε)σ2/(nε2)P(|\bar X_n-\mu|\ge\varepsilon)\le\sigma^2/(n\varepsilon^2)。右侧随 nn 增加而趋近 0,直接给出有限方差条件下的弱大数定律。

2. 大数定律描述长期平均

2.1 弱大数定律与强大数定律

弱大数定律描述依概率收敛:对任意 ε>0\varepsilon>0P(Xˉnμ>ε)0P(|\bar X_n-\mu|>\varepsilon)\to0。固定一个可接受误差后,样本均值超出该误差的概率会随样本数增加而消失。

强大数定律描述几乎必然收敛:P(limnXˉn=μ)=1P(\lim_{n\to\infty}\bar X_n=\mu)=1。强大数定律从完整无限样本路径的角度陈述结果;除了总概率为 0 的例外路径,样本均值都会收敛到 μ\mu

几乎必然收敛比依概率收敛更强。两个版本不能只靠名称互换,因为不同定理使用的矩条件、独立条件与证明工具可能不同。对 i.i.d. 变量,有限绝对一阶矩 E[X1]<E[|X_1|]<\infty 已足以支持经典强大数定律;利用切比雪夫不等式完成的简单弱大数证明则使用有限方差。

2.2 一个具有数值尺度的例子

公平骰子的方差为 35/122.91735/12\approx2.917。若掷 1000 次并要求样本均值与 3.5 的差小于 0.2,切比雪夫不等式给出 P(Xˉ10003.50.2)(35/12)/(1000×0.22)0.0729P(|\bar X_{1000}-3.5|\ge0.2)\le(35/12)/(1000\times0.2^2)\approx0.0729。该上界表示偏差至少 0.2 的概率不超过约 7.29%。

真实概率会比切比雪夫上界小得多,因为切比雪夫不等式没有利用骰子分布的有界性和形状。上界虽然保守,却展示了一个不依赖正态近似的结论:固定误差的失败概率至少按 1/n1/n 的上界下降。

大数定律不表示单个 XnX_n 会接近 μ\mu。第 100 万次骰子仍然只能得到 1 到 6;收敛的对象是前 nn 次结果的平均。大数定律也不保证短期平均单调接近期望值,样本均值可以在收敛过程中反复穿越 μ\mu

3. 中心极限定理量化剩余波动

3.1 标准化与 1/n1/\sqrt n 尺度

假设 X1,X2,X_1,X_2,\dots i.i.d.,共同均值为 μ\mu,共同方差为有限正数 σ2\sigma^2。经典中心极限定理指出,标准化样本均值 n(Xˉnμ)/σ\sqrt n(\bar X_n-\mu)/\sigma 依分布收敛到 N(0,1)N(0,1)。等价地,大样本下可以使用 XˉnN(μ,σ2/n)\bar X_n\approx N(\mu,\sigma^2/n)

样本均值的标准差 σ/n\sigma/\sqrt n 称为均值的标准误(standard error)。如果希望标准误缩小一半,样本量需要增加到四倍;希望标准误缩小到十分之一,样本量需要增加到一百倍。统计实验、A/B test 与蒙特卡洛估计常出现相同的平方根成本。

中心极限定理不要求单个 XiX_i 服从正态分布。Bernoulli 变量、骰子点数与许多偏斜分布的平均,在适当条件下都会逐渐接近正态分布。正态近似描述的是标准化总和或平均的抽样分布,不是把原始数据本身变成正态分布。

3.2 Bernoulli 成功率的近似计算

XiBernoulli(p)X_i\sim\operatorname{Bernoulli}(p) 表示第 ii 个请求是否成功,成功记为 1,失败记为 0。样本均值 p^=Xˉn\hat p=\bar X_n 就是成功比例,并满足 E[p^]=pE[\hat p]=pVar(p^)=p(1p)/n\operatorname{Var}(\hat p)=p(1-p)/n

假设真实成功率 p=0.8p=0.8,观察 n=400n=400 个独立请求。标准误为 0.8×0.2/400=0.02\sqrt{0.8\times0.2/400}=0.02。CLT 近似表示成功比例大致服从 N(0.8,0.022)N(0.8,0.02^2),因此约 95% 的样本比例会落在 0.8±1.96×0.020.8\pm1.96\times0.02,也就是约 [0.761,0.839][0.761,0.839]

例子中的 95% 范围描述重复抽取 400 个请求时样本比例的变化。如果 pp 未知,实务上需要用估计值代入标准误,并考虑有限样本与区间方法。

4. 从独立样本走向随机过程

4.1 部分和与随机游走

定义部分和 Sn=i=1nXiS_n=\sum_{i=1}^nX_i 后,{Sn}n1\{S_n\}_{n\ge1} 本身就是随机过程。大数定律研究 Sn/nμS_n/n\to\mu,中心极限定理研究 (Snnμ)/(σn)N(0,1)(S_n-n\mu)/(\sigma\sqrt n)\Rightarrow N(0,1)。LLN 决定一阶的宏观速度 nμn\mu,CLT 描述该速度周围的 n\sqrt n 随机波动。

对称随机游走的增量 ϵi\epsilon_i 以相同概率取 +1+11-1,所以 E[ϵi]=0E[\epsilon_i]=0Var(ϵi)=1\operatorname{Var}(\epsilon_i)=1。位置 Sn=iϵiS_n=\sum_i\epsilon_i 满足 Sn/n0S_n/n\to0,但结论不是位置回到原点,而是平均每一步位移趋近 0。CLT 进一步给出 Sn/nN(0,1)S_n/\sqrt n\Rightarrow N(0,1),说明走 nn 步后的典型距离是 n\sqrt n 量级。完整路径行为可接着阅读随机过程 7:随机游走

普通 CLT 只观察终点 SnS_n。函数型中心极限定理会同时缩放时间与空间,研究整条部分和路径。Donsker 定理指出,适当插值与缩放后的随机游走会收敛到布朗运动。终点的正态极限因此可以扩展成路径空间中的布朗运动极限。

4.2 相依数据需要额外条件

时间序列与随机过程的观测通常相依。若相邻 XtX_t 具有正相关,连续收集 1000 个观测提供的信息量可能远少于 1000 个独立样本。平稳序列的样本均值方差包含所有 lag 的自协方差;正自相关通常放大标准误,负自相关则可能降低标准误。

相依版本的 LLN 与 CLT 需要 ergodicity、mixing、martingale difference 或其他控制长程依赖的条件。只把 i.i.d. 公式中的 nn 换成时间序列长度,可能严重低估不确定性。相关结构可先参考随机过程 2:联合分布、相关性与依赖结构,长期平均与系综平均的关系则在随机过程 14:遍历性中讨论。

5. 使用极限定理时检查什么

5.1 分清楚收敛对象与结论

LLN 描述未缩放的样本均值靠近 μ\mu;CLT 描述把平均误差乘以 n\sqrt n 后的极限分布。LLN 不提供精确的有限样本误差形状,CLT 也不保证任意小样本已接近正态分布。

极端重尾分布可能没有有限方差,甚至没有有限均值。Cauchy 样本的平均不会因样本数增加而稳定到一个有限期望;无限方差分布的标准化总和也可能收敛到非高斯的 stable law。强相依、非平稳与抽样偏差同样会破坏简单版本的定理。

5.2 从宏观稳定走向连续极限

大数定律把理论期望连接到长期经验平均,中心极限定理把剩余误差连接到 1/n1/\sqrt n 尺度与高斯极限。对部分和过程而言,两个定理分别刻画确定性的宏观趋势和随机的次阶波动。

随机游走会把离散增量累积成路径,布朗运动则出现在缩放后的连续极限。掌握 LLN、CLT 与相依数据的限制后,后续的 Markov process、random walk、布朗运动和 stochastic differential equation 会具有清楚的共同基础。