随机过程经常由大量随机变量组成,甚至很多过程本身就是随机变量不断累积的结果。

因此,在进入随机游走和布朗运动之前,需要先理解概率论中两个最重要的极限定理:

  • 大数定律(Law of Large Numbers, LLN);
  • 中心极限定理(Central Limit Theorem, CLT)。

它们回答的是两个不同但紧密相关的问题:

大数定律:平均值最后会去哪里?\boxed{\text{大数定律:平均值最后会去哪里?}} 中心极限定理:它围绕那个值如何波动?\boxed{\text{中心极限定理:它围绕那个值如何波动?}}

1. 样本平均为什么趋于稳定

1.1 从反复掷骰子开始

X1,X2,X_1,X_2,\dots 是独立同分布的骰子点数。

对公平六面骰子,有:

E[Xi]=3.5E[X_i]=3.5

定义前 nn 次实验的样本均值:

Xˉn=1ni=1nXi\bar X_n=\frac{1}{n}\sum_{i=1}^n X_i

nn 很小时,Xˉn\bar X_n 可能离 3.5 很远。

但随着实验次数增加,我们通常会观察到 Xˉn\bar X_n 越来越接近 3.5。

这个现象就是大数定律研究的对象。

1.2 大数定律

假设 X1,X2,X_1,X_2,\dots 独立同分布,并且 E[X1]<E[|X_1|]<\infty,记共同期望为 μ\mu

那么在适当条件下:

Xˉnμ(1)\boxed{\bar X_n\to\mu} \tag{1}

这里的“收敛”有不同的严格定义,因此大数定律也分成弱大数定律和强大数定律。

1.3 弱大数定律

弱大数定律说的是依概率收敛

对任意 ε>0\varepsilon>0

P(Xˉnμ>ε)0P(|\bar X_n-\mu|>\varepsilon)\to0

意思是:样本数越大,样本平均偏离真实均值超过某个固定误差的概率越小。

它强调的是一个概率层面的结论:

nn 足够大时,Xˉn\bar X_n 很可能靠近 μ\mu

1.4 强大数定律

强大数定律则要求更强的几乎必然收敛

P(limnXˉn=μ)=1P\left(\lim_{n\to\infty}\bar X_n=\mu\right)=1

直觉上可以理解为:

如果真正把一条无限长的实验序列一直做下去,那么除了概率为 0 的异常路径之外,几乎所有样本路径的平均值都会收敛到 μ\mu

因此大数定律建立了一个非常重要的联系:

理论期望长期经验平均\boxed{\text{理论期望} \longleftrightarrow \text{长期经验平均}}

2. 误差尺度与中心极限定理

2.1 大数定律没有告诉我们误差多大

大数定律告诉我们 Xˉnμ\bar X_n\to\mu,但没有直接告诉我们:

  • 误差下降得有多快;
  • Xˉnμ\bar X_n-\mu 大约是什么数量级;
  • 误差的分布长什么样。

这就是中心极限定理要解决的问题。

2.2 中心极限定理

假设 X1,X2,X_1,X_2,\dots 独立同分布,具有有限均值 μ\mu 和有限方差 σ2\sigma^2

那么:

n(Xˉnμ)σN(0,1)(2)\boxed{ \frac{\sqrt n(\bar X_n-\mu)}{\sigma} \Rightarrow N(0,1) } \tag{2}

符号 \Rightarrow 表示依分布收敛。

式 (2) 的直觉非常重要。

它意味着,当 nn 足够大时:

XˉnN(μ,σ2n)\bar X_n\approx N\left(\mu,\frac{\sigma^2}{n}\right)

所以样本平均的标准差大约是 σ/n\sigma/\sqrt n

2.3 为什么总是出现 1/n1/\sqrt n

如果原始随机变量的标准差为 σ\sigma,那么平均 nn 个独立样本以后:

Std(Xˉn)σn\operatorname{Std}(\bar X_n)\approx\frac{\sigma}{\sqrt n}

所以如果希望误差缩小一半,样本量大约需要增加到原来的 4 倍。

如果希望误差缩小到原来的十分之一,样本量通常需要增加到原来的 100 倍。

这就是统计学、Monte Carlo 方法和实验设计中经常出现的平方根规律。

3. 两个极限定理如何分工

3.1 为什么中心极限定理重要

中心极限定理最惊人的地方在于:原始的 XiX_i 不需要服从正态分布。

它们可以是骰子、Bernoulli 变量、偏态分布,甚至很多形状非常奇怪的分布。

只要满足适当条件,大量独立随机变量的和经过标准化以后,都会逐渐接近高斯分布。

这解释了为什么自然科学和统计学中高斯分布如此常见。

很多现实量并不是“本身天生服从高斯分布”,而是:

它是大量小随机因素累积后的结果\boxed{\text{它是大量小随机因素累积后的结果}}

3.2 大数定律和中心极限定理的区别

假设样本平均为 Xˉn\bar X_n

大数定律说:

Xˉnμ\bar X_n\to\mu

它回答:

最终会不会稳定到正确的平均值?

中心极限定理说:

n(Xˉnμ)\sqrt n(\bar X_n-\mu)

经过标准化以后趋近高斯分布。

它回答:

靠近 μ\mu 的过程中,误差是什么尺度、呈现什么形状?

因此可以粗略记成:

LLN 研究位置,CLT 研究波动\boxed{\text{LLN 研究位置,CLT 研究波动}}

3.3 和随机过程有什么关系

表面上,大数定律和中心极限定理只是在讨论一列随机变量 X1,X2,X_1,X_2,\dots

但定义部分和:

Sn=i=1nXiS_n=\sum_{i=1}^n X_i

以后,{Sn}\{S_n\} 本身就是一个随机过程。

此时大数定律研究的是:

Snnμ\frac{S_n}{n}\to\mu

而中心极限定理研究的是:

SnnμσnN(0,1)\frac{S_n-n\mu}{\sigma\sqrt n}\Rightarrow N(0,1)

所以这两个定理实际上已经在描述一个随机过程随 nn 增大的长期行为。

4. 从离散累积到连续极限

4.1 从中心极限定理到随机游走

考虑最简单的随机游走增量:

ϵi={+1,1/21,1/2\epsilon_i= \begin{cases} +1,&1/2\\ -1,&1/2 \end{cases}

定义:

Sn=ϵ1++ϵnS_n=\epsilon_1+\cdots+\epsilon_n

因为 E[ϵi]=0E[\epsilon_i]=0,大数定律告诉我们:

Snn0\frac{S_n}{n}\to0

这并不是说随机游走最终回到原点,而是说平均每一步位移趋近于 0。

中心极限定理进一步告诉我们:

SnnN(0,1)\frac{S_n}{\sqrt n}\Rightarrow N(0,1)

所以走 nn 步以后,典型距离并不是 nn,而是 n\sqrt n 量级。

这正是随机游走最重要的尺度之一。

4.2 从 CLT 到布朗运动

普通中心极限定理关注的是某一个终点 SnS_n

如果不只看终点,而是同时观察整条轨迹:

S1,S2,,SnS_1,S_2,\dots,S_n

并对时间和空间同时做适当缩放,那么在极限下,整条随机游走轨迹会趋向布朗运动。

这就是 函数型中心极限定理(functional central limit theorem),最经典的结果是 Donsker 定理。

因此可以形成一条非常漂亮的主线:

随机变量部分和LLNCLTBrownian Motion\text{随机变量} \rightarrow \text{部分和} \rightarrow \text{LLN} \rightarrow \text{CLT} \rightarrow \text{Brownian Motion}

5. 小结

大数定律告诉我们,大量随机变量平均以后会出现稳定的宏观规律:

Xˉnμ\bar X_n\to\mu

中心极限定理则告诉我们,剩余误差大约是 1/n1/\sqrt n 的尺度,并且经过标准化以后通常趋近高斯分布。

因此:

大量微观随机性可以同时产生宏观稳定性和可预测的统计波动\boxed{\text{大量微观随机性可以同时产生宏观稳定性和可预测的统计波动}}

理解这两个定理以后,再看随机游走、布朗运动和扩散过程,会自然很多。