隨機過程經常由大量隨機變數組成,部分和、累積報酬、請求總數與隨機遊走都會隨著索引增加而累積新變數。逐項結果仍然不可預測,長期平均和適當縮放後的總和卻可能呈現穩定規律。

大數定律(Law of Large Numbers, LLN)回答樣本平均是否接近期望值;中心極限定理(Central Limit Theorem, CLT)回答樣本平均在期望值附近以多大尺度波動。理解兩個定理的差異,是進入隨機遊走、布朗運動、Monte Carlo 方法與統計推斷的必要準備。隨機變數與樣本路徑的關係可以先參考隨機過程 1:什麼是隨機過程

1. 樣本平均為什麼可能穩定

1.1 從公平骰子建立問題

X1,X2,X_1,X_2,\dots 為獨立同分佈的公平骰子點數。每個 XiX_i 都可能取 1 到 6,而且 E[Xi]=3.5E[X_i]=3.5Var(Xi)=35/12\operatorname{Var}(X_i)=35/12。前 nn 次結果的樣本平均是 Xˉn=n1i=1nXi\bar X_n=n^{-1}\sum_{i=1}^nX_i

nn 很小時,Xˉn\bar X_n 可能明顯偏離 3.5。樣本數增加後,偏高與偏低的結果會在平均中互相抵消。抵消並非保證每一小段資料都接近 3.5,而是讓固定誤差門檻被超過的機率逐步下降。

獨立性使不同觀測不會一起朝同一方向偏移;同分佈使所有觀測具有相同平均與波動尺度;有限期望或有限變異數則限制極端值對平均的影響。不同版本的極限定理可以放寬部分條件,但不能在沒有檢查假設的情況下直接套用 i.i.d. 結論。

1.2 Markov 與切比雪夫不等式

Markov 不等式指出,非負隨機變數 YY 對任意 a>0a>0 滿足 P(Ya)E[Y]/aP(Y\ge a)\le E[Y]/a。把 YY 換成平方偏差 (Xμ)2(X-\mu)^2,便得到切比雪夫不等式(Chebyshev’s inequality):若 E[X]=μE[X]=\muVar(X)=σ2\operatorname{Var}(X)=\sigma^2,則 P(Xμε)σ2/ε2P(|X-\mu|\ge\varepsilon)\le\sigma^2/\varepsilon^2

切比雪夫不等式只使用平均值與變異數,不要求 Normal 分佈,也不要求分佈對稱。代價是上界通常較寬。若把門檻寫成 kk 個標準差,便有 P(Xμkσ)1/k2P(|X-\mu|\ge k\sigma)\le1/k^2;不論分佈形狀,落在平均值兩個標準差以外的機率最多為 1/4,落在三個標準差以外的機率最多為 1/9。

對 i.i.d. 樣本,E[Xˉn]=μE[\bar X_n]=\muVar(Xˉn)=σ2/n\operatorname{Var}(\bar X_n)=\sigma^2/n。把切比雪夫不等式用於樣本平均,可得 P(Xˉnμε)σ2/(nε2)P(|\bar X_n-\mu|\ge\varepsilon)\le\sigma^2/(n\varepsilon^2)。右側隨 nn 增加而趨近 0,直接給出有限變異數條件下的弱大數定律。

2. 大數定律描述長期平均

2.1 弱大數定律與強大數定律

弱大數定律描述依機率收斂:對任意 ε>0\varepsilon>0P(Xˉnμ>ε)0P(|\bar X_n-\mu|>\varepsilon)\to0。固定一個可接受誤差後,樣本平均超出該誤差的機率會隨樣本數增加而消失。

強大數定律描述幾乎必然收斂:P(limnXˉn=μ)=1P(\lim_{n\to\infty}\bar X_n=\mu)=1。強大數定律從完整無限樣本路徑的角度陳述結果;除了總機率為 0 的例外路徑,樣本平均都會收斂到 μ\mu

幾乎必然收斂比依機率收斂更強。兩個版本不能只靠名稱互換,因為不同定理使用的矩條件、獨立條件與證明工具可能不同。對 i.i.d. 變數,有限絕對一階矩 E[X1]<E[|X_1|]<\infty 已足以支援經典強大數定律;利用切比雪夫不等式完成的簡單弱大數證明則使用有限變異數。

2.2 一個具有數值尺度的例子

公平骰子的變異數為 35/122.91735/12\approx2.917。若擲 1000 次並要求樣本平均與 3.5 的差小於 0.2,切比雪夫不等式給出 P(Xˉ10003.50.2)(35/12)/(1000×0.22)0.0729P(|\bar X_{1000}-3.5|\ge0.2)\le(35/12)/(1000\times0.2^2)\approx0.0729。該上界表示偏差至少 0.2 的機率不超過約 7.29%。

真實機率會比切比雪夫上界小得多,因為切比雪夫不等式沒有利用骰子分佈的有界性和形狀。上界雖然保守,卻展示了一個不依賴 Normal 近似的結論:固定誤差的失敗機率至少按 1/n1/n 的上界下降。

大數定律不表示單個 XnX_n 會接近 μ\mu。第 100 萬次骰子仍然只能得到 1 到 6;收斂的對象是前 nn 次結果的平均。大數定律也不保證短期平均單調接近期望值,樣本平均可以在收斂過程中反覆穿越 μ\mu

3. 中心極限定理量化剩餘波動

3.1 標準化與 1/n1/\sqrt n 尺度

假設 X1,X2,X_1,X_2,\dots i.i.d.,共同平均為 μ\mu,共同變異數為有限正數 σ2\sigma^2。經典中心極限定理指出,標準化樣本平均 n(Xˉnμ)/σ\sqrt n(\bar X_n-\mu)/\sigma 依分佈收斂到 N(0,1)N(0,1)。等價地,大樣本下可以使用 XˉnN(μ,σ2/n)\bar X_n\approx N(\mu,\sigma^2/n)

樣本平均的標準差 σ/n\sigma/\sqrt n 稱為平均值的標準誤(standard error)。如果希望標準誤縮小一半,樣本量需要增加到四倍;希望標準誤縮小到十分之一,樣本量需要增加到一百倍。統計實驗、A/B test 與 Monte Carlo 估計常出現相同的平方根成本。

中心極限定理不要求單個 XiX_i 服從 Normal 分佈。Bernoulli 變數、骰子點數與許多偏斜分佈的平均,在適當條件下都會逐漸接近 Normal 分佈。Normal 近似描述的是標準化總和或平均的抽樣分佈,不是把原始資料本身變成 Normal 分佈。

3.2 Bernoulli 成功率的近似計算

XiBernoulli(p)X_i\sim\operatorname{Bernoulli}(p) 表示第 ii 個請求是否成功,成功記為 1,失敗記為 0。樣本平均 p^=Xˉn\hat p=\bar X_n 就是成功比例,並滿足 E[p^]=pE[\hat p]=pVar(p^)=p(1p)/n\operatorname{Var}(\hat p)=p(1-p)/n

假設真實成功率 p=0.8p=0.8,觀察 n=400n=400 個獨立請求。標準誤為 0.8×0.2/400=0.02\sqrt{0.8\times0.2/400}=0.02。CLT 近似表示成功比例大致服從 N(0.8,0.022)N(0.8,0.02^2),因此約 95% 的樣本比例會落在 0.8±1.96×0.020.8\pm1.96\times0.02,也就是約 [0.761,0.839][0.761,0.839]

例子中的 95% 範圍描述重複抽取 400 個請求時樣本比例的變化。如果 pp 未知,實務上需要用估計值代入標準誤,並考慮有限樣本與區間方法。

4. 從獨立樣本走向隨機過程

4.1 部分和與隨機遊走

定義部分和 Sn=i=1nXiS_n=\sum_{i=1}^nX_i 後,{Sn}n1\{S_n\}_{n\ge1} 本身就是隨機過程。大數定律研究 Sn/nμS_n/n\to\mu,中心極限定理研究 (Snnμ)/(σn)N(0,1)(S_n-n\mu)/(\sigma\sqrt n)\Rightarrow N(0,1)。LLN 決定一階的宏觀速度 nμn\mu,CLT 描述該速度周圍的 n\sqrt n 隨機波動。

對稱隨機遊走的增量 ϵi\epsilon_i 以相同機率取 +1+11-1,所以 E[ϵi]=0E[\epsilon_i]=0Var(ϵi)=1\operatorname{Var}(\epsilon_i)=1。位置 Sn=iϵiS_n=\sum_i\epsilon_i 滿足 Sn/n0S_n/n\to0,但結論不是位置回到原點,而是平均每一步位移趨近 0。CLT 進一步給出 Sn/nN(0,1)S_n/\sqrt n\Rightarrow N(0,1),說明走 nn 步後的典型距離是 n\sqrt n 量級。完整路徑行為可接著閱讀隨機過程 7:隨機遊走

普通 CLT 只觀察終點 SnS_n。函數型中心極限定理會同時縮放時間與空間,研究整條部分和路徑。Donsker 定理指出,適當插值與縮放後的隨機遊走會收斂到 Brownian motion。終點的 Normal 極限因此可以擴展成路徑空間中的布朗運動極限。

4.2 相依資料需要額外條件

時間序列與隨機過程的觀測通常相依。若相鄰 XtX_t 具有正相關,連續收集 1000 個觀測提供的資訊量可能遠少於 1000 個獨立樣本。平穩序列的樣本平均變異數包含所有 lag 的自共變異數;正自相關通常放大標準誤,負自相關則可能降低標準誤。

相依版本的 LLN 與 CLT 需要 ergodicity、mixing、martingale difference 或其他控制長程依賴的條件。只把 i.i.d. 公式中的 nn 換成時間序列長度,可能嚴重低估不確定性。相關結構可先參考隨機過程 2:聯合分佈、相關性與依賴結構,長期平均與系綜平均的關係則在隨機過程 14:遍歷性中討論。

5. 使用極限定理時檢查什麼

5.1 分清楚收斂對象與結論

LLN 描述未縮放的樣本平均靠近 μ\mu;CLT 描述把平均誤差乘以 n\sqrt n 後的極限分佈。LLN 不提供精確的有限樣本誤差形狀,CLT 也不保證任意小樣本已接近 Normal 分佈。

極端重尾分佈可能沒有有限變異數,甚至沒有有限平均值。Cauchy 樣本的平均不會因樣本數增加而穩定到一個有限期望;無限變異數分佈的標準化總和也可能收斂到非 Gaussian 的 stable law。強相依、非平穩與抽樣偏差同樣會破壞簡單版本的定理。

5.2 從宏觀穩定走向連續極限

大數定律把理論期望連接到長期經驗平均,中心極限定理把剩餘誤差連接到 1/n1/\sqrt n 尺度與 Gaussian 極限。對部分和過程而言,兩個定理分別刻畫確定性的宏觀趨勢和隨機的次階波動。

隨機遊走會把離散增量累積成路徑,Brownian motion 則出現在縮放後的連續極限。掌握 LLN、CLT 與相依資料的限制後,後續的 Markov process、random walk、Brownian motion 和 stochastic differential equation 會具有清楚的共同基礎。