隨機過程經常由大量隨機變數組成,部分和、累積報酬、請求總數與隨機遊走都會隨著索引增加而累積新變數。逐項結果仍然不可預測,長期平均和適當縮放後的總和卻可能呈現穩定規律。
大數定律(Law of Large Numbers, LLN)回答樣本平均是否接近期望值;中心極限定理(Central Limit Theorem, CLT)回答樣本平均在期望值附近以多大尺度波動。理解兩個定理的差異,是進入隨機遊走、布朗運動、Monte Carlo 方法與統計推斷的必要準備。隨機變數與樣本路徑的關係可以先參考隨機過程 1:什麼是隨機過程。
1. 樣本平均為什麼可能穩定
1.1 從公平骰子建立問題
令 為獨立同分佈的公平骰子點數。每個 都可能取 1 到 6,而且 、。前 次結果的樣本平均是 。
很小時, 可能明顯偏離 3.5。樣本數增加後,偏高與偏低的結果會在平均中互相抵消。抵消並非保證每一小段資料都接近 3.5,而是讓固定誤差門檻被超過的機率逐步下降。
獨立性使不同觀測不會一起朝同一方向偏移;同分佈使所有觀測具有相同平均與波動尺度;有限期望或有限變異數則限制極端值對平均的影響。不同版本的極限定理可以放寬部分條件,但不能在沒有檢查假設的情況下直接套用 i.i.d. 結論。
1.2 Markov 與切比雪夫不等式
Markov 不等式指出,非負隨機變數 對任意 滿足 。把 換成平方偏差 ,便得到切比雪夫不等式(Chebyshev’s inequality):若 且 ,則 。
切比雪夫不等式只使用平均值與變異數,不要求 Normal 分佈,也不要求分佈對稱。代價是上界通常較寬。若把門檻寫成 個標準差,便有 ;不論分佈形狀,落在平均值兩個標準差以外的機率最多為 1/4,落在三個標準差以外的機率最多為 1/9。
對 i.i.d. 樣本, 且 。把切比雪夫不等式用於樣本平均,可得 。右側隨 增加而趨近 0,直接給出有限變異數條件下的弱大數定律。
2. 大數定律描述長期平均
2.1 弱大數定律與強大數定律
弱大數定律描述依機率收斂:對任意 ,。固定一個可接受誤差後,樣本平均超出該誤差的機率會隨樣本數增加而消失。
強大數定律描述幾乎必然收斂:。強大數定律從完整無限樣本路徑的角度陳述結果;除了總機率為 0 的例外路徑,樣本平均都會收斂到 。
幾乎必然收斂比依機率收斂更強。兩個版本不能只靠名稱互換,因為不同定理使用的矩條件、獨立條件與證明工具可能不同。對 i.i.d. 變數,有限絕對一階矩 已足以支援經典強大數定律;利用切比雪夫不等式完成的簡單弱大數證明則使用有限變異數。
2.2 一個具有數值尺度的例子
公平骰子的變異數為 。若擲 1000 次並要求樣本平均與 3.5 的差小於 0.2,切比雪夫不等式給出 。該上界表示偏差至少 0.2 的機率不超過約 7.29%。
真實機率會比切比雪夫上界小得多,因為切比雪夫不等式沒有利用骰子分佈的有界性和形狀。上界雖然保守,卻展示了一個不依賴 Normal 近似的結論:固定誤差的失敗機率至少按 的上界下降。
大數定律不表示單個 會接近 。第 100 萬次骰子仍然只能得到 1 到 6;收斂的對象是前 次結果的平均。大數定律也不保證短期平均單調接近期望值,樣本平均可以在收斂過程中反覆穿越 。
3. 中心極限定理量化剩餘波動
3.1 標準化與 尺度
假設 i.i.d.,共同平均為 ,共同變異數為有限正數 。經典中心極限定理指出,標準化樣本平均 依分佈收斂到 。等價地,大樣本下可以使用 。
樣本平均的標準差 稱為平均值的標準誤(standard error)。如果希望標準誤縮小一半,樣本量需要增加到四倍;希望標準誤縮小到十分之一,樣本量需要增加到一百倍。統計實驗、A/B test 與 Monte Carlo 估計常出現相同的平方根成本。
中心極限定理不要求單個 服從 Normal 分佈。Bernoulli 變數、骰子點數與許多偏斜分佈的平均,在適當條件下都會逐漸接近 Normal 分佈。Normal 近似描述的是標準化總和或平均的抽樣分佈,不是把原始資料本身變成 Normal 分佈。
3.2 Bernoulli 成功率的近似計算
令 表示第 個請求是否成功,成功記為 1,失敗記為 0。樣本平均 就是成功比例,並滿足 與 。
假設真實成功率 ,觀察 個獨立請求。標準誤為 。CLT 近似表示成功比例大致服從 ,因此約 95% 的樣本比例會落在 ,也就是約 。
例子中的 95% 範圍描述重複抽取 400 個請求時樣本比例的變化。如果 未知,實務上需要用估計值代入標準誤,並考慮有限樣本與區間方法。
4. 從獨立樣本走向隨機過程
4.1 部分和與隨機遊走
定義部分和 後, 本身就是隨機過程。大數定律研究 ,中心極限定理研究 。LLN 決定一階的宏觀速度 ,CLT 描述該速度周圍的 隨機波動。
對稱隨機遊走的增量 以相同機率取 或 ,所以 且 。位置 滿足 ,但結論不是位置回到原點,而是平均每一步位移趨近 0。CLT 進一步給出 ,說明走 步後的典型距離是 量級。完整路徑行為可接著閱讀隨機過程 7:隨機遊走。
普通 CLT 只觀察終點 。函數型中心極限定理會同時縮放時間與空間,研究整條部分和路徑。Donsker 定理指出,適當插值與縮放後的隨機遊走會收斂到 Brownian motion。終點的 Normal 極限因此可以擴展成路徑空間中的布朗運動極限。
4.2 相依資料需要額外條件
時間序列與隨機過程的觀測通常相依。若相鄰 具有正相關,連續收集 1000 個觀測提供的資訊量可能遠少於 1000 個獨立樣本。平穩序列的樣本平均變異數包含所有 lag 的自共變異數;正自相關通常放大標準誤,負自相關則可能降低標準誤。
相依版本的 LLN 與 CLT 需要 ergodicity、mixing、martingale difference 或其他控制長程依賴的條件。只把 i.i.d. 公式中的 換成時間序列長度,可能嚴重低估不確定性。相關結構可先參考隨機過程 2:聯合分佈、相關性與依賴結構,長期平均與系綜平均的關係則在隨機過程 14:遍歷性中討論。
5. 使用極限定理時檢查什麼
5.1 分清楚收斂對象與結論
LLN 描述未縮放的樣本平均靠近 ;CLT 描述把平均誤差乘以 後的極限分佈。LLN 不提供精確的有限樣本誤差形狀,CLT 也不保證任意小樣本已接近 Normal 分佈。
極端重尾分佈可能沒有有限變異數,甚至沒有有限平均值。Cauchy 樣本的平均不會因樣本數增加而穩定到一個有限期望;無限變異數分佈的標準化總和也可能收斂到非 Gaussian 的 stable law。強相依、非平穩與抽樣偏差同樣會破壞簡單版本的定理。
5.2 從宏觀穩定走向連續極限
大數定律把理論期望連接到長期經驗平均,中心極限定理把剩餘誤差連接到 尺度與 Gaussian 極限。對部分和過程而言,兩個定理分別刻畫確定性的宏觀趨勢和隨機的次階波動。
隨機遊走會把離散增量累積成路徑,Brownian motion 則出現在縮放後的連續極限。掌握 LLN、CLT 與相依資料的限制後,後續的 Markov process、random walk、Brownian motion 和 stochastic differential equation 會具有清楚的共同基礎。