隨機過程理論中有兩個完全不同的觀察方向:一種是同時想像很多個平行系統,在固定時間觀察它們的分佈;另一種是只觀察一個系統,但讓它執行很長時間。這兩種平均什麼時候會得到同一個結果?這就是 ergodicity(遍歷性) 想回答的問題。

1. 總體平均與時間平均

1.1 Ensemble average

假設有很多個相互獨立的系統,在同一個時間點 tt 觀察 Xt(1),Xt(2),X_t^{(1)},X_t^{(2)},\dots,這些系統之間的平均可以逼近期望 E[Xt]E[X_t],這種跨不同 realization 的平均叫 ensemble average

1.2 Time average:核心問題

如果只有一個系統,但觀察很長時間,可以計算 XˉT=1Tt=1TXt\bar X_T=\frac1T\sum_{t=1}^TX_t,這叫 time average。核心問題是:time average 是否會趨近 ensemble average?如果在適當意義下成立,這個過程就具有遍歷性。

2. 為什麼這是個深問題:一個非遍歷的具體例子

假設一個系統一開始各以 1/21/2 的機率隨機選擇進入 A 或 B 兩個區域,然後永遠留在那裡:進入 A 則長期值恆為 0,進入 B 則長期值恆為 10。從總體上看,E[X]=0.5×0+0.5×10=5E[X]=0.5\times0+0.5\times10=5,ensemble across 不同系統的變異數是 E[X2]E[X]2=0.5×0+0.5×10025=25E[X^2]-E[X]^2=0.5\times0+0.5\times100-25=25,標準差是 5——如果只看 ensemble 統計量,會以為典型值是「55 上下波動 55」。但任何一條 sample path 的長期平均只可能恰好是 0 或恰好是 10,永遠不會接近 5,而且單條路徑內部的時間平均變異數是 0(一旦決定了進入 A 還是 B,之後就不再有任何隨機性)。這正是遍歷性失效的核心後果:只觀察一條再長的路徑,也完全無法推斷出真實的 ensemble 變異數是 25,因為單條路徑從一開始就被鎖定在兩個極端之一,這個系統就是典型的非遍歷結構。

3. 平穩性與 Markov chain 中的遍歷性

3.1 平穩性不等於遍歷性

平穩性說的是「機率規律不隨時間平移改變」,遍歷性說的是「一條足夠長的軌跡能不能探索整個統計結構」,一個過程可以平穩但不遍歷——第 2 節的例子只要略加調整(例如讓 A、B 兩個常數值本身不隨時間改變分佈)就同時是平穩且非遍歷的。不要把「長期統計規律穩定」和「單條軌跡能夠代表總體」混為一談。

3.2 Markov chain 中的遍歷性:具體算一次

對於很多有限狀態 Markov chain,如果不可約、非週期並具有平穩分佈 π\pi,長期時間比例會收斂到平穩分佈:1Tt=1T1(Xt=i)πi\frac1T\sum_{t=1}^T\mathbf1(X_t=i)\to\pi_i,一條長軌跡在狀態 ii 上停留的時間比例,會接近平穩分佈中的機率 πi\pi_i,這是典型的 ergodic theorem。延續隨機過程 6裡解出的平穩分佈 π=(1/3,1/2,1/6)\pi=(1/3,1/2,1/6):如果實際模擬這條鏈 T=12000T=12000 步,狀態 B 出現的次數應該接近 12000×0.5=600012000\times0.5=6000 次,狀態 C 出現的次數應該接近 12000×1/6=200012000\times1/6=2000 次——不需要平行跑很多條鏈取 ensemble average,一條夠長的軌跡本身就足以估計出平穩分佈,這正是這個 Markov chain 具有遍歷性的直接體現。

4. 遍歷定理、Mixing 與非遍歷系統

4.1 Birkhoff 遍歷定理與 mixing

更一般的遍歷定理告訴我們,在適當條件下 1Tt=1Tf(Xt)\frac1T\sum_{t=1}^Tf(X_t) 可以收斂到 E[f(X)]E[f(X)],意味著理論上的 ensemble expectation 可以透過一條長時間序列估計,這對實際資料分析極其重要,因為現實中往往只有「一個世界的一條歷史」。Mixing 是比遍歷性更強的一類「忘記過去」的概念:粗略來說,如果系統的遠期狀態和當前狀態越來越接近獨立,就具有 mixing 行為,mixing 往往意味著良好的遍歷性,但兩者並不完全等價。

4.2 非遍歷系統為什麼重要

非遍歷性常見於多吸引子動力系統、含有多個 communicating class 或吸收態的 Markov chain、玻璃態等複雜物理系統,以及具有長期鎖定行為的 path-dependent 系統,此時單條 trajectory 可能永遠只能探索狀態空間的一部分。第 2 節的例子看似是刻意構造的極端情形,但實際系統裡的「多吸引子」結構(例如訓練過程可能收斂到不同的局部最優解、或生態系統可能穩定在不同的平衡點)本質上是同一種現象:只跑一次、觀察很久,得到的結論不一定能代表所有可能的初始條件或隨機性。

5. 小結

遍歷性真正問的是:沿著一個系統看得足夠久,是否等價於看很多個平行系統?第 2 節的非遍歷例子和第 3.2 節的遍歷 Markov chain 例子形成鮮明對比:前者無論觀察多久都學不到真正的 ensemble 變異數,後者一條夠長的軌跡就能準確估計出整個平穩分佈。遍歷性把機率分佈、long-run average 和 sample path 聯繫起來,是判斷「一條時間序列能否代表整體」這個問題的核心概念,也是幾乎所有從單一觀測歷史做統計推論的場合,都必須先確認(而不是假設)成立的前提。