隨機過程理論中有兩個完全不同的觀察方向:一種是同時想像很多個平行系統,在固定時間觀察它們的分佈;另一種是只觀察一個系統,但讓它執行很長時間。這兩種平均什麼時候會得到同一個結果?這就是 ergodicity(遍歷性) 想回答的問題。
1. 總體平均與時間平均
1.1 Ensemble average
假設有很多個相互獨立的系統,在同一個時間點 觀察 ,這些系統之間的平均可以逼近期望 ,這種跨不同 realization 的平均叫 ensemble average。
1.2 Time average:核心問題
如果只有一個系統,但觀察很長時間,可以計算 ,這叫 time average。核心問題是:time average 是否會趨近 ensemble average?如果在適當意義下成立,這個過程就具有遍歷性。
2. 為什麼這是個深問題:一個非遍歷的具體例子
假設一個系統一開始各以 的機率隨機選擇進入 A 或 B 兩個區域,然後永遠留在那裡:進入 A 則長期值恆為 0,進入 B 則長期值恆為 10。從總體上看,,ensemble across 不同系統的變異數是 ,標準差是 5——如果只看 ensemble 統計量,會以為典型值是「 上下波動 」。但任何一條 sample path 的長期平均只可能恰好是 0 或恰好是 10,永遠不會接近 5,而且單條路徑內部的時間平均變異數是 0(一旦決定了進入 A 還是 B,之後就不再有任何隨機性)。這正是遍歷性失效的核心後果:只觀察一條再長的路徑,也完全無法推斷出真實的 ensemble 變異數是 25,因為單條路徑從一開始就被鎖定在兩個極端之一,這個系統就是典型的非遍歷結構。
3. 平穩性與 Markov chain 中的遍歷性
3.1 平穩性不等於遍歷性
平穩性說的是「機率規律不隨時間平移改變」,遍歷性說的是「一條足夠長的軌跡能不能探索整個統計結構」,一個過程可以平穩但不遍歷——第 2 節的例子只要略加調整(例如讓 A、B 兩個常數值本身不隨時間改變分佈)就同時是平穩且非遍歷的。不要把「長期統計規律穩定」和「單條軌跡能夠代表總體」混為一談。
3.2 Markov chain 中的遍歷性:具體算一次
對於很多有限狀態 Markov chain,如果不可約、非週期並具有平穩分佈 ,長期時間比例會收斂到平穩分佈:,一條長軌跡在狀態 上停留的時間比例,會接近平穩分佈中的機率 ,這是典型的 ergodic theorem。延續隨機過程 6裡解出的平穩分佈 :如果實際模擬這條鏈 步,狀態 B 出現的次數應該接近 次,狀態 C 出現的次數應該接近 次——不需要平行跑很多條鏈取 ensemble average,一條夠長的軌跡本身就足以估計出平穩分佈,這正是這個 Markov chain 具有遍歷性的直接體現。
4. 遍歷定理、Mixing 與非遍歷系統
4.1 Birkhoff 遍歷定理與 mixing
更一般的遍歷定理告訴我們,在適當條件下 可以收斂到 ,意味著理論上的 ensemble expectation 可以透過一條長時間序列估計,這對實際資料分析極其重要,因為現實中往往只有「一個世界的一條歷史」。Mixing 是比遍歷性更強的一類「忘記過去」的概念:粗略來說,如果系統的遠期狀態和當前狀態越來越接近獨立,就具有 mixing 行為,mixing 往往意味著良好的遍歷性,但兩者並不完全等價。
4.2 非遍歷系統為什麼重要
非遍歷性常見於多吸引子動力系統、含有多個 communicating class 或吸收態的 Markov chain、玻璃態等複雜物理系統,以及具有長期鎖定行為的 path-dependent 系統,此時單條 trajectory 可能永遠只能探索狀態空間的一部分。第 2 節的例子看似是刻意構造的極端情形,但實際系統裡的「多吸引子」結構(例如訓練過程可能收斂到不同的局部最優解、或生態系統可能穩定在不同的平衡點)本質上是同一種現象:只跑一次、觀察很久,得到的結論不一定能代表所有可能的初始條件或隨機性。
5. 小結
遍歷性真正問的是:沿著一個系統看得足夠久,是否等價於看很多個平行系統?第 2 節的非遍歷例子和第 3.2 節的遍歷 Markov chain 例子形成鮮明對比:前者無論觀察多久都學不到真正的 ensemble 變異數,後者一條夠長的軌跡就能準確估計出整個平穩分佈。遍歷性把機率分佈、long-run average 和 sample path 聯繫起來,是判斷「一條時間序列能否代表整體」這個問題的核心概念,也是幾乎所有從單一觀測歷史做統計推論的場合,都必須先確認(而不是假設)成立的前提。