上一節把隨機過程寫成了 。如果只看這個形式,它似乎只是“很多隨機變數放在一起”。真正讓隨機過程成為一門獨立學科的,是這些隨機變數之間並不是隨意擺放的,它們通常存在某種依賴結構。
因此,隨機過程真正研究的問題不是“每一個 分別是什麼分佈”,而是:
核心問題是整族隨機變數具有什麼聯合關係。
1. 從邊緣分佈到聯合分佈
1.1 只知道每個 的分佈是不夠的
考慮兩個過程:
- 第一個過程滿足:每一個 ,並且 相互獨立。
- 第二個過程則先生成一個隨機變數 ,然後令所有時間點都滿足 。
單獨看任意一個時刻,這兩個過程都滿足 。也就是說,它們在每一個單獨時間點上的分佈完全一樣。但它們顯然不是同一個隨機過程。
第一個過程每一步都會重新隨機;第二個過程一旦第一次取值確定,之後就永遠保持一樣。所以問題不在於某個單獨的 ,而在於 和 如何一起變化。
1.2 聯合分佈
這裡需要回顧一下機率論的知識。如果只研究一個隨機變數 ,我們關心的是它的分佈: 。如果同時研究兩個時間點 ,就需要看它們的聯合分佈:。
聯合分佈告訴我們的不是“兩個變數分別長什麼樣”,而是“它們會怎樣一起出現”。兩個變數可能都服從標準常態分布,但它們可以:
- 完全獨立;
- 高度正相關;
- 高度負相關;
- 存在複雜的非線性依賴。
這些情形單看邊緣分佈都無法區分。
1.3 有限維分佈
隨機過程可能包含無限多個隨機變數,但在實際分析中,我們總是選擇有限多個時間點:
然後研究隨機向量 的聯合分佈。這一組分佈稱為隨機過程的 有限維分佈(finite-dimensional distributions)。
更嚴格地說,如果我們知道任意有限時間點組合的聯合分佈,並且這些分佈彼此滿足一致性條件,就已經掌握了這個隨機過程的機率結構。
所以從機率論角度看,一個隨機過程並不只是“一條會抖動的曲線”,而是:
隨機過程由所有有限多個時間點上的聯合機率規律刻畫。
2. 用統計量描述依賴結構
2.1 平均值函數
最基礎的統計量仍然是期望。樸素的理解就是,雖然你有隨機性,但是在取樣次數足夠多,所有的軌跡都會有個平均值。
對每個時間點定義:
這個 稱為隨機過程的平均值函數(mean function)。簡單來說就是不同索引的結果的平均,只不過這裡的索引是時間 。
- 如果 ,表示整個過程在每個時間點都以 0 為中心波動。
- 如果 ,則說明過程的平均水平本身隨著時間上升。
- 實際上 也可以是別的函數。
平均值函數只描述每個時間點的中心位置,它還不能告訴我們不同時間點之間是否相關。
2.2 變異數和共變異數
請繼續回憶機率論,每個 自己的波動大小可以由 描述。如果要研究兩個時間點之間的關係,則使用共變異數:
如果 ,通常表示 偏高時, 也傾向於偏高;如果 ,則表示二者傾向於反方向變化。
如果 ,只能說明它們沒有線性相關性,並不能保證它們獨立。相關性描述的是線性關係。這是機率論中非常重要的區別:
獨立必然推出不相關;不相關不能推出獨立。
2.3 自相關和時間間隔
隨機過程中特別關心的是同一個過程在不同時間的相關性。更確切地說是不同索引之間的相關性,時間是一種常見的索引。
例如研究 和 的關係,其中 稱為 lag(滯後)。標準化以後,可以定義相關係數:
如果隨著 增大, 很快接近 0,那麼可以說這個過程的“記憶”衰減得比較快。
如果即使隔了很久仍然保持較強相關,則說明過程具有更長的時間依賴。這類關係在時間序列、訊號處理、金融資料和物理系統中都非常重要。
3. 特殊結構與過程對比
3.1 獨立同分布只是一個特殊情況
隨機過程並不要求 獨立同分布。事實上,可以存在很多不同的關係,就是獨立和同分佈構成一個笛卡爾積:
- 獨立且同分布;
- 獨立但不同分佈;
- 同分布但彼此相關;
- 既不同分佈,也存在複雜依賴。
i.i.d. (Independent and Identically Distributed)只是一種非常特殊、非常方便的結構。
很多真正有意思的隨機過程,恰恰來自不同時間點之間的依賴。
例如隨機遊走滿足 ,因此 明顯依賴 ,但它的增量 可以是 i.i.d. 的。
3.2 不同的隨機過程
現在就可以理解為什麼會有 Markov process、Poisson process、Gaussian process、random walk 等不同名字。它們本質上都是在 這族隨機變數上施加不同的結構條件。
- Markov 過程規定了條件依賴結構;
- Poisson 過程規定了計數增量的分佈與獨立性;
- Gaussian process 規定任意有限多個時間點的聯合分佈都是多元高斯;
- 隨機遊走規定狀態由隨機增量不斷累積得到。
因此,所謂“學習一種隨機過程”,很多時候就是在學習:
這族隨機變數之間究竟滿足什麼特殊關係?
4. 小結
普通機率論經常問:
一個隨機變數 是什麼分佈?
而隨機過程進一步問:
一族隨機變數 怎樣共同變化?
因此,對隨機過程來說,邊緣分佈只是第一層資訊,更重要的是聯合分佈、共變異數、自相關和更一般的依賴結構。
這一點也自然引出了下一個問題:
如果一個隨機過程的統計規律在不同時間看起來都一樣,這意味著什麼?
這就是下一節要討論的 平穩性(stationarity)。