上一節把隨機過程寫成了 {Xt}tT\{X_t\}_{t\in T}。如果只看這個形式,它似乎只是“很多隨機變數放在一起”。真正讓隨機過程成為一門獨立學科的,是這些隨機變數之間並不是隨意擺放的,它們通常存在某種依賴結構。

因此,隨機過程真正研究的問題不是“每一個 XtX_t 分別是什麼分佈”,而是:

核心問題是整族隨機變數具有什麼聯合關係。

1. 從邊緣分佈到聯合分佈

1.1 只知道每個 XtX_t 的分佈是不夠的

考慮兩個過程:

  • 第一個過程滿足:每一個 XtN(0,1)X_t\sim N(0,1),並且 X1,X2,X_1,X_2,\dots 相互獨立。
  • 第二個過程則先生成一個隨機變數 ZN(0,1)Z\sim N(0,1),然後令所有時間點都滿足 Xt=ZX_t=Z

單獨看任意一個時刻,這兩個過程都滿足 XtN(0,1)X_t\sim N(0,1)。也就是說,它們在每一個單獨時間點上的分佈完全一樣。但它們顯然不是同一個隨機過程。

第一個過程每一步都會重新隨機;第二個過程一旦第一次取值確定,之後就永遠保持一樣。所以問題不在於某個單獨的 XtX_t,而在於 XsX_sXtX_t 如何一起變化。

1.2 聯合分佈

這裡需要回顧一下機率論的知識。如果只研究一個隨機變數 XtX_t,我們關心的是它的分佈: P(Xtx)P(X_t\le x)。如果同時研究兩個時間點 s,ts,t,就需要看它們的聯合分佈:P(Xsx,  Xty)P(X_s\le x,\;X_t\le y)

聯合分佈告訴我們的不是“兩個變數分別長什麼樣”,而是“它們會怎樣一起出現”。兩個變數可能都服從標準常態分布,但它們可以:

  • 完全獨立;
  • 高度正相關;
  • 高度負相關;
  • 存在複雜的非線性依賴。

這些情形單看邊緣分佈都無法區分。

1.3 有限維分佈

隨機過程可能包含無限多個隨機變數,但在實際分析中,我們總是選擇有限多個時間點:

t1,t2,,tnt_1,t_2,\dots,t_n

然後研究隨機向量 (Xt1,Xt2,,Xtn)(X_{t_1},X_{t_2},\dots,X_{t_n}) 的聯合分佈。這一組分佈稱為隨機過程的 有限維分佈(finite-dimensional distributions)

更嚴格地說,如果我們知道任意有限時間點組合的聯合分佈,並且這些分佈彼此滿足一致性條件,就已經掌握了這個隨機過程的機率結構。

所以從機率論角度看,一個隨機過程並不只是“一條會抖動的曲線”,而是:

隨機過程由所有有限多個時間點上的聯合機率規律刻畫。

2. 用統計量描述依賴結構

2.1 平均值函數

最基礎的統計量仍然是期望。樸素的理解就是,雖然你有隨機性,但是在取樣次數足夠多,所有的軌跡都會有個平均值。

對每個時間點定義:

m(t)=E[Xt]m(t)=E[X_t]

這個 m(t)m(t) 稱為隨機過程的平均值函數(mean function)。簡單來說就是不同索引的結果的平均,只不過這裡的索引是時間 tt

  • 如果 m(t)=0m(t)=0,表示整個過程在每個時間點都以 0 為中心波動。
  • 如果 m(t)=tm(t)=t,則說明過程的平均水平本身隨著時間上升。
  • 實際上 m(t)m(t) 也可以是別的函數。

平均值函數只描述每個時間點的中心位置,它還不能告訴我們不同時間點之間是否相關。

2.2 變異數和共變異數

請繼續回憶機率論,每個 XtX_t 自己的波動大小可以由 Var(Xt)\operatorname{Var}(X_t) 描述。如果要研究兩個時間點之間的關係,則使用共變異數:

C(s,t)=Cov(Xs,Xt)C(s,t)=\operatorname{Cov}(X_s,X_t)

如果 C(s,t)>0C(s,t)>0,通常表示 XsX_s 偏高時,XtX_t 也傾向於偏高;如果 C(s,t)<0C(s,t)<0,則表示二者傾向於反方向變化。

如果 C(s,t)=0C(s,t)=0,只能說明它們沒有線性相關性,並不能保證它們獨立。相關性描述的是線性關係。這是機率論中非常重要的區別:

獨立必然推出不相關;不相關不能推出獨立。

2.3 自相關和時間間隔

隨機過程中特別關心的是同一個過程在不同時間的相關性。更確切地說是不同索引之間的相關性,時間是一種常見的索引。

例如研究 XtX_tXt+τX_{t+\tau} 的關係,其中 τ\tau 稱為 lag(滯後)。標準化以後,可以定義相關係數:

ρ(s,t)=Cov(Xs,Xt)Var(Xs)Var(Xt)\rho(s,t)= \frac{\operatorname{Cov}(X_s,X_t)} {\sqrt{\operatorname{Var}(X_s)\operatorname{Var}(X_t)}}

如果隨著 τ\tau 增大,ρ(t,t+τ)\rho(t,t+\tau) 很快接近 0,那麼可以說這個過程的“記憶”衰減得比較快。

如果即使隔了很久仍然保持較強相關,則說明過程具有更長的時間依賴。這類關係在時間序列、訊號處理、金融資料和物理系統中都非常重要。

3. 特殊結構與過程對比

3.1 獨立同分布只是一個特殊情況

隨機過程並不要求 X1,X2,X_1,X_2,\dots 獨立同分布。事實上,可以存在很多不同的關係,就是獨立和同分佈構成一個笛卡爾積:

  • 獨立且同分布;
  • 獨立但不同分佈;
  • 同分布但彼此相關;
  • 既不同分佈,也存在複雜依賴。

i.i.d. (Independent and Identically Distributed)只是一種非常特殊、非常方便的結構。

很多真正有意思的隨機過程,恰恰來自不同時間點之間的依賴。

例如隨機遊走滿足 Xt+1=Xt+ϵt+1X_{t+1}=X_t+\epsilon_{t+1},因此 Xt+1X_{t+1} 明顯依賴 XtX_t,但它的增量 ϵt\epsilon_t 可以是 i.i.d. 的。

3.2 不同的隨機過程

現在就可以理解為什麼會有 Markov process、Poisson process、Gaussian process、random walk 等不同名字。它們本質上都是在 {Xt}\{X_t\} 這族隨機變數上施加不同的結構條件。

  • Markov 過程規定了條件依賴結構;
  • Poisson 過程規定了計數增量的分佈與獨立性;
  • Gaussian process 規定任意有限多個時間點的聯合分佈都是多元高斯;
  • 隨機遊走規定狀態由隨機增量不斷累積得到。

因此,所謂“學習一種隨機過程”,很多時候就是在學習:

這族隨機變數之間究竟滿足什麼特殊關係?

4. 小結

普通機率論經常問:

一個隨機變數 XX 是什麼分佈?

而隨機過程進一步問:

一族隨機變數 X1,X2,X_1,X_2,\dots 怎樣共同變化?

因此,對隨機過程來說,邊緣分佈只是第一層資訊,更重要的是聯合分佈、共變異數、自相關和更一般的依賴結構。

這一點也自然引出了下一個問題:

如果一個隨機過程的統計規律在不同時間看起來都一樣,這意味著什麼?

這就是下一節要討論的 平穩性(stationarity)