上一节把随机过程写成了 {Xt}tT\{X_t\}_{t\in T}。如果只看这个形式,它似乎只是“很多随机变量放在一起”。真正让随机过程成为一门独立学科的,是这些随机变量之间并不是随意摆放的,它们通常存在某种依赖结构。

因此,随机过程真正研究的问题不是“每一个 XtX_t 分别是什么分布”,而是:

这一族随机变量之间究竟存在怎样的联合关系\boxed{\text{这一族随机变量之间究竟存在怎样的联合关系}}

1. 从边缘分布到联合分布

1.1 只知道每个 XtX_t 的分布是不够的

考虑两个过程:

  • 第一个过程满足:每一个 XtN(0,1)X_t\sim N(0,1),并且 X1,X2,X_1,X_2,\dots 相互独立。
  • 第二个过程则先生成一个随机变量 ZN(0,1)Z\sim N(0,1),然后令所有时间点都满足 Xt=ZX_t=Z

单独看任意一个时刻,这两个过程都满足 XtN(0,1)X_t\sim N(0,1)。也就是说,它们在每一个单独时间点上的分布完全一样。但它们显然不是同一个随机过程。

第一个过程每一步都会重新随机;第二个过程一旦第一次取值确定,之后就永远保持一样。所以问题不在于某个单独的 XtX_t,而在于 XsX_sXtX_t 如何一起变化。

1.2 联合分布

这里需要回顾一下概率论的知识。如果只研究一个随机变量 XtX_t,我们关心的是它的分布: P(Xtx)P(X_t\le x)。如果同时研究两个时间点 s,ts,t,就需要看它们的联合分布:P(Xsx,  Xty)P(X_s\le x,\;X_t\le y)

联合分布告诉我们的不是“两个变量分别长什么样”,而是“它们会怎样一起出现”。两个变量可能都服从标准正态分布,但它们可以:

  • 完全独立;
  • 高度正相关;
  • 高度负相关;
  • 存在复杂的非线性依赖。

这些情形单看边缘分布都无法区分。

1.3 有限维分布

随机过程可能包含无限多个随机变量,但在实际分析中,我们总是选择有限多个时间点:

t1,t2,,tnt_1,t_2,\dots,t_n

然后研究随机向量 (Xt1,Xt2,,Xtn)(X_{t_1},X_{t_2},\dots,X_{t_n}) 的联合分布。这一组分布称为随机过程的 有限维分布(finite-dimensional distributions)

更严格地说,如果我们知道任意有限时间点组合的联合分布,并且这些分布彼此满足一致性条件,就已经掌握了这个随机过程的概率结构。

所以从概率论角度看,一个随机过程并不只是“一条会抖动的曲线”,而是:

所有有限多个时间点上的联合概率规律(1)\boxed{\text{所有有限多个时间点上的联合概率规律}} \tag{1}

2. 用统计量描述依赖结构

2.1 均值函数

最基础的统计量仍然是期望。朴素的理解就是,虽然你有随机性,但是在采样次数足够多,所有的轨迹都会有个平均值。

对每个时间点定义:

m(t)=E[Xt]m(t)=E[X_t]

这个 m(t)m(t) 称为随机过程的均值函数(mean function)。简单来说就是不同索引的结果的平均,只不过这里的索引是时间 tt

  • 如果 m(t)=0m(t)=0,表示整个过程在每个时间点都以 0 为中心波动。
  • 如果 m(t)=tm(t)=t,则说明过程的平均水平本身随着时间上升。
  • 实际上 m(t)m(t) 也可以是别的函数。

均值函数只描述每个时间点的中心位置,它还不能告诉我们不同时间点之间是否相关。

2.2 方差和协方差

请继续回忆概率论,每个 XtX_t 自己的波动大小可以由 Var(Xt)\operatorname{Var}(X_t) 描述。如果要研究两个时间点之间的关系,则使用协方差:

C(s,t)=Cov(Xs,Xt)C(s,t)=\operatorname{Cov}(X_s,X_t)

如果 C(s,t)>0C(s,t)>0,通常表示 XsX_s 偏高时,XtX_t 也倾向于偏高;如果 C(s,t)<0C(s,t)<0,则表示二者倾向于反方向变化。

如果 C(s,t)=0C(s,t)=0,只能说明它们没有线性相关性,并不能保证它们独立。相关性描述的是线性关系。这是概率论中非常重要的区别:

独立不相关,但不相关独立\boxed{\text{独立} \Rightarrow \text{不相关,但不相关} \nRightarrow \text{独立}}

2.3 自相关和时间间隔

随机过程中特别关心的是同一个过程在不同时间的相关性。更确切地说是不同索引之间的相关性,时间是一种常见的索引。

例如研究 XtX_tXt+τX_{t+\tau} 的关系,其中 τ\tau 称为 lag(滞后)。标准化以后,可以定义相关系数:

ρ(s,t)=Cov(Xs,Xt)Var(Xs)Var(Xt)\rho(s,t)= \frac{\operatorname{Cov}(X_s,X_t)} {\sqrt{\operatorname{Var}(X_s)\operatorname{Var}(X_t)}}

如果随着 τ\tau 增大,ρ(t,t+τ)\rho(t,t+\tau) 很快接近 0,那么可以说这个过程的“记忆”衰减得比较快。

如果即使隔了很久仍然保持较强相关,则说明过程具有更长的时间依赖。这类关系在时间序列、信号处理、金融数据和物理系统中都非常重要。

3. 特殊结构与过程对比

3.1 独立同分布只是一个特殊情况

随机过程并不要求 X1,X2,X_1,X_2,\dots 独立同分布。事实上,可以存在很多不同的关系,就是独立和同分布构成一个笛卡尔积:

  • 独立且同分布;
  • 独立但不同分布;
  • 同分布但彼此相关;
  • 既不同分布,也存在复杂依赖。

i.i.d. (Independent and Identically Distributed)只是一种非常特殊、非常方便的结构。

很多真正有意思的随机过程,恰恰来自不同时间点之间的依赖。

例如随机游走满足 Xt+1=Xt+ϵt+1X_{t+1}=X_t+\epsilon_{t+1},因此 Xt+1X_{t+1} 明显依赖 XtX_t,但它的增量 ϵt\epsilon_t 可以是 i.i.d. 的。

3.2 不同的随机过程

现在就可以理解为什么会有 Markov process、Poisson process、Gaussian process、random walk 等不同名字。它们本质上都是在 {Xt}\{X_t\} 这族随机变量上施加不同的结构条件。

  • Markov 过程规定了条件依赖结构;
  • Poisson 过程规定了计数增量的分布与独立性;
  • Gaussian process 规定任意有限多个时间点的联合分布都是多元高斯;
  • 随机游走规定状态由随机增量不断累积得到。

因此,所谓“学习一种随机过程”,很多时候就是在学习:

这族随机变量之间究竟满足什么特殊关系?

4. 小结

普通概率论经常问:

一个随机变量 XX 是什么分布?

而随机过程进一步问:

一族随机变量 X1,X2,X_1,X_2,\dots 怎样共同变化?

因此,对随机过程来说,边缘分布只是第一层信息,更重要的是联合分布、协方差、自相关和更一般的依赖结构。

这一点也自然引出了下一个问题:

如果一个随机过程的统计规律在不同时间看起来都一样,这意味着什么?

这就是下一节要讨论的 平稳性(stationarity)