随机过程最简洁的定义是:

随机过程是一族按照某种索引组织起来的随机变量。

理解定义还需要回答两个问题:为什么要组织多个随机变量,以及随机过程研究这些变量之间的什么关系。先从概率论的基础概念开始。

1. 从概率论开始

1.1 随机试验、事件与概率

掷一颗六面骰子时,结果可能是 1,2,3,4,5,61,2,3,4,5,6。掷骰子之前无法确定结果,因此掷骰子是一个随机试验(random experiment)

所有可能结果组成样本空间(sample space),记为 Ω\Omega。对于六面骰子,Ω={1,2,3,4,5,6}\Omega=\{1,2,3,4,5,6\}。如果关注“点数大于 3”,对应的结果集合 A={4,5,6}A=\{4,5,6\} 是一个事件(event)

概率 P(A)P(A) 描述事件发生的可能性。公平骰子满足 P(A)=P(X>3)=3/6=1/2P(A)=P(X>3)=3/6=1/2

  • 随机试验:执行结果不确定的操作;
  • 事件:研究者关注的一组结果;
  • 概率:事件发生可能性的数值描述。

1.2 随机变量

定义 XX 表示骰子的点数,则 X{1,2,3,4,5,6}X\in\{1,2,3,4,5,6\}XX 是一个随机变量(random variable)

严格来说,随机变量是把样本空间中的结果映射为数值的函数:X:ΩRX:\Omega\rightarrow\mathbb{R}ωX(ω)\omega\mapsto X(\omega)

例如,一次试验得到点数 4,可以写成 X(ω)=4X(\omega)=4XX 是随机变量,4 是一次实现值,而 X>3X>3 是事件,三个概念不能混用。

1.3 概率分布与期望值

**概率分布(probability distribution)**给出随机变量各个取值的概率。公平骰子满足 P(X=1)=P(X=2)==P(X=6)=16P(X=1)=P(X=2)=\cdots=P(X=6)=\frac16

离散随机变量的**期望值(expected value)**定义为 E[X]=xxP(X=x)E[X]=\sum_x xP(X=x)

公平骰子的期望值是 3.5。骰子不会掷出 3.5;期望值表示重复试验的平均结果会趋近的数值。随机过程理论经常研究 E[Xt]E[X_t],即索引 tt 对应随机变量的平均行为。

1.4 概率论与统计学

**概率论(probability theory)**从已知随机模型推导可能的结果。例如,已知骰子公平后计算点数大于 3 的概率。

**统计学(statistics)**从观察数据推断背后的概率模型。例如,掷骰子 1000 次后发现点数 6 出现了 400 次,研究者可能据此检验骰子是否公平。

随机过程以概率论为基础。实际应用通常只能观察一条或少数几条轨迹,因此还需要统计推断。

2. 从随机变量到随机过程

2.1 从随机变量到随机向量

一次掷骰子的结果可以用随机变量 XX 描述。连续掷 1000 次时,可以定义 X1,X2,,X1000X_1,X_2,\dots,X_{1000},其中 XiX_i 表示第 ii 次的点数。

(X1,X2,,X1000)(X_1,X_2,\dots,X_{1000}) 是一个 1000 维随机向量(random vector)。一次完整实验可能得到 (3,6,1,4,2,5,,1)(3,6,1,4,2,5,\dots,1),即随机向量的一次实现。

如果重复整组实验,可以把结果排成表格:

实验X1X_1X2X_2X3X_3\cdotsX1000X_{1000}
1361\cdots1
2524\cdots2
3136\cdots3

纵向观察一列,会看到某个固定位置的随机变量在不同实验中的实现;横向观察一行,会看到整个随机向量的一次实现。即使现实中只执行一次实验,概率模型仍然描述所有可能的实验结果。

2.2 从随机向量到随机过程

有限的 (X1,,X1000)(X_1,\dots,X_{1000}) 是随机向量。如果索引扩展为 X1,X2,X3,X_1,X_2,X_3,\dots,或者允许连续索引 XtX_t,普通有限维向量便不足以表达整个对象。

随机过程写成 {Xt}tT\{X_t\}_{t\in T}XtX_t 是随机变量,tt 是索引,TT 是索引集合。

  • T={0,1,2,}T=\{0,1,2,\dots\} 对应离散时间随机过程
  • T=[0,)T=[0,\infty) 对应连续时间随机过程

随机变量、随机向量和随机过程可以看成逐步扩展的结构:

随机变量 → 随机向量 → 随机过程

随机过程的关键不只是随机变量数量多,而是不同索引位置的随机变量具有联合结构。

3. 索引、实验与样本路径

3.1 索引不一定表示时间

XtX_t 常用来表示第 tt 天的气温、时刻 tt 的股票价格、随机游走第 tt 步的位置,或者第 tt 次模拟的状态。

索引也可以表示世代、迭代次数、采样顺序或其他有序结构。随机过程只要求一族随机变量具有有意义的索引结构,不要求索引必须是物理时间。

3.2 随机过程不等于一条曲线

随机游走可以写成 Xt+1=Xt+ϵt+1X_{t+1}=X_t+\epsilon_{t+1},其中 ϵt\epsilon_t 以相同概率取 +1+11-1。从 X0=0X_0=0 出发,两次实验可能得到不同的序列:

0 → 1 → 2 → 1 → 0 → -1 → 0 → ...
0 → -1 → 0 → 1 → 2 → 1 → 2 → ...

每个完整序列都是一次实现(realization),也称为一条样本路径(sample path)。随机过程描述所有可能的样本路径及其概率规律,单条观测曲线只是其中一次实现。

3.3 固定索引与固定实验

随机过程的完整记法是 X(t,ω)X(t,\omega),其中 tt 是索引,ωΩ\omega\in\Omega 表示样本空间中的结果。

  • 固定 t=t0t=t_0 并改变 ω\omegaX(t0,ω)X(t_0,\omega) 是一个随机变量;
  • 固定 ω=ω0\omega=\omega_0 并改变 ttX(t,ω0)X(t,\omega_0) 是一条样本路径。

平均函数、自相关函数、高斯过程和时间序列都会反复使用这两个观察方向。

4. 从标量过程到随机场

4.1 状态可以是向量

XtX_t 不必是标量。二维随机游走可以写成 Xt=(xt,yt)X_t=(x_t,y_t);车辆状态可以写成 Xt=(xt,vt,at)X_t=(x_t,v_t,a_t),分别表示位置、速度和加速度。

索引 tt 描述组织结构,XtX_t 描述每个索引位置上的状态。因此,随机过程可以具有一维时间索引和高维状态。

4.2 索引也可以是多维的

Xi,jX_{i,j} 表示图像位置 (i,j)(i,j) 的像素值时,索引变为二维。这类多维索引的随机对象称为随机场(random field)

已经拍摄的照片具有确定像素值,但生成图像的概率模型需要描述观察之前的所有可能图像。传感器噪声也会使相同场景的重复拍摄产生不同像素值。

RGB 图像可以写成 Xi,j,cX_{i,j,c},视频可以写成 Xt,i,j,cX_{t,i,j,c}。这些对象具有统一结构:

对象表示索引结构
随机变量XX无额外索引
随机过程XtX_t一维索引
二维随机场Xi,jX_{i,j}二维索引
高维随机场Xt,i,j,cX_{t,i,j,c}多维索引

索引集合把一族具有联合概率结构的随机变量组织起来。

5. 随机过程研究的对象

随机过程关注不同索引位置之间的关系,而不只关注每个 XtX_t 的单独分布。例如,分析气温过程时需要研究:

  • 今天偏热是否会提高明天偏热的概率;
  • XtX_tXt+1X_{t+1} 的相关性有多强;
  • 已知 XtX_t 后,Xt1X_{t-1} 是否仍提供信息;
  • Xt+hXtX_{t+h}-X_t 的分布是否只取决于 hh
  • 相隔更远的观测是否具有更弱的相关性;
  • 平均值 E[Xt]E[X_t] 是否随时间改变。

随机过程不要求 X1,X2,X_1,X_2,\dots 相互独立,也不要求各个随机变量同分布。骰子结果可以独立,股票价格和气温通常具有明显的时间依赖。

随机过程的核心研究对象是一族随机变量的联合分布与依赖结构。

6. 核心概念

随机过程的基本形式是 {Xt}tT\{X_t\}_{t\in T}。每个 XtX_t 是随机变量,TT 是索引集合。实际观察到的 x0,x1,x2,x_0,x_1,x_2,\dots 是一条样本路径;完整的随机过程还包括所有其他可能路径及其概率规律。

从随机变量继续扩展,可以得到:

随机变量 → 随机向量 → 随机过程 → 随机场

只知道每个 XtX_t 的边缘分布,无法确定不同索引位置如何共同变化。下一步需要研究联合分布、期望、方差、协方差、自相关和更一般的依赖关系。