在普通概率论里,一个 Gaussian random variable 由均值和方差决定。

如果把这个思想推广到一整族随机变量,就得到 Gaussian process(高斯过程)

1. 定义与 Kernel

1.1 高斯过程的定义

随机过程 {Xt}tT\{X_t\}_{t\in T} 如果满足:

对于任意有限多个索引 t1,,tnt_1,\dots,t_n,随机向量

(Xt1,,Xtn)(X_{t_1},\dots,X_{t_n})

都服从多元 Gaussian 分布,那么称它为 Gaussian process。

这一定义直接使用了随机过程的有限维分布。

1.2 均值函数和协方差函数

Gaussian process 可以由两个函数刻画:

均值函数:

m(t)=E[Xt]m(t)=E[X_t]

协方差函数:

k(s,t)=Cov(Xs,Xt)k(s,t)=\operatorname{Cov}(X_s,X_t)

因此通常写成:

X(t)GP(m(t),k(s,t))(1)\boxed{X(t)\sim GP(m(t),k(s,t))} \tag{1}

对于 Gaussian process,均值和协方差不只是“低阶统计量”,而几乎决定了整个过程的有限维联合分布。

1.3 Kernel 的意义

协方差函数 k(s,t)k(s,t) 也常称为 kernel。

它编码的是:

不同输入位置上的随机变量应该有多相似。

如果 k(s,t)k(s,t)sstt 接近时很大,说明相邻位置倾向于有相近取值。

不同 kernel 会产生不同的 sample path 性质:

  • 更平滑;
  • 更粗糙;
  • 更周期;
  • 更长程相关。

2. 典型过程与回归

2.1 Brownian motion 是 Gaussian process

Brownian motion 满足:

E[Bt]=0E[B_t]=0

以及:

Cov(Bs,Bt)=min(s,t)\operatorname{Cov}(B_s,B_t)=\min(s,t)

所以它就是一个特殊的 Gaussian process。

这说明 Gaussian process 不是机器学习独有概念,而是经典随机过程理论中的基础对象。

2.2 Gaussian process regression

机器学习中的 Gaussian Process Regression 可以理解为:

不直接假设某一个确定函数,而是假设“可能的函数”本身来自一个 Gaussian process。

观测数据以后,就利用条件 Gaussian 分布更新对函数的后验分布。

因此预测结果不仅有均值,还有不确定性。

3. 函数建模与平稳性

3.1 为什么它特别适合函数建模

普通参数模型写成 y=fθ(x)y=f_\theta(x),先选择有限维参数 θ\theta

Gaussian process 更像直接在“函数空间”上定义概率分布。

可以理解为:

fGP(m,k)f\sim GP(m,k)

每次从这个分布里采样,就得到一条可能的函数曲线。

3.2 Stationary kernel

如果 kernel 只依赖 sts-t,即:

k(s,t)=k(st)k(s,t)=k(s-t)

那么对应的 Gaussian process 常具有平稳结构。

例如 squared exponential kernel 只取决于两点之间的距离。

这把 Gaussian process 和前面学过的 stationarity 重新连接起来。

4. 小结

Gaussian process 的核心是:

任意有限多个位置上的随机变量都联合高斯\boxed{\text{任意有限多个位置上的随机变量都联合高斯}}

因此只需均值函数和协方差函数,就可以非常完整地描述整个随机过程。

它把随机过程的“联合结构”思想推到了一个极其干净的形式。