在普通概率论里,一个 Gaussian random variable 由均值和方差决定。
如果把这个思想推广到一整族随机变量,就得到 Gaussian process(高斯过程)。
1. 定义与 Kernel
1.1 高斯过程的定义
随机过程 如果满足:
对于任意有限多个索引 ,随机向量
都服从多元 Gaussian 分布,那么称它为 Gaussian process。
这一定义直接使用了随机过程的有限维分布。
1.2 均值函数和协方差函数
Gaussian process 可以由两个函数刻画:
均值函数:
协方差函数:
因此通常写成:
对于 Gaussian process,均值和协方差不只是“低阶统计量”,而几乎决定了整个过程的有限维联合分布。
1.3 Kernel 的意义
协方差函数 也常称为 kernel。
它编码的是:
不同输入位置上的随机变量应该有多相似。
如果 在 和 接近时很大,说明相邻位置倾向于有相近取值。
不同 kernel 会产生不同的 sample path 性质:
- 更平滑;
- 更粗糙;
- 更周期;
- 更长程相关。
2. 典型过程与回归
2.1 Brownian motion 是 Gaussian process
Brownian motion 满足:
以及:
所以它就是一个特殊的 Gaussian process。
这说明 Gaussian process 不是机器学习独有概念,而是经典随机过程理论中的基础对象。
2.2 Gaussian process regression
机器学习中的 Gaussian Process Regression 可以理解为:
不直接假设某一个确定函数,而是假设“可能的函数”本身来自一个 Gaussian process。
观测数据以后,就利用条件 Gaussian 分布更新对函数的后验分布。
因此预测结果不仅有均值,还有不确定性。
3. 函数建模与平稳性
3.1 为什么它特别适合函数建模
普通参数模型写成 ,先选择有限维参数 。
Gaussian process 更像直接在“函数空间”上定义概率分布。
可以理解为:
每次从这个分布里采样,就得到一条可能的函数曲线。
3.2 Stationary kernel
如果 kernel 只依赖 ,即:
那么对应的 Gaussian process 常具有平稳结构。
例如 squared exponential kernel 只取决于两点之间的距离。
这把 Gaussian process 和前面学过的 stationarity 重新连接起来。
4. 小结
Gaussian process 的核心是:
因此只需均值函数和协方差函数,就可以非常完整地描述整个随机过程。
它把随机过程的“联合结构”思想推到了一个极其干净的形式。