随机过程写成 。随机过程成为独立研究领域的原因,在于不同索引位置的随机变量通常具有特定的依赖结构。
随机过程研究一族随机变量的联合关系。
1. 从边缘分布到联合分布
1.1 单变量分布无法确定过程
考虑两个过程:
- 第一个过程满足每个 ,并且 相互独立;
- 第二个过程先生成 ,再令所有时间点满足 。
两个过程在任意单独时刻都满足 ,但动态结构完全不同。第一个过程每一步重新随机取值,第二个过程一旦确定初值便始终保持该值。区别来自 与 的共同变化方式。
1.2 联合分布
研究一个随机变量 时,可以考察其分布 。同时研究时间点 时,需要联合分布 。
联合分布描述两个变量如何共同出现。即使两个变量都服从标准正态分布,它们仍可能完全独立、高度正相关、高度负相关,或者具有复杂的非线性依赖。边缘分布无法区分这些情况。
1.3 有限维分布
随机过程可能包含无限多个随机变量。实际分析会选择有限多个时间点 ,再研究随机向量 的联合分布。这些分布称为随机过程的有限维分布(finite-dimensional distributions)。
如果任意有限时间点组合的联合分布都已知,并且这些分布满足一致性条件,随机过程的概率结构也就确定了。
2. 用统计量描述依赖结构
2.1 均值函数
对每个时间点定义 。
称为随机过程的均值函数(mean function)。 表示过程在每个时间点都围绕 0 波动; 表示平均水平随时间线性上升。
均值函数只描述各个时间点的中心位置,不能确定不同时间点之间的相关性。
2.2 方差与协方差
描述单个时间点的波动大小。两个时间点之间的线性关系由协方差描述:。
通常表示 偏高时 也倾向偏高; 表示两个变量倾向反向变化。
只说明没有线性相关性,不能保证变量独立:
独立蕴含不相关,但不相关不一定蕴含独立。
2.3 自相关与滞后
随机过程尤其关注同一过程在不同索引位置的相关性。研究 与 时, 称为 lag(滞后)。标准化的相关系数为:
如果 随 增大而迅速接近 0,过程的记忆衰减较快;长期保持较强相关则表示过程具有较长的时间依赖。时间序列、信号处理、金融数据和物理系统都需要分析这类关系。
3. 特殊结构与过程类型
3.1 独立同分布只是特殊情况
可以具有多种关系:
- 独立且同分布;
- 独立但不同分布;
- 同分布但相互相关;
- 不同分布且具有复杂依赖。
i.i.d.(independent and identically distributed)只是方便分析的一种特殊结构。许多重要过程来自不同时间点之间的依赖。
例如,随机游走满足 。
依赖 ,但增量 可以是 i.i.d. 的。
3.2 不同随机过程的结构条件
Markov process、Poisson process、Gaussian process 和 random walk 都是在 上施加不同结构条件:
- Markov process 规定条件依赖结构;
- Poisson process 规定计数增量的分布与独立性;
- Gaussian process 要求任意有限时间点的联合分布都是多元高斯分布;
- random walk 通过累积随机增量产生状态。
学习某类随机过程,核心任务是理解该过程要求随机变量之间满足哪些特殊关系。
4. 核心概念
普通概率论经常研究一个随机变量的分布;随机过程进一步研究一族随机变量如何共同变化。
边缘分布提供单个时间点的信息,联合分布、协方差、自相关和一般依赖结构提供时间点之间的信息。下一篇将讨论统计规律在时间平移后是否保持不变,即平稳性(stationarity)。