随机过程理论中有两个完全不同的观察方向:

一种是同时想象很多个平行实验,在固定时间观察它们的分布;另一种是只观察一个系统,但让它运行很长时间。

这两种平均什么时候会得到同一个结果?

这就是 ergodicity(遍历性) 想回答的问题。

1. 总体平均与时间平均

1.1 Ensemble average

假设有很多个相互独立的系统,在同一个时间点 tt 观察:

Xt(1),Xt(2),X_t^{(1)},X_t^{(2)},\dots

这些系统之间的平均可以逼近期望:

E[Xt]E[X_t]

这种跨不同 realization 的平均叫 ensemble average

1.2 Time average

如果我们只有一个系统,但观察很长时间,可以计算:

XˉT=1Tt=1TXt\bar X_T=\frac1T\sum_{t=1}^T X_t

这叫 time average

核心问题是:

time average 是否会趋近 ensemble average?(1)\boxed{\text{time average 是否会趋近 ensemble average?}} \tag{1}

如果在适当意义下成立,就具有遍历性。

1.3 为什么这是个深问题

假设一个系统一开始随机选择进入 A 或 B 两个区域,然后永远留在那里。

如果进入 A,长期值始终接近 0;如果进入 B,长期值始终接近 10。

从总体上看:

E[X]=5E[X]=5

但某一条 sample path 的长期平均只可能接近 0 或 10,而不会接近 5。

所以:

time averageensemble average\text{time average}\neq\text{ensemble average}

这个系统就是典型的非遍历结构。

2. 平稳性与 Markov chain 中的遍历性

2.1 Stationarity 和 ergodicity 不一样

平稳性说:

概率规律不随时间平移改变。

遍历性说:

一条足够长的轨迹是否能探索整个统计结构。

一个过程可以平稳但不遍历。

因此不要把“长期统计规律稳定”和“单条轨迹能够代表总体”混为一谈。

2.2 Markov chain 中的遍历性

对于很多有限状态 Markov chain,如果它不可约、非周期并具有合适的 stationary distribution,那么长期时间比例会收敛到平稳分布。

例如:

1Tt=1T1(Xt=i)πi\frac1T\sum_{t=1}^T\mathbf 1(X_t=i)\to\pi_i

这意味着:一条长轨迹在状态 ii 上停留的时间比例,会接近平稳分布中的概率 πi\pi_i

这就是非常典型的 ergodic theorem。

3. 遍历定理与 Mixing

3.1 Birkhoff ergodic theorem 的直觉

更一般的遍历定理告诉我们,在适当条件下:

1Tt=1Tf(Xt)\frac1T\sum_{t=1}^T f(X_t)

可以收敛到:

E[f(X)]E[f(X)]

这意味着理论上的 ensemble expectation 可以通过一条长时间序列估计。

这对实际数据分析极其重要,因为现实中我们往往只有“一个世界的一条历史”。

3.2 Mixing 和 ergodicity

Mixing 是比遍历性更强的一类“忘记过去”的概念。

粗略来说,如果一个系统的远期状态和当前状态越来越接近独立,就具有 mixing 行为。

Mixing 往往意味着良好的 ergodicity,但两者并不完全等价。

4. 非遍历系统为什么重要

非遍历性常见于:

  • 多吸引子动力系统;
  • 多个 communicating classes;
  • 吸收态;
  • 玻璃态和复杂物理系统;
  • path-dependent 系统;
  • 存在长期锁定的过程。

此时单条 trajectory 可能永远只能探索状态空间的一部分。

5. 小结

遍历性真正问的是:

沿着一个系统看得足够久,是否等价于看很多个平行系统?\boxed{\text{沿着一个系统看得足够久,是否等价于看很多个平行系统?}}

它把 probability distribution、long-run average 和 sample path 联系起来,是理解“单条时间序列能否代表总体”的核心概念。