随机过程理论中有两个完全不同的观察方向:一种是同时想象很多个平行系统,在固定时间观察它们的分布;另一种是只观察一个系统,但让它运行很长时间。这两种平均什么时候会得到同一个结果?这就是 ergodicity(遍历性) 想回答的问题。

1. 总体平均与时间平均

1.1 Ensemble average

假设有很多个相互独立的系统,在同一个时间点 tt 观察 Xt(1),Xt(2),X_t^{(1)},X_t^{(2)},\dots,这些系统之间的平均可以逼近期望 E[Xt]E[X_t],这种跨不同 realization 的平均叫 ensemble average

1.2 Time average:核心问题

如果只有一个系统,但观察很长时间,可以计算 XˉT=1Tt=1TXt\bar X_T=\frac1T\sum_{t=1}^TX_t,这叫 time average。核心问题是:time average 是否会趋近 ensemble average?如果在适当意义下成立,这个过程就具有遍历性。

2. 为什么这是个深问题:一个非遍历的具体例子

假设一个系统一开始各以 1/21/2 的概率随机选择进入 A 或 B 两个区域,然后永远停留在该区域:进入 A 则长期值恒为 0,进入 B 则长期值恒为 10。从总体上看,E[X]=0.5×0+0.5×10=5E[X]=0.5\times0+0.5\times10=5,ensemble across 不同系统的方差是 E[X2]E[X]2=0.5×0+0.5×10025=25E[X^2]-E[X]^2=0.5\times0+0.5\times100-25=25,标准差是 5——如果只看 ensemble 统计量,会以为典型值是”55 上下波动 55“。但任何一条 sample path 的长期平均只可能恰好是 0 或恰好是 10,永远不会接近 5,而且单条路径内部的时间平均方差是 0(一旦决定了进入 A 还是 B,之后就不再有任何随机性)。这正是遍历性失效的核心后果:只观察一条再长的路径,也完全无法推断出真实的 ensemble 方差是 25,因为单条路径从一开始就被锁定在两个极端之一,这个系统就是典型的非遍历结构。

3. 平稳性与 Markov chain 中的遍历性

3.1 平稳性不等于遍历性

平稳性说的是”概率规律不随时间平移改变”,遍历性说的是”一条足够长的轨迹能不能探索整个统计结构”,一个过程可以平稳但不遍历——第 2 节的例子只要略加调整(例如让 A、B 两个常数值本身不随时间改变分布)就同时是平稳且非遍历的。不要把”长期统计规律稳定”和”单条轨迹能够代表总体”混为一谈。

3.2 Markov chain 中的遍历性:具体算一次

对于很多有限状态 Markov chain,如果不可约、非周期并具有平稳分布 π\pi,长期时间比例会收敛到平稳分布:1Tt=1T1(Xt=i)πi\frac1T\sum_{t=1}^T\mathbf1(X_t=i)\to\pi_i,一条长轨迹在状态 ii 上停留的时间比例,会接近平稳分布中的概率 πi\pi_i,这是典型的 ergodic theorem。延续随机过程 6里解出的平稳分布 π=(1/3,1/2,1/6)\pi=(1/3,1/2,1/6):如果实际模拟这条链 T=12000T=12000 步,状态 B 出现的次数应该接近 12000×0.5=600012000\times0.5=6000 次,状态 C 出现的次数应该接近 12000×1/6=200012000\times1/6=2000 次——不需要平行跑很多条链取 ensemble average,一条够长的轨迹本身就足以估计出平稳分布,这正是这个 Markov chain 具有遍历性的直接体现。

4. 遍历定理、Mixing 与非遍历系统

4.1 Birkhoff 遍历定理与 mixing

更一般的遍历定理告诉我们,在适当条件下 1Tt=1Tf(Xt)\frac1T\sum_{t=1}^Tf(X_t) 可以收敛到 E[f(X)]E[f(X)],意味着理论上的 ensemble expectation 可以透过一条长时间序列估计,这对实际数据分析极其重要,因为现实中往往只有”一个世界的一条历史”。Mixing 是比遍历性更强的一类”忘记过去”的概念:粗略来说,如果系统的远期状态和当前状态越来越接近独立,就具有 mixing 行为,mixing 往往意味着良好的遍历性,但两者并不完全等价。

4.2 非遍历系统为什么重要

非遍历性常见于多吸引子动力系统、含有多个 communicating class 或吸收态的 Markov chain、玻璃态等复杂物理系统,以及具有长期锁定行为的 path-dependent 系统,此时单条 trajectory 可能永远只能探索状态空间的一部分。第 2 节的例子看似是刻意构造的极端情形,但实际系统里的”多吸引子”结构(例如训练过程可能收敛到不同的局部最优解、或生态系统可能稳定在不同的平衡点)本质上是同一种现象:只跑一次、观察很久,得到的结论不一定能代表所有可能的初始条件或随机性。

5. 小结

遍历性真正问的是:沿着一个系统看得足够久,是否等价于看很多个平行系统?第 2 节的非遍历例子和第 3.2 节的遍历 Markov chain 例子形成鲜明对比:前者无论观察多久都学不到真正的 ensemble 方差,后者一条够长的轨迹就能准确估计出整个平稳分布。遍历性把概率分布、long-run average 和 sample path 联系起来,是判断”一条时间序列能否代表整体”这个问题的核心概念,也是几乎所有从单一观测历史做统计推断的场合,都必须先确认(而不是假设)成立的前提。