随机过程理论中有两个完全不同的观察方向:一种是同时想象很多个平行系统,在固定时间观察它们的分布;另一种是只观察一个系统,但让它运行很长时间。这两种平均什么时候会得到同一个结果?这就是 ergodicity(遍历性) 想回答的问题。
1. 总体平均与时间平均
1.1 Ensemble average
假设有很多个相互独立的系统,在同一个时间点 观察 ,这些系统之间的平均可以逼近期望 ,这种跨不同 realization 的平均叫 ensemble average。
1.2 Time average:核心问题
如果只有一个系统,但观察很长时间,可以计算 ,这叫 time average。核心问题是:time average 是否会趋近 ensemble average?如果在适当意义下成立,这个过程就具有遍历性。
2. 为什么这是个深问题:一个非遍历的具体例子
假设一个系统一开始各以 的概率随机选择进入 A 或 B 两个区域,然后永远停留在该区域:进入 A 则长期值恒为 0,进入 B 则长期值恒为 10。从总体上看,,ensemble across 不同系统的方差是 ,标准差是 5——如果只看 ensemble 统计量,会以为典型值是” 上下波动 “。但任何一条 sample path 的长期平均只可能恰好是 0 或恰好是 10,永远不会接近 5,而且单条路径内部的时间平均方差是 0(一旦决定了进入 A 还是 B,之后就不再有任何随机性)。这正是遍历性失效的核心后果:只观察一条再长的路径,也完全无法推断出真实的 ensemble 方差是 25,因为单条路径从一开始就被锁定在两个极端之一,这个系统就是典型的非遍历结构。
3. 平稳性与 Markov chain 中的遍历性
3.1 平稳性不等于遍历性
平稳性说的是”概率规律不随时间平移改变”,遍历性说的是”一条足够长的轨迹能不能探索整个统计结构”,一个过程可以平稳但不遍历——第 2 节的例子只要略加调整(例如让 A、B 两个常数值本身不随时间改变分布)就同时是平稳且非遍历的。不要把”长期统计规律稳定”和”单条轨迹能够代表总体”混为一谈。
3.2 Markov chain 中的遍历性:具体算一次
对于很多有限状态 Markov chain,如果不可约、非周期并具有平稳分布 ,长期时间比例会收敛到平稳分布:,一条长轨迹在状态 上停留的时间比例,会接近平稳分布中的概率 ,这是典型的 ergodic theorem。延续随机过程 6里解出的平稳分布 :如果实际模拟这条链 步,状态 B 出现的次数应该接近 次,状态 C 出现的次数应该接近 次——不需要平行跑很多条链取 ensemble average,一条够长的轨迹本身就足以估计出平稳分布,这正是这个 Markov chain 具有遍历性的直接体现。
4. 遍历定理、Mixing 与非遍历系统
4.1 Birkhoff 遍历定理与 mixing
更一般的遍历定理告诉我们,在适当条件下 可以收敛到 ,意味着理论上的 ensemble expectation 可以透过一条长时间序列估计,这对实际数据分析极其重要,因为现实中往往只有”一个世界的一条历史”。Mixing 是比遍历性更强的一类”忘记过去”的概念:粗略来说,如果系统的远期状态和当前状态越来越接近独立,就具有 mixing 行为,mixing 往往意味着良好的遍历性,但两者并不完全等价。
4.2 非遍历系统为什么重要
非遍历性常见于多吸引子动力系统、含有多个 communicating class 或吸收态的 Markov chain、玻璃态等复杂物理系统,以及具有长期锁定行为的 path-dependent 系统,此时单条 trajectory 可能永远只能探索状态空间的一部分。第 2 节的例子看似是刻意构造的极端情形,但实际系统里的”多吸引子”结构(例如训练过程可能收敛到不同的局部最优解、或生态系统可能稳定在不同的平衡点)本质上是同一种现象:只跑一次、观察很久,得到的结论不一定能代表所有可能的初始条件或随机性。
5. 小结
遍历性真正问的是:沿着一个系统看得足够久,是否等价于看很多个平行系统?第 2 节的非遍历例子和第 3.2 节的遍历 Markov chain 例子形成鲜明对比:前者无论观察多久都学不到真正的 ensemble 方差,后者一条够长的轨迹就能准确估计出整个平稳分布。遍历性把概率分布、long-run average 和 sample path 联系起来,是判断”一条时间序列能否代表整体”这个问题的核心概念,也是几乎所有从单一观测历史做统计推断的场合,都必须先确认(而不是假设)成立的前提。