有些随机过程不研究”位置”,而研究”事件数量”:一小时来了多少顾客、一分钟服务器收到多少请求、一段时间内发生多少次放射性衰变。这类过程最经典的模型就是泊松过程(Poisson process),概率与统计 2已经介绍过泊松分布本身,本文把它放进”随时间持续发生”的过程视角。
1. 从计数过程到泊松过程
1.1 定义
定义 为从时间 0 到 为止发生的事件总数, 就是一个计数过程(counting process),一条样本路径呈阶梯状:事件发生时计数增加 1,没有事件时保持不变。强度为 的齐次泊松过程要求:、不重叠时间区间上的增量互相独立、长度为 的区间内事件数服从 ,其中 是单位时间内平均发生的事件数。
1.2 泊松分布描述一个时刻,泊松过程描述整条轨迹
泊松分布描述”一个固定区间里发生多少次事件”,例如 是一个随机变量;泊松过程描述的则是”累计事件数 随时间怎么变化”,也就是整条随机过程 。以 (每分钟平均 4 个事件)为例,两分钟内恰好发生 10 次事件的概率是 ——这个计算只用到 这一个时间点的分布;泊松过程要问的是这类计数如何在所有时刻上一起演化,而不只是单一时刻的分布长什么样。
2. 增量结构:独立且平稳
若区间 和 不重叠,标准泊松过程假设两个区间里的事件数 与 互相独立,这叫独立增量(independent increments)。泊松过程同时具有平稳增量:对任意 , 只取决于区间长度 ,不取决于区间从什么时候开始——同样长度的一小时,不论发生在早上还是晚上,在齐次模型里都有相同的统计规律。
3. 到达间隔与无记忆性
3.1 到达间隔服从指数分布
设 为第一次事件发生前的等待时间,事件在 之前还没发生的概率是 ,因此 ,而且相邻到达事件之间的等待时间也是 i.i.d. 指数分布。仍以 为例,等待超过 0.5 分钟才发生下一个事件的概率是 。泊松过程因此有两个等价视角:看固定时间内发生多少次,是泊松分布;看下一次事件要等多久,是指数分布——两者描述的是同一个随机机制,只是切入的角度不同。
3.2 无记忆性
指数分布具有无记忆性:,已经等待了多久,不会改变还需要继续等待多久的分布。这与泊松过程的 Markov 性质密切相关:知道”目前为止还没有事件发生”这件事本身,不会透露任何关于”还要多久”的额外信息。
4. 过程的合并、拆分与推广
4.1 Superposition 与 thinning:具体算一次
如果两个独立泊松过程的速率分别为 ,把它们的事件合并以后仍然是泊松过程,速率为 ,这叫 superposition(叠加):例如两类独立用户请求合并成总请求流,速率 (每分钟)。反过来,如果一个速率为 的泊松过程中,每个事件独立地以概率 被标记为 A 类,A 类事件本身形成一个新的泊松过程,速率为 ,剩余事件的速率为 ,这叫 thinning(稀疏化):例如原始请求流速率 10(每分钟),若 30% 的请求来自移动设备,移动设备请求本身是速率 的泊松过程,其余设备请求则是速率 的泊松过程,两者仍然互相独立。
4.2 非齐次泊松过程
现实中的事件速率往往随时间变化,例如餐厅中午和凌晨的客流显然不同。这时可以让强度变成 ,得到非齐次泊松过程,区间 的平均事件数变成 ,其余假设(独立增量、给定平均事件数下服从泊松分布)维持不变,只是不再有平稳增量——不同时段的统计规律可以不一样。
5. 模型限制与小结
泊松过程假设事件之间没有长程依赖、到达速率结构简单、inter-arrival time 恰好是指数分布,这三个假设合在一起,等于假设”事件发生的倾向不会因为最近发生过什么而改变”。很多现实系统并不满足这个条件:用户访问常常爆发式聚集(一个事件触发一连串相关事件,违反独立增量)、机器故障寿命通常不是指数分布(磨损效应让故障概率随使用时间增加,违反无记忆性)。放宽”到达间隔必须是指数分布”这个限制、保留”到达间隔独立同分布”的核心结构,就自然引出更一般的 renewal process。
泊松过程是最基础的随机到达模型:固定平均速率、独立增量、计数服从泊松分布,把泊松分布、指数等待时间、Markov 性质和计数过程串在了一起,也是理解更一般到达模型的起点。