随机变量把试验结果转成数值,分布则说明各个数值出现的概率。只记住分布名称和公式不够:建模时还要知道参数代表什么、数据是否符合模型假设,以及均值与方差遗漏了哪些信息。
本文先建立描述单一分布的数值工具,再比较常见离散与连续分布,最后把一个随机变量推广到随机向量。本文会在使用 PMF、PDF 与 CDF 时交代所需定义,因此不要求读者先完成系列其他文章。
1. 用分布与数值摘要描述随机变量
1.1 PMF、PDF 与 CDF 回答不同问题
离散随机变量 X X X 使用概率质量函数(PMF)p X ( x ) = P ( X = x ) p_X(x)=P(X=x) p X ( x ) = P ( X = x ) ,所有可能值的概率必须满足 p X ( x ) ≥ 0 p_X(x)\ge 0 p X ( x ) ≥ 0 与 ∑ x p X ( x ) = 1 \sum_x p_X(x)=1 ∑ x p X ( x ) = 1 。连续随机变量使用概率密度函数(PDF)f X ( x ) f_X(x) f X ( x ) ,区间概率是 P ( a ≤ X ≤ b ) = ∫ a b f X ( x ) d x P(a\le X\le b)=\int_a^b f_X(x)\,dx P ( a ≤ X ≤ b ) = ∫ a b f X ( x ) d x 。密度本身不是概率;连续变量通常满足 P ( X = x ) = 0 P(X=x)=0 P ( X = x ) = 0 ,真正有意义的是一段区间下方的面积。
累积分布函数(CDF)F X ( x ) = P ( X ≤ x ) F_X(x)=P(X\le x) F X ( x ) = P ( X ≤ x ) 同时适用于离散与连续变量。CDF 可以直接计算区间与尾端概率,例如 P ( X > x ) = 1 − F X ( x ) P(X>x)=1-F_X(x) P ( X > x ) = 1 − F X ( x ) ;若 X X X 为连续变量,则 P ( a < X ≤ b ) = F X ( b ) − F X ( a ) P(a<X\le b)=F_X(b)-F_X(a) P ( a < X ≤ b ) = F X ( b ) − F X ( a ) 。比较两个模型时,先确认使用的是单点概率、密度还是累积概率,能避免把 PDF 高度误当成事件概率。
1.2 期望值、方差与矩
期望值描述分布的重心。离散情况为 E [ X ] = ∑ x x p X ( x ) E[X]=\sum_x xp_X(x) E [ X ] = ∑ x x p X ( x ) ,连续情况为 E [ X ] = ∫ − ∞ ∞ x f X ( x ) d x E[X]=\int_{-\infty}^{\infty}xf_X(x)\,dx E [ X ] = ∫ − ∞ ∞ x f X ( x ) d x 。期望值不一定是可能观测到的值:公平六面骰子的期望值是 3.5 3.5 3.5 ,但任何一次掷骰都不会出现 3.5 3.5 3.5 。期望值也不保证存在;尾端衰减过慢的分布可能使积分发散。
方差 Var ( X ) = E [ ( X − μ ) 2 ] = E [ X 2 ] − μ 2 \operatorname{Var}(X)=E[(X-\mu)^2]=E[X^2]-\mu^2 Var ( X ) = E [( X − μ ) 2 ] = E [ X 2 ] − μ 2 衡量观测值相对均值 μ = E [ X ] \mu=E[X] μ = E [ X ] 的平方偏差。标准差 σ = Var ( X ) \sigma=\sqrt{\operatorname{Var}(X)} σ = Var ( X ) 与 X X X 具有相同单位,因此比方差容易解读。若服务器延迟的均值是 100 ms、标准差是 10 ms,标准差直接以毫秒描述波动;方差的单位则是平方毫秒。
k k k 阶原始矩是 E [ X k ] E[X^k] E [ X k ] ,k k k 阶中心矩是 E [ ( X − μ ) k ] E[(X-\mu)^k] E [( X − μ ) k ] 。一阶原始矩就是均值,二阶中心矩就是方差;标准化三阶中心矩形成偏度,用来描述左右不对称;标准化四阶中心矩与峰度相关,用来描述尾端与集中程度。有限个矩通常不能完整决定分布,而且某些分布没有高阶矩,所以矩是摘要,不是分布本身。
1.3 中位数、分位数与尾端风险
中位数是 0.5 分位数。更一般地,可以把 p p p 分位数定义为 q p = inf { x : F X ( x ) ≥ p } q_p=\inf\{x:F_X(x)\ge p\} q p = inf { x : F X ( x ) ≥ p } ;第 25、50、75 百分位数分别描述分布的四分位位置。四分位距 I Q R = q 0.75 − q 0.25 IQR=q_{0.75}-q_{0.25} I QR = q 0.75 − q 0.25 对极端值较不敏感,适合描述偏斜或含离群值的数据。
均值与中位数的差异能揭示偏斜。九次延迟都是 20 ms、一次延迟是 1020 ms 时,均值为 120 ms,中位数仍是 20 ms。均值反映极端延迟造成的总成本,中位数反映典型请求;两个数值回答不同问题。服务可靠性通常还要报告 p 95 p_{95} p 95 、p 99 p_{99} p 99 或超过阈值的尾端概率 P ( X > c ) P(X>c) P ( X > c ) ,因为相同均值与标准差的分布仍可能具有截然不同的尾端。
2. 常见离散分布
2.1 Bernoulli、Binomial 与 Geometric
Bernoulli 分布描述一次只有成功或失败的试验。若 X ∈ { 0 , 1 } X\in\{0,1\} X ∈ { 0 , 1 } 且成功概率为 p p p ,写成 X ∼ Bernoulli ( p ) X\sim\operatorname{Bernoulli}(p) X ∼ Bernoulli ( p ) ;其期望值为 p p p ,方差为 p ( 1 − p ) p(1-p) p ( 1 − p ) 。参数 p p p 必须在每次指定的试验中具有明确含义,例如”一个请求在 200 ms 内完成”的概率,而不是没有时间范围或服务范围的抽象成功率。
Binomial 分布描述 n n n 次独立、成功率相同的 Bernoulli 试验中成功的总次数。若 X ∼ Binomial ( n , p ) X\sim\operatorname{Binomial}(n,p) X ∼ Binomial ( n , p ) ,则 P ( X = k ) = ( n k ) p k ( 1 − p ) n − k P(X=k)={n\choose k}p^k(1-p)^{n-k} P ( X = k ) = ( k n ) p k ( 1 − p ) n − k 、E [ X ] = n p E[X]=np E [ X ] = n p 、Var ( X ) = n p ( 1 − p ) \operatorname{Var}(X)=np(1-p) Var ( X ) = n p ( 1 − p ) 。假设 20 个独立请求各有 5% 概率失败,失败数 X X X 可建模为 Binomial ( 20 , 0.05 ) \operatorname{Binomial}(20,0.05) Binomial ( 20 , 0.05 ) ,恰好两次失败的概率是 ( 20 2 ) ( 0.05 ) 2 ( 0.95 ) 18 ≈ 0.189 {20\choose2}(0.05)^2(0.95)^{18}\approx0.189 ( 2 20 ) ( 0.05 ) 2 ( 0.95 ) 18 ≈ 0.189 。若请求共享同一个故障节点,失败事件可能高度相关,Binomial 的独立假设便不成立。
Geometric 分布描述第一次成功前需要多少次试验。若把成功所在的试验次数记为 T ∈ { 1 , 2 , … } T\in\{1,2,\ldots\} T ∈ { 1 , 2 , … } ,则 P ( T = k ) = ( 1 − p ) k − 1 p P(T=k)=(1-p)^{k-1}p P ( T = k ) = ( 1 − p ) k − 1 p 与 E [ T ] = 1 / p E[T]=1/p E [ T ] = 1/ p 。不同教材也会把失败次数记为从 0 开始的变量;使用公式前必须确认计数起点。Geometric 分布具有离散无记忆性,适合成功率固定且每次试验独立的等待问题。
2.2 Poisson 分布
Poisson 分布描述固定区间内的事件数。若 X ∼ Poisson ( λ ) X\sim\operatorname{Poisson}(\lambda) X ∼ Poisson ( λ ) ,则 P ( X = k ) = e − λ λ k / k ! P(X=k)=e^{-\lambda}\lambda^k/k! P ( X = k ) = e − λ λ k / k ! ,而且 E [ X ] = Var ( X ) = λ E[X]=\operatorname{Var}(X)=\lambda E [ X ] = Var ( X ) = λ 。参数 λ \lambda λ 是指定区间内的平均事件数;若平均每分钟有 3 个请求,十分钟区间的均值在齐次假设下是 30,不能仍把参数填成 3。
Poisson 模型通常假设事件在极短区间内单独发生、互不影响,而且平均速率在研究区间内固定。均值与样本方差差距很大,可能表示数据有过度离散、速率随时间改变或事件聚集。固定区间的 Poisson 分布只描述一个计数变量;若要描述计数如何随时间累积,以及计数与等待时间的关系,可阅读随机过程 9:泊松过程 。
2.3 Categorical 与 Multinomial
Categorical 分布把 Bernoulli 的两种结果扩充为 K K K 个互斥类别,参数为概率向量 ( p 1 , … , p K ) (p_1,\dots,p_K) ( p 1 , … , p K ) ,其中每个 p i ≥ 0 p_i\ge0 p i ≥ 0 且总和为 1。单次请求的状态可能分为成功、客户端错误与服务器错误,三类概率共同定义一次 Categorical 试验。
Multinomial 分布再把单次 Categorical 试验扩充到 n n n 次独立同分布试验,输出每一类的计数 ( X 1 , … , X K ) (X_1,\dots,X_K) ( X 1 , … , X K ) ,并满足 ∑ i X i = n \sum_iX_i=n ∑ i X i = n 。各类计数不能彼此独立,因为某一类多一次就会压缩其他类可用的总数。该限制预告了一个重要观念:多维数据的每个分量都可能有简单的边缘分布,但分量之间仍受联合结构约束。
3. 常见连续分布
Uniform 分布 X ∼ Uniform ( a , b ) X\sim\operatorname{Uniform}(a,b) X ∼ Uniform ( a , b ) 在区间 [ a , b ] [a,b] [ a , b ] 内具有固定密度 1 / ( b − a ) 1/(b-a) 1/ ( b − a ) ,期望值为 ( a + b ) / 2 (a+b)/2 ( a + b ) /2 ,方差为 ( b − a ) 2 / 12 (b-a)^2/12 ( b − a ) 2 /12 。模型假设每个等长子区间具有相同概率,适合描述有限范围内没有偏好的位置;Uniform 不适合仅因数据落在某个范围内就直接采用,观测机制仍需支持均匀假设。
Exponential 分布 T ∼ Exponential ( λ ) T\sim\operatorname{Exponential}(\lambda) T ∼ Exponential ( λ ) 常用来描述 Poisson 过程中的事件间隔,密度为 f T ( t ) = λ e − λ t f_T(t)=\lambda e^{-\lambda t} f T ( t ) = λ e − λ t (t ≥ 0 t\ge0 t ≥ 0 ),期望值为 1 / λ 1/\lambda 1/ λ ,方差为 1 / λ 2 1/\lambda^2 1/ λ 2 。速率 λ \lambda λ 越大,平均等待时间越短。Exponential 的无记忆性 P ( T > s + t ∣ T > s ) = P ( T > t ) P(T>s+t\mid T>s)=P(T>t) P ( T > s + t ∣ T > s ) = P ( T > t ) 意味着已等待时间不改变剩余等待时间的分布;具有老化、磨损或排队聚集的寿命数据通常不符合该假设。
Gamma 分布可以描述累积多个独立 Exponential 等待时间。采用 shape-rate 参数化 T ∼ Gamma ( α , λ ) T\sim\operatorname{Gamma}(\alpha,\lambda) T ∼ Gamma ( α , λ ) 时,期望值是 α / λ \alpha/\lambda α / λ ,方差是 α / λ 2 \alpha/\lambda^2 α / λ 2 。不同软件可能用 scale θ = 1 / λ \theta=1/\lambda θ = 1/ λ 代替 rate;看到 Gamma 参数时必须先确认第二个参数是 rate 还是 scale。
3.2 Normal 分布与标准化
Normal 分布 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) 由位置参数 μ \mu μ 与尺度参数 σ > 0 \sigma>0 σ > 0 决定,期望值为 μ \mu μ ,方差为 σ 2 \sigma^2 σ 2 。标准化 Z = ( X − μ ) / σ Z=(X-\mu)/\sigma Z = ( X − μ ) / σ 会得到 Z ∼ N ( 0 , 1 ) Z\sim N(0,1) Z ∼ N ( 0 , 1 ) ,因此不同单位的观测值可以转换成距离均值多少个标准差。
若零件长度可近似为 N ( 100 , 2 2 ) N(100,2^2) N ( 100 , 2 2 ) mm,规格要求 96 至 104 mm,标准化后的界线是 -2 与 2,因此合格率约为 P ( − 2 ≤ Z ≤ 2 ) ≈ 0.9545 P(-2\le Z\le2)\approx0.9545 P ( − 2 ≤ Z ≤ 2 ) ≈ 0.9545 。计算结果依赖 Normal 假设;分布若偏斜、有厚尾或混合了多个生产批次,仅凭均值与标准差套用 68–95–99.7 规则会低估尾端概率。
Normal 分布常见于许多微小影响相加的测量误差与样本均值,但”数据很多”不会自动让原始数据服从 Normal。中心极限定理通常描述经过中心化与缩放的总和或均值,而不是任意总体的每一笔观测。
3.3 依数据类型选择候选模型
分布名称应由随机机制和支撑集合共同决定。二元结果可先考虑 Bernoulli;固定试验次数内的成功数可考虑 Binomial;固定时间内的稀疏事件数可考虑 Poisson;正值等待时间可比较 Exponential、Gamma 或其他寿命分布;上下界内近似无偏好的位置可考虑 Uniform;多个微小误差相加的实值量可考虑 Normal。
候选模型仍需接受数据检查。研究者可以比较直方图、经验 CDF、分位数与模型分位数,并检查均值和方差是否符合参数限制。模型是带假设的近似;选择分布时,生成机制、支撑集合与尾端行为比曲线外观更重要。
4. 联合、边缘与条件分布
4.1 联合分布保留变量如何共同出现
两个离散随机变量的联合 PMF 是 p X , Y ( x , y ) = P ( X = x , Y = y ) p_{X,Y}(x,y)=P(X=x,Y=y) p X , Y ( x , y ) = P ( X = x , Y = y ) ;两个连续随机变量则可使用联合密度 f X , Y ( x , y ) f_{X,Y}(x,y) f X , Y ( x , y ) 。联合分布需要对所有可能组合归一化,并且包含单一变量分布与变量依赖关系的完整信息。
考虑一个等概率抽取的数据表:( X , Y ) (X,Y) ( X , Y ) 分别以概率 1 / 4 1/4 1/4 取值 ( 0 , 0 ) , ( 0 , 1 ) , ( 1 , 1 ) , ( 1 , 2 ) (0,0),(0,1),(1,1),(1,2) ( 0 , 0 ) , ( 0 , 1 ) , ( 1 , 1 ) , ( 1 , 2 ) 。X X X 的分布只告诉读者 P ( X = 0 ) = P ( X = 1 ) = 1 / 2 P(X=0)=P(X=1)=1/2 P ( X = 0 ) = P ( X = 1 ) = 1/2 ,Y Y Y 的分布只告诉读者 P ( Y = 0 ) = 1 / 4 P(Y=0)=1/4 P ( Y = 0 ) = 1/4 、P ( Y = 1 ) = 1 / 2 P(Y=1)=1/2 P ( Y = 1 ) = 1/2 、P ( Y = 2 ) = 1 / 4 P(Y=2)=1/4 P ( Y = 2 ) = 1/4 。联合 PMF 还保留 X = 0 X=0 X = 0 时 Y Y Y 不会等于 2,以及 X = 1 X=1 X = 1 时 Y Y Y 不会等于 0 的依赖结构。
联合分布可以推广到随机向量 X = ( X 1 , … , X d ) T \mathbf X=(X_1,\dots,X_d)^\mathsf T X = ( X 1 , … , X d ) T 。每个观测不再是一个数,而是 d d d 维空间中的一个点。例如一个请求可由延迟、响应大小和 CPU 时间组成三维随机向量;多元分布同时描述三个分量各自的变化及共同变化。
4.2 边缘分布与条件分布
从联合 PMF 对不关心的变量求和,可以得到边缘 PMF:p X ( x ) = ∑ y p X , Y ( x , y ) p_X(x)=\sum_y p_{X,Y}(x,y) p X ( x ) = ∑ y p X , Y ( x , y ) 。连续情况改为积分:f X ( x ) = ∫ − ∞ ∞ f X , Y ( x , y ) d y f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy f X ( x ) = ∫ − ∞ ∞ f X , Y ( x , y ) d y 。上述操作称为 marginalization,含义是忽略 Y Y Y 的具体值,只保留 X X X 的分布。
观察到 Y = y Y=y Y = y 后,离散条件分布为 p X ∣ Y ( x ∣ y ) = p X , Y ( x , y ) / p Y ( y ) p_{X\mid Y}(x\mid y)=p_{X,Y}(x,y)/p_Y(y) p X ∣ Y ( x ∣ y ) = p X , Y ( x , y ) / p Y ( y ) ,前提是 p Y ( y ) > 0 p_Y(y)>0 p Y ( y ) > 0 。在前述四点例子中,P ( Y = 2 ) = 1 / 4 P(Y=2)=1/4 P ( Y = 2 ) = 1/4 且只有 ( 1 , 2 ) (1,2) ( 1 , 2 ) 符合条件,所以 P ( X = 1 ∣ Y = 2 ) = 1 P(X=1\mid Y=2)=1 P ( X = 1 ∣ Y = 2 ) = 1 ;没有条件信息时 P ( X = 1 ) = 1 / 2 P(X=1)=1/2 P ( X = 1 ) = 1/2 。条件分布量化新增信息如何改变不确定性,也是回归、分类、Bayes 推断与序列模型的共同基础。
知道所有边缘分布仍不足以重建联合分布。两个 Bernoulli( 1 / 2 ) (1/2) ( 1/2 ) 变量可以互相独立,也可以满足 Y = X Y=X Y = X ,还可以满足 Y = 1 − X Y=1-X Y = 1 − X ;三种情况具有相同边缘分布,但联合行为完全不同。随机过程因而必须研究不同时间点的联合分布,而不能只逐点列出分布;更完整的延伸可阅读随机过程 2:联合分布、相关性与依赖结构 。
5. 独立性、协方差与相关性
5.1 独立性是对整个联合分布的要求
离散变量 X X X 与 Y Y Y 独立时,所有可能组合都满足 p X , Y ( x , y ) = p X ( x ) p Y ( y ) p_{X,Y}(x,y)=p_X(x)p_Y(y) p X , Y ( x , y ) = p X ( x ) p Y ( y ) ;连续变量则满足 f X , Y ( x , y ) = f X ( x ) f Y ( y ) f_{X,Y}(x,y)=f_X(x)f_Y(y) f X , Y ( x , y ) = f X ( x ) f Y ( y ) 。等价地,知道 Y Y Y 不会改变 X X X 的条件分布。独立性比”两个变量看起来没有趋势”更强,必须由联合分布或合理的生成机制支持。
若 X X X 与 Y Y Y 独立且相关期望存在,任何合适函数 g , h g,h g , h 都满足 E [ g ( X ) h ( Y ) ] = E [ g ( X ) ] E [ h ( Y ) ] E[g(X)h(Y)]=E[g(X)]E[h(Y)] E [ g ( X ) h ( Y )] = E [ g ( X )] E [ h ( Y )] 。反方向通常不成立:一组特定期望能分解,无法证明整个联合分布都能分解。
5.2 协方差与相关系数
协方差 Cov ( X , Y ) = E [ ( X − E [ X ] ) ( Y − E [ Y ] ) ] = E [ X Y ] − E [ X ] E [ Y ] \operatorname{Cov}(X,Y)=E[(X-E[X])(Y-E[Y])]=E[XY]-E[X]E[Y] Cov ( X , Y ) = E [( X − E [ X ]) ( Y − E [ Y ])] = E [ X Y ] − E [ X ] E [ Y ] 描述线性共同变化。正值表示两个变量倾向同方向偏离各自均值,负值表示反方向偏离,零表示没有线性共同变化。协方差受单位影响;把米换成厘米会把协方差放大 100 倍。
Pearson 相关系数 ρ X , Y = Cov ( X , Y ) / ( σ X σ Y ) \rho_{X,Y}=\operatorname{Cov}(X,Y)/(\sigma_X\sigma_Y) ρ X , Y = Cov ( X , Y ) / ( σ X σ Y ) 消除尺度,并落在 [ − 1 , 1 ] [-1,1] [ − 1 , 1 ] 内,前提是两个标准差都大于 0。ρ \rho ρ 接近 1 或 -1 表示强线性关系,ρ \rho ρ 接近 0 只表示线性关系弱。相关系数不提供因果方向,也可能被极端值、群组混合或非线性关系误导。
零相关不代表独立。令 X X X 在 [ − 1 , 1 ] [-1,1] [ − 1 , 1 ] 上均匀分布,并令 Y = X 2 Y=X^2 Y = X 2 。对称性使 E [ X ] = 0 E[X]=0 E [ X ] = 0 与 E [ X 3 ] = 0 E[X^3]=0 E [ X 3 ] = 0 ,所以 Cov ( X , Y ) = E [ X 3 ] − E [ X ] E [ X 2 ] = 0 \operatorname{Cov}(X,Y)=E[X^3]-E[X]E[X^2]=0 Cov ( X , Y ) = E [ X 3 ] − E [ X ] E [ X 2 ] = 0 ;但 Y Y Y 完全由 X X X 决定,两者显然不独立。独立且二阶矩存在会推出零协方差;只有在多元 Normal 等额外条件成立时,零协方差才足以推出独立。
5.3 协方差矩阵与线性组合
对 d d d 维随机向量 X \mathbf X X ,均值向量记为 μ = E [ X ] \boldsymbol\mu=E[\mathbf X] μ = E [ X ] ,协方差矩阵记为 Σ = E [ ( X − μ ) ( X − μ ) T ] \boldsymbol\Sigma=E[(\mathbf X-\boldsymbol\mu)(\mathbf X-\boldsymbol\mu)^\mathsf T] Σ = E [( X − μ ) ( X − μ ) T ] 。矩阵元素 Σ i j = Cov ( X i , X j ) \Sigma_{ij}=\operatorname{Cov}(X_i,X_j) Σ ij = Cov ( X i , X j ) ;对角线是各分量的方差,非对角线是成对协方差。协方差矩阵必定对称且半正定,因此任意向量 a \mathbf a a 都满足 Var ( a T X ) = a T Σ a ≥ 0 \operatorname{Var}(\mathbf a^\mathsf T\mathbf X)=\mathbf a^\mathsf T\boldsymbol\Sigma\mathbf a\ge0 Var ( a T X ) = a T Σ a ≥ 0 。多元 Normal 分布 N d ( μ , Σ ) N_d(\boldsymbol\mu,\boldsymbol\Sigma) N d ( μ , Σ ) 由均值向量和协方差矩阵决定;在该分布族内,零协方差也会推出对应分量独立。
假设两台服务的每分钟负载分别为 X 1 , X 2 X_1,X_2 X 1 , X 2 ,标准差都是 10。若相关系数为 0.8,两者总负载的方差是 10 2 + 10 2 + 2 ( 0.8 ) ( 10 ) ( 10 ) = 360 10^2+10^2+2(0.8)(10)(10)=360 1 0 2 + 1 0 2 + 2 ( 0.8 ) ( 10 ) ( 10 ) = 360 ,标准差约为 18.97;若两者独立,总负载标准差是 200 ≈ 14.14 \sqrt{200}\approx14.14 200 ≈ 14.14 。单机波动相同,正相关仍会提高总容量的不确定性。资源配置、投资组合与多传感器融合都需要保留协方差矩阵,不能只分别保存每个分量的标准差。
分布描述可能值及其概率,数值摘要压缩分布特征,联合分布则补上多个变量共同出现的规律。完成三层区分后,后续的参数估计、置信区间、大数定律与中心极限定理才有清楚的对象:数据来自哪个分布、未知参数是什么,以及统计量在重复抽样下如何变化。