随机变量把试验结果转成数值,分布则说明各个数值出现的概率。只记住分布名称和公式不够:建模时还要知道参数代表什么、数据是否符合模型假设,以及均值与方差遗漏了哪些信息。

本文先建立描述单一分布的数值工具,再比较常见离散与连续分布,最后把一个随机变量推广到随机向量。本文会在使用 PMF、PDF 与 CDF 时交代所需定义,因此不要求读者先完成系列其他文章。

1. 用分布与数值摘要描述随机变量

1.1 PMF、PDF 与 CDF 回答不同问题

离散随机变量 XX 使用概率质量函数(PMF)pX(x)=P(X=x)p_X(x)=P(X=x),所有可能值的概率必须满足 pX(x)0p_X(x)\ge 0xpX(x)=1\sum_x p_X(x)=1。连续随机变量使用概率密度函数(PDF)fX(x)f_X(x),区间概率是 P(aXb)=abfX(x)dxP(a\le X\le b)=\int_a^b f_X(x)\,dx。密度本身不是概率;连续变量通常满足 P(X=x)=0P(X=x)=0,真正有意义的是一段区间下方的面积。

累积分布函数(CDF)FX(x)=P(Xx)F_X(x)=P(X\le x) 同时适用于离散与连续变量。CDF 可以直接计算区间与尾端概率,例如 P(X>x)=1FX(x)P(X>x)=1-F_X(x);若 XX 为连续变量,则 P(a<Xb)=FX(b)FX(a)P(a<X\le b)=F_X(b)-F_X(a)。比较两个模型时,先确认使用的是单点概率、密度还是累积概率,能避免把 PDF 高度误当成事件概率。

1.2 期望值、方差与矩

期望值描述分布的重心。离散情况为 E[X]=xxpX(x)E[X]=\sum_x xp_X(x),连续情况为 E[X]=xfX(x)dxE[X]=\int_{-\infty}^{\infty}xf_X(x)\,dx。期望值不一定是可能观测到的值:公平六面骰子的期望值是 3.53.5,但任何一次掷骰都不会出现 3.53.5。期望值也不保证存在;尾端衰减过慢的分布可能使积分发散。

方差 Var(X)=E[(Xμ)2]=E[X2]μ2\operatorname{Var}(X)=E[(X-\mu)^2]=E[X^2]-\mu^2 衡量观测值相对均值 μ=E[X]\mu=E[X] 的平方偏差。标准差 σ=Var(X)\sigma=\sqrt{\operatorname{Var}(X)}XX 具有相同单位,因此比方差容易解读。若服务器延迟的均值是 100 ms、标准差是 10 ms,标准差直接以毫秒描述波动;方差的单位则是平方毫秒。

kk 阶原始矩是 E[Xk]E[X^k]kk 阶中心矩是 E[(Xμ)k]E[(X-\mu)^k]。一阶原始矩就是均值,二阶中心矩就是方差;标准化三阶中心矩形成偏度,用来描述左右不对称;标准化四阶中心矩与峰度相关,用来描述尾端与集中程度。有限个矩通常不能完整决定分布,而且某些分布没有高阶矩,所以矩是摘要,不是分布本身。

1.3 中位数、分位数与尾端风险

中位数是 0.5 分位数。更一般地,可以把 pp 分位数定义为 qp=inf{x:FX(x)p}q_p=\inf\{x:F_X(x)\ge p\};第 25、50、75 百分位数分别描述分布的四分位位置。四分位距 IQR=q0.75q0.25IQR=q_{0.75}-q_{0.25} 对极端值较不敏感,适合描述偏斜或含离群值的数据。

均值与中位数的差异能揭示偏斜。九次延迟都是 20 ms、一次延迟是 1020 ms 时,均值为 120 ms,中位数仍是 20 ms。均值反映极端延迟造成的总成本,中位数反映典型请求;两个数值回答不同问题。服务可靠性通常还要报告 p95p_{95}p99p_{99} 或超过阈值的尾端概率 P(X>c)P(X>c),因为相同均值与标准差的分布仍可能具有截然不同的尾端。

2. 常见离散分布

2.1 Bernoulli、Binomial 与 Geometric

Bernoulli 分布描述一次只有成功或失败的试验。若 X{0,1}X\in\{0,1\} 且成功概率为 pp,写成 XBernoulli(p)X\sim\operatorname{Bernoulli}(p);其期望值为 pp,方差为 p(1p)p(1-p)。参数 pp 必须在每次指定的试验中具有明确含义,例如”一个请求在 200 ms 内完成”的概率,而不是没有时间范围或服务范围的抽象成功率。

Binomial 分布描述 nn 次独立、成功率相同的 Bernoulli 试验中成功的总次数。若 XBinomial(n,p)X\sim\operatorname{Binomial}(n,p),则 P(X=k)=(nk)pk(1p)nkP(X=k)={n\choose k}p^k(1-p)^{n-k}E[X]=npE[X]=npVar(X)=np(1p)\operatorname{Var}(X)=np(1-p)。假设 20 个独立请求各有 5% 概率失败,失败数 XX 可建模为 Binomial(20,0.05)\operatorname{Binomial}(20,0.05),恰好两次失败的概率是 (202)(0.05)2(0.95)180.189{20\choose2}(0.05)^2(0.95)^{18}\approx0.189。若请求共享同一个故障节点,失败事件可能高度相关,Binomial 的独立假设便不成立。

Geometric 分布描述第一次成功前需要多少次试验。若把成功所在的试验次数记为 T{1,2,}T\in\{1,2,\ldots\},则 P(T=k)=(1p)k1pP(T=k)=(1-p)^{k-1}pE[T]=1/pE[T]=1/p。不同教材也会把失败次数记为从 0 开始的变量;使用公式前必须确认计数起点。Geometric 分布具有离散无记忆性,适合成功率固定且每次试验独立的等待问题。

2.2 Poisson 分布

Poisson 分布描述固定区间内的事件数。若 XPoisson(λ)X\sim\operatorname{Poisson}(\lambda),则 P(X=k)=eλλk/k!P(X=k)=e^{-\lambda}\lambda^k/k!,而且 E[X]=Var(X)=λE[X]=\operatorname{Var}(X)=\lambda。参数 λ\lambda 是指定区间内的平均事件数;若平均每分钟有 3 个请求,十分钟区间的均值在齐次假设下是 30,不能仍把参数填成 3。

Poisson 模型通常假设事件在极短区间内单独发生、互不影响,而且平均速率在研究区间内固定。均值与样本方差差距很大,可能表示数据有过度离散、速率随时间改变或事件聚集。固定区间的 Poisson 分布只描述一个计数变量;若要描述计数如何随时间累积,以及计数与等待时间的关系,可阅读随机过程 9:泊松过程

2.3 Categorical 与 Multinomial

Categorical 分布把 Bernoulli 的两种结果扩充为 KK 个互斥类别,参数为概率向量 (p1,,pK)(p_1,\dots,p_K),其中每个 pi0p_i\ge0 且总和为 1。单次请求的状态可能分为成功、客户端错误与服务器错误,三类概率共同定义一次 Categorical 试验。

Multinomial 分布再把单次 Categorical 试验扩充到 nn 次独立同分布试验,输出每一类的计数 (X1,,XK)(X_1,\dots,X_K),并满足 iXi=n\sum_iX_i=n。各类计数不能彼此独立,因为某一类多一次就会压缩其他类可用的总数。该限制预告了一个重要观念:多维数据的每个分量都可能有简单的边缘分布,但分量之间仍受联合结构约束。

3. 常见连续分布

3.1 Uniform、Exponential 与 Gamma

Uniform 分布 XUniform(a,b)X\sim\operatorname{Uniform}(a,b) 在区间 [a,b][a,b] 内具有固定密度 1/(ba)1/(b-a),期望值为 (a+b)/2(a+b)/2,方差为 (ba)2/12(b-a)^2/12。模型假设每个等长子区间具有相同概率,适合描述有限范围内没有偏好的位置;Uniform 不适合仅因数据落在某个范围内就直接采用,观测机制仍需支持均匀假设。

Exponential 分布 TExponential(λ)T\sim\operatorname{Exponential}(\lambda) 常用来描述 Poisson 过程中的事件间隔,密度为 fT(t)=λeλtf_T(t)=\lambda e^{-\lambda t}t0t\ge0),期望值为 1/λ1/\lambda,方差为 1/λ21/\lambda^2。速率 λ\lambda 越大,平均等待时间越短。Exponential 的无记忆性 P(T>s+tT>s)=P(T>t)P(T>s+t\mid T>s)=P(T>t) 意味着已等待时间不改变剩余等待时间的分布;具有老化、磨损或排队聚集的寿命数据通常不符合该假设。

Gamma 分布可以描述累积多个独立 Exponential 等待时间。采用 shape-rate 参数化 TGamma(α,λ)T\sim\operatorname{Gamma}(\alpha,\lambda) 时,期望值是 α/λ\alpha/\lambda,方差是 α/λ2\alpha/\lambda^2。不同软件可能用 scale θ=1/λ\theta=1/\lambda 代替 rate;看到 Gamma 参数时必须先确认第二个参数是 rate 还是 scale。

3.2 Normal 分布与标准化

Normal 分布 XN(μ,σ2)X\sim N(\mu,\sigma^2) 由位置参数 μ\mu 与尺度参数 σ>0\sigma>0 决定,期望值为 μ\mu,方差为 σ2\sigma^2。标准化 Z=(Xμ)/σZ=(X-\mu)/\sigma 会得到 ZN(0,1)Z\sim N(0,1),因此不同单位的观测值可以转换成距离均值多少个标准差。

若零件长度可近似为 N(100,22)N(100,2^2) mm,规格要求 96 至 104 mm,标准化后的界线是 -2 与 2,因此合格率约为 P(2Z2)0.9545P(-2\le Z\le2)\approx0.9545。计算结果依赖 Normal 假设;分布若偏斜、有厚尾或混合了多个生产批次,仅凭均值与标准差套用 68–95–99.7 规则会低估尾端概率。

Normal 分布常见于许多微小影响相加的测量误差与样本均值,但”数据很多”不会自动让原始数据服从 Normal。中心极限定理通常描述经过中心化与缩放的总和或均值,而不是任意总体的每一笔观测。

3.3 依数据类型选择候选模型

分布名称应由随机机制和支撑集合共同决定。二元结果可先考虑 Bernoulli;固定试验次数内的成功数可考虑 Binomial;固定时间内的稀疏事件数可考虑 Poisson;正值等待时间可比较 Exponential、Gamma 或其他寿命分布;上下界内近似无偏好的位置可考虑 Uniform;多个微小误差相加的实值量可考虑 Normal。

候选模型仍需接受数据检查。研究者可以比较直方图、经验 CDF、分位数与模型分位数,并检查均值和方差是否符合参数限制。模型是带假设的近似;选择分布时,生成机制、支撑集合与尾端行为比曲线外观更重要。

4. 联合、边缘与条件分布

4.1 联合分布保留变量如何共同出现

两个离散随机变量的联合 PMF 是 pX,Y(x,y)=P(X=x,Y=y)p_{X,Y}(x,y)=P(X=x,Y=y);两个连续随机变量则可使用联合密度 fX,Y(x,y)f_{X,Y}(x,y)。联合分布需要对所有可能组合归一化,并且包含单一变量分布与变量依赖关系的完整信息。

考虑一个等概率抽取的数据表:(X,Y)(X,Y) 分别以概率 1/41/4 取值 (0,0),(0,1),(1,1),(1,2)(0,0),(0,1),(1,1),(1,2)XX 的分布只告诉读者 P(X=0)=P(X=1)=1/2P(X=0)=P(X=1)=1/2YY 的分布只告诉读者 P(Y=0)=1/4P(Y=0)=1/4P(Y=1)=1/2P(Y=1)=1/2P(Y=2)=1/4P(Y=2)=1/4。联合 PMF 还保留 X=0X=0YY 不会等于 2,以及 X=1X=1YY 不会等于 0 的依赖结构。

联合分布可以推广到随机向量 X=(X1,,Xd)T\mathbf X=(X_1,\dots,X_d)^\mathsf T。每个观测不再是一个数,而是 dd 维空间中的一个点。例如一个请求可由延迟、响应大小和 CPU 时间组成三维随机向量;多元分布同时描述三个分量各自的变化及共同变化。

4.2 边缘分布与条件分布

从联合 PMF 对不关心的变量求和,可以得到边缘 PMF:pX(x)=ypX,Y(x,y)p_X(x)=\sum_y p_{X,Y}(x,y)。连续情况改为积分:fX(x)=fX,Y(x,y)dyf_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy。上述操作称为 marginalization,含义是忽略 YY 的具体值,只保留 XX 的分布。

观察到 Y=yY=y 后,离散条件分布为 pXY(xy)=pX,Y(x,y)/pY(y)p_{X\mid Y}(x\mid y)=p_{X,Y}(x,y)/p_Y(y),前提是 pY(y)>0p_Y(y)>0。在前述四点例子中,P(Y=2)=1/4P(Y=2)=1/4 且只有 (1,2)(1,2) 符合条件,所以 P(X=1Y=2)=1P(X=1\mid Y=2)=1;没有条件信息时 P(X=1)=1/2P(X=1)=1/2。条件分布量化新增信息如何改变不确定性,也是回归、分类、Bayes 推断与序列模型的共同基础。

知道所有边缘分布仍不足以重建联合分布。两个 Bernoulli(1/2)(1/2) 变量可以互相独立,也可以满足 Y=XY=X,还可以满足 Y=1XY=1-X;三种情况具有相同边缘分布,但联合行为完全不同。随机过程因而必须研究不同时间点的联合分布,而不能只逐点列出分布;更完整的延伸可阅读随机过程 2:联合分布、相关性与依赖结构

5. 独立性、协方差与相关性

5.1 独立性是对整个联合分布的要求

离散变量 XXYY 独立时,所有可能组合都满足 pX,Y(x,y)=pX(x)pY(y)p_{X,Y}(x,y)=p_X(x)p_Y(y);连续变量则满足 fX,Y(x,y)=fX(x)fY(y)f_{X,Y}(x,y)=f_X(x)f_Y(y)。等价地,知道 YY 不会改变 XX 的条件分布。独立性比”两个变量看起来没有趋势”更强,必须由联合分布或合理的生成机制支持。

XXYY 独立且相关期望存在,任何合适函数 g,hg,h 都满足 E[g(X)h(Y)]=E[g(X)]E[h(Y)]E[g(X)h(Y)]=E[g(X)]E[h(Y)]。反方向通常不成立:一组特定期望能分解,无法证明整个联合分布都能分解。

5.2 协方差与相关系数

协方差 Cov(X,Y)=E[(XE[X])(YE[Y])]=E[XY]E[X]E[Y]\operatorname{Cov}(X,Y)=E[(X-E[X])(Y-E[Y])]=E[XY]-E[X]E[Y] 描述线性共同变化。正值表示两个变量倾向同方向偏离各自均值,负值表示反方向偏离,零表示没有线性共同变化。协方差受单位影响;把米换成厘米会把协方差放大 100 倍。

Pearson 相关系数 ρX,Y=Cov(X,Y)/(σXσY)\rho_{X,Y}=\operatorname{Cov}(X,Y)/(\sigma_X\sigma_Y) 消除尺度,并落在 [1,1][-1,1] 内,前提是两个标准差都大于 0。ρ\rho 接近 1 或 -1 表示强线性关系,ρ\rho 接近 0 只表示线性关系弱。相关系数不提供因果方向,也可能被极端值、群组混合或非线性关系误导。

零相关不代表独立。令 XX[1,1][-1,1] 上均匀分布,并令 Y=X2Y=X^2。对称性使 E[X]=0E[X]=0E[X3]=0E[X^3]=0,所以 Cov(X,Y)=E[X3]E[X]E[X2]=0\operatorname{Cov}(X,Y)=E[X^3]-E[X]E[X^2]=0;但 YY 完全由 XX 决定,两者显然不独立。独立且二阶矩存在会推出零协方差;只有在多元 Normal 等额外条件成立时,零协方差才足以推出独立。

5.3 协方差矩阵与线性组合

dd 维随机向量 X\mathbf X,均值向量记为 μ=E[X]\boldsymbol\mu=E[\mathbf X],协方差矩阵记为 Σ=E[(Xμ)(Xμ)T]\boldsymbol\Sigma=E[(\mathbf X-\boldsymbol\mu)(\mathbf X-\boldsymbol\mu)^\mathsf T]。矩阵元素 Σij=Cov(Xi,Xj)\Sigma_{ij}=\operatorname{Cov}(X_i,X_j);对角线是各分量的方差,非对角线是成对协方差。协方差矩阵必定对称且半正定,因此任意向量 a\mathbf a 都满足 Var(aTX)=aTΣa0\operatorname{Var}(\mathbf a^\mathsf T\mathbf X)=\mathbf a^\mathsf T\boldsymbol\Sigma\mathbf a\ge0。多元 Normal 分布 Nd(μ,Σ)N_d(\boldsymbol\mu,\boldsymbol\Sigma) 由均值向量和协方差矩阵决定;在该分布族内,零协方差也会推出对应分量独立。

假设两台服务的每分钟负载分别为 X1,X2X_1,X_2,标准差都是 10。若相关系数为 0.8,两者总负载的方差是 102+102+2(0.8)(10)(10)=36010^2+10^2+2(0.8)(10)(10)=360,标准差约为 18.97;若两者独立,总负载标准差是 20014.14\sqrt{200}\approx14.14。单机波动相同,正相关仍会提高总容量的不确定性。资源配置、投资组合与多传感器融合都需要保留协方差矩阵,不能只分别保存每个分量的标准差。

分布描述可能值及其概率,数值摘要压缩分布特征,联合分布则补上多个变量共同出现的规律。完成三层区分后,后续的参数估计、置信区间、大数定律与中心极限定理才有清楚的对象:数据来自哪个分布、未知参数是什么,以及统计量在重复抽样下如何变化。