系列第一篇建立了概率空间、条件概率与随机变量,系列第二篇介绍常见分布、数值摘要、联合分布与相关性。前两篇从概率模型出发,假定分布或参数已知;统计推断面对相反方向的问题:研究者只看得到有限数据,却想知道产生数据的总体分布和未知参数。

本文以一组实际数值贯穿计算,区分统计量、估计量与估计值,介绍矩估计和最大似然估计,并说明偏差、方差、均方误差与一致性。最后从 Markov 与 Chebyshev 不等式推导样本均值为何稳定,再解释大数定律、中心极限定理和标准误各自回答什么问题。

1. 从总体到随机样本

1.1 总体、样本与观测值

总体(population)是研究问题关心的全部个体或生成机制,例如某条产线制造的全部零件、服务未来会收到的全部请求,或某个随机变量的完整分布。总体均值 μ\mu、总体方差 σ2\sigma^2 和 Bernoulli 成功概率 pp 都是参数(parameter);参数描述总体,通常未知且固定。

研究者从总体取得 nn 个观测。观测之前,X1,…,XnX_1,\ldots,X_n 是随机变量;观测之后,x1,…,xnx_1,\ldots,x_n 是已经得到的数值。大写与小写的区分很重要:Xˉ\bar X 在重复抽样时会改变,因此具有抽样分布;某次数据算出的 xˉ=3\bar x=3 只是单一数值。

最常用的理论模型是独立同分布(independent and identically distributed, IID)随机样本:每个 XiX_i 服从相同分布,而且不同观测彼此独立。IID 不是数据自动具备的性质。连续测量的网络延迟可能具有时间相依性,同一用户产生的多笔记录可能聚集,便利抽样也可能无法代表总体。抽样机制违反独立性或代表性时,增加数据笔数不会自动消除系统性偏差。

1.2 统计量、估计量与估计值

统计量(statistic)是样本的函数,而且公式不能含有未知参数。样本均值 Xˉ=n−1∑i=1nXi\bar X=n^{-1}\sum_{i=1}^nX_i、样本最大值 max⁡iXi\max_iX_i 和经验分布函数都属于统计量。Xˉ−μ\bar X-\mu 含有未知的 μ\mu,因此不是可以直接由数据算出的统计量。

统计量若用来推测未知参数,就称为估计量(estimator)。例如 μ^=Xˉ\hat\mu=\bar X 是总体均值的估计量。把实际数据代入估计量后得到的数值称为估计值(estimate);若五笔观测为 1,2,2,4,61,2,2,4,6,则 μ^=3\hat\mu=3。同一条估计公式在抽样前是随机变量,在抽样后产生确定结果。

2. 从样本计算常用统计量

2.1 中心位置、比例、矩与方差

考虑五天的故障次数 x=(1,2,2,4,6)x=(1,2,2,4,6)。样本均值为 xˉ=(1+2+2+4+6)/5=3\bar x=(1+2+2+4+6)/5=3,样本中位数为 2。中位数只取决于排序后的中间位置,均值则会受到每个数值影响;故障次数 6 若改成 60,中位数仍为 2,均值会从 3 增加到 13.8。

二元数据常用样本比例。十件产品的检测结果若为 0,1,0,0,1,0,0,0,1,00,1,0,0,1,0,0,0,1,0,其中 1 表示不合格,则不合格数 K=3K=3,样本比例 p^=K/n=0.3\hat p=K/n=0.3。因为二元数值的均值也等于 1 的比例,所以 Bernoulli 样本同时满足 xˉ=p^\bar x=\hat p。

第 kk 阶样本原点矩是 mk′=n−1∑ixikm'_k=n^{-1}\sum_i x_i^k。故障数据的第一阶原点矩 m1′=3m'_1=3,第二阶原点矩 m2′=(12+22+22+42+62)/5=12.2m'_2=(1^2+2^2+2^2+4^2+6^2)/5=12.2。第 kk 阶样本中心矩是 mk=n−1∑i(xi−xˉ)km_k=n^{-1}\sum_i(x_i-\bar x)^k;第二阶中心矩为 m2=[(−2)2+(−1)2+(−1)2+12+32]/5=3.2m_2=[(-2)^2+(-1)^2+(-1)^2+1^2+3^2]/5=3.2。

分母为 nn 的 m2m_2 描述目前五笔数据的平均平方离差,也会出现在正态分布的最大似然估计中。若目标是无偏估计总体方差,通常使用 s2=(n−1)−1∑i(xi−xˉ)2=16/4=4s^2=(n-1)^{-1}\sum_i(x_i-\bar x)^2=16/4=4。分母 nn 与 n−1n-1 对应不同目的,不能只凭习惯互换。样本标准差为 s=2s=2,单位与原始故障次数相同。

2.2 经验分布、分位数与协方差

经验累积分布函数(empirical CDF)定义为 Fn(t)=n−1∑i1(xi≤t)F_n(t)=n^{-1}\sum_i\mathbf 1(x_i\le t),也就是样本中不大于 tt 的比例。故障数据满足 Fn(2)=3/5=0.6F_n(2)=3/5=0.6、Fn(4)=4/5=0.8F_n(4)=4/5=0.8。经验 CDF 保留整组一维数据的分布信息,不必先假设正态、Poisson 或其他参数分布。

若采用经验分位数定义 qp=inf⁡{t:Fn(t)≥p}q_p=\inf\{t:F_n(t)\ge p\},故障数据的 q0.25=2q_{0.25}=2、q0.5=2q_{0.5}=2、q0.9=6q_{0.9}=6。不同软件可能对相邻次序统计量插值,因此小样本的分位数结果可能略有差异。报告分位数时应注明所用定义或软件默认,不能把不同插值规则的差异误认为计算错误。

成对数据需要描述共同变化。假设四次实验的输入量为 x=(1,2,3,4)x=(1,2,3,4),输出量为 y=(2,3,5,8)y=(2,3,5,8),两组均值分别为 xˉ=2.5\bar x=2.5 与 yˉ=4.5\bar y=4.5。样本协方差为 sxy=(n−1)−1∑i(xi−xˉ)(yi−yˉ)=10/3≈3.33s_{xy}=(n-1)^{-1}\sum_i(x_i-\bar x)(y_i-\bar y)=10/3\approx3.33。正号表示较大的输入量通常伴随较大的输出量,但协方差的大小会随测量单位改变。

将协方差标准化可得样本相关系数 r=sxy/(sxsy)=10/105≈0.976r=s_{xy}/(s_xs_y)=10/\sqrt{105}\approx0.976。相关系数接近 1 表示数据具有强烈的正线性关系,却不能单独证明输入量造成输出量增加;共同原因、选样方式与非线性关系都需要另外分析。联合分布、边际分布与相关性的模型层面定义可回到系列第二篇查阅。

3. 用矩估计与最大似然估计参数

3.1 矩估计把理论矩对准样本矩

矩估计法(method of moments)先写出分布矩与参数的关系,再令理论矩等于对应的样本矩。若 X∼Bernoulli⁡(p)X\sim\operatorname{Bernoulli}(p),则 E[X]=pE[X]=p;令 E[X]=XˉE[X]=\bar X 可得 p^MM=Xˉ\hat p_{\mathrm{MM}}=\bar X。前述十件产品有三件不合格,因此矩估计值为 0.3。Poisson 分布满足 E[X]=λE[X]=\lambda,所以 Poisson 率参数也可用 λ^MM=Xˉ\hat\lambda_{\mathrm{MM}}=\bar X 估计。

若 X∼N(μ,σ2)X\sim N(\mu,\sigma^2),前两个原点矩满足 E[X]=μE[X]=\mu 与 E[X2]=μ2+σ2E[X^2]=\mu^2+\sigma^2。令理论矩分别等于 m1′m'_1 与 m2′m'_2,可得 μ^MM=Xˉ\hat\mu_{\mathrm{MM}}=\bar X 与 σ^MM2=m2′−Xˉ2=n−1∑i(Xi−Xˉ)2\hat\sigma^2_{\mathrm{MM}}=m'_2-\bar X^2=n^{-1}\sum_i(X_i-\bar X)^2。故障数据产生 μ^=3\hat\mu=3 与 σ^2=12.2−32=3.2\hat\sigma^2=12.2-3^2=3.2。

矩估计通常容易计算,也适合提供数值优化的初始值,但矩估计不一定充分利用分布信息。高阶样本矩也容易受到极端值影响。选择哪些矩、估计结果是否落在合法参数范围内,都需要按模型检查。

3.2 最大似然选择最能解释数据的参数

给定观测 x1,…,xnx_1,\ldots,x_n,似然函数(likelihood)把联合 PMF 或 PDF 视为参数 θ\theta 的函数,记为 L(θ;x)=∏if(xi;θ)L(\theta;x)=\prod_i f(x_i;\theta)。数据已经固定,最大似然估计(maximum likelihood estimation, MLE)寻找使 L(θ;x)L(\theta;x) 最大的参数值。似然不是”参数为真的概率”;在频率学派模型中,参数不是随机变量,L(θ1;x)/L(θ2;x)L(\theta_1;x)/L(\theta_2;x) 只比较同一笔数据对两个参数值的相对支持。

对 Bernoulli 样本,若 nn 次试验中有 kk 次成功,似然为 L(p)=pk(1−p)n−kL(p)=p^k(1-p)^{n-k}。乘积常改写成对数似然 ℓ(p)=klog⁡p+(n−k)log⁡(1−p)\ell(p)=k\log p+(n-k)\log(1-p),因为对数不改变最大值位置,并把乘积变成较容易处理的求和。令导数 ℓ′(p)=k/p−(n−k)/(1−p)\ell'(p)=k/p-(n-k)/(1-p) 等于 0,可得 p^MLE=k/n\hat p_{\mathrm{MLE}}=k/n。十件产品中的三件不合格仍得到 p^=0.3\hat p=0.3。

对 IID 正态样本,对数似然为 ℓ(μ,σ2)=−n2log⁡(2πσ2)−12σ2∑i(xi−μ)2\ell(\mu,\sigma^2)=-\frac n2\log(2\pi\sigma^2)-\frac{1}{2\sigma^2}\sum_i(x_i-\mu)^2。分别对 μ\mu 与 σ2\sigma^2 求最大值,可得 μ^MLE=xˉ\hat\mu_{\mathrm{MLE}}=\bar x 与 σ^MLE2=n−1∑i(xi−xˉ)2\hat\sigma^2_{\mathrm{MLE}}=n^{-1}\sum_i(x_i-\bar x)^2。故障数据的正态 MLE 是 μ^=3\hat\mu=3、σ^2=3.2\hat\sigma^2=3.2。正态方差 MLE 使用分母 nn,即使分母 n−1n-1 的样本方差才是无偏估计;最大似然与无偏是两套不同准则。

MLE 的答案依赖完整模型。若观测彼此相依、截尾机制被忽略,或错把计数数据当成正态数据,形式正确的微分仍可能产生没有意义的估计。开始优化之前,应先写清楚每笔观测的分布、参数范围与联合似然如何分解。

4. 判断估计量是否可靠

4.1 偏差、方差与均方误差

估计量需要在”重复抽取同样大小的样本”下评估。估计 θ\theta 的偏差定义为 Bias⁡(θ^)=E[θ^]−θ\operatorname{Bias}(\hat\theta)=E[\hat\theta]-\theta;期望等于参数时,估计量称为无偏(unbiased)。对 IID 样本,E[Xˉ]=μE[\bar X]=\mu,所以样本均值无偏;Bernoulli 样本比例 p^=Xˉ\hat p=\bar X 也无偏。

分母为 nn 的样本方差 S~2=n−1∑i(Xi−Xˉ)2\tilde S^2=n^{-1}\sum_i(X_i-\bar X)^2 满足 E[S~2]=(n−1)σ2/nE[\tilde S^2]=(n-1)\sigma^2/n,会系统性低估总体方差。原因是同一批数据先估计了 Xˉ\bar X,离差因此受到一个线性限制,只剩 n−1n-1 个自由度。乘上 n/(n−1)n/(n-1) 得到 S2=(n−1)−1∑i(Xi−Xˉ)2S^2=(n-1)^{-1}\sum_i(X_i-\bar X)^2,并满足 E[S2]=σ2E[S^2]=\sigma^2。

无偏不等于估计结果一定靠近真值。估计量的均方误差为 MSE⁡(θ^)=E[(θ^−θ)2]=Var⁡(θ^)+Bias⁡(θ^)2\operatorname{MSE}(\hat\theta)=E[(\hat\theta-\theta)^2]=\operatorname{Var}(\hat\theta)+\operatorname{Bias}(\hat\theta)^2。MSE 同时惩罚抽样波动和系统性偏移,因此一个偏差很小但方差很大的估计量,可能比带有少量偏差的稳定估计量更差。小样本 Bernoulli 问题有时使用 Laplace 平滑 p~=(K+1)/(n+2)\tilde p=(K+1)/(n+2);该估计量通常有偏,却能避免 K=0K=0 或 K=nK=n 时直接估出 0 或 1,并可能降低极端参数区域以外的 MSE。

4.2 一致性与标准误

若样本量增加时 θ^n\hat\theta_n 依概率收敛到 θ\theta,估计量称为一致(consistent),也就是对每个 ε>0\varepsilon>0 都有 P(∣θ^n−θ∣>ε)→0P(|\hat\theta_n-\theta|>\varepsilon)\to0。一致性描述大样本极限,不保证某个有限样本准确;无偏性描述每个固定样本量的抽样均值,也不保证方差很小。两个性质回答不同问题。

估计量抽样分布的标准差称为标准误(standard error, SE)。若 IID 样本的总体方差为 σ2\sigma^2,则 Var⁡(Xˉ)=σ2/n\operatorname{Var}(\bar X)=\sigma^2/n,所以 SE⁡(Xˉ)=σ/n\operatorname{SE}(\bar X)=\sigma/\sqrt n;未知的 σ\sigma 通常以 ss 代替,得到估计标准误 s/ns/\sqrt n。样本标准差 ss 描述个别观测的离散程度,标准误 s/ns/\sqrt n 描述样本均值的抽样波动,两个数值不能互换。

5. 从概率不等式到极限定理

5.1 Markov 与 Chebyshev 不等式

若随机变量 Y≥0Y\ge0 且 E[Y]<∞E[Y]<\infty,Markov 不等式给出 P(Y≥a)≤E[Y]/aP(Y\ge a)\le E[Y]/a,其中 a>0a>0。若请求延迟非负且均值为 100 ms,Markov 不等式只能保证 P(Y≥500 ms)≤0.2P(Y\ge500\text{ ms})\le0.2。界限可能很宽,但结论不需要知道延迟的完整分布。

将 Markov 不等式套用到非负变量 (X−μ)2(X-\mu)^2,可以得到 Chebyshev 不等式:P(∣X−μ∣≥a)≤σ2/a2P(|X-\mu|\ge a)\le\sigma^2/a^2。若改用标准差倍数 a=kσa=k\sigma,公式成为 P(∣X−μ∣≥kσ)≤1/k2P(|X-\mu|\ge k\sigma)\le1/k^2。例如任何具有有限方差的分布都满足 P(∣X−μ∣≥2σ)≤1/4P(|X-\mu|\ge2\sigma)\le1/4;Chebyshev 不等式没有假设正态分布,因此不能擅自替换成正态分布的 95% 经验法则。

5.2 弱大数定律、强大数定律与中心极限定理

对均值为 μ\mu、方差为 σ2<∞\sigma^2<\infty 的 IID 样本,样本均值满足 E[Xˉn]=μE[\bar X_n]=\mu 与 Var⁡(Xˉn)=σ2/n\operatorname{Var}(\bar X_n)=\sigma^2/n。把 Chebyshev 不等式套用到 Xˉn\bar X_n 可得 P(∣Xˉn−μ∣≥ε)≤σ2/(nε2)P(|\bar X_n-\mu|\ge\varepsilon)\le\sigma^2/(n\varepsilon^2)。右侧随 nn 增加而趋近 0,因此 Xˉn\bar X_n 依概率收敛到 μ\mu。该推导给出有限方差条件下的弱大数定律(weak law of large numbers)。

强大数定律(strong law of large numbers)叙述更强的样本路径性质:在适当条件下,P(lim⁡n→∞Xˉn=μ)=1P(\lim_{n\to\infty}\bar X_n=\mu)=1。弱大数定律表示固定的大样本量下,偏离 μ\mu 的概率趋近 0;强大数定律表示除了概率为 0 的样本路径集合,沿着同一条无限抽样序列计算的均值会收敛。几乎必然收敛不代表每一条可想象的序列都收敛,也不代表任何有限样本均值恰好等于 μ\mu。

大数定律回答估计量是否趋近目标,却没有描述剩余误差的形状。若 IID 样本具有有限均值 μ\mu 与正的有限方差 σ2\sigma^2,经典中心极限定理(central limit theorem, CLT)给出 n(Xˉn−μ)/σ⇒N(0,1)\sqrt n(\bar X_n-\mu)/\sigma\Rightarrow N(0,1)。因此大样本下可以近似写成 Xˉn∼N(μ,σ2/n)\bar X_n\sim N(\mu,\sigma^2/n),而典型误差尺度为 1/n1/\sqrt n。样本量增加四倍,标准误约缩小一半;样本量增加一百倍,标准误约缩小为原来的十分之一。

以 n=400n=400 的 Bernoulli 样本为例,若观察到 p^=0.30\hat p=0.30,代入估计标准误可得 SE⁡^(p^)=0.3×0.7/400≈0.0229\widehat{\operatorname{SE}}(\hat p)=\sqrt{0.3\times0.7/400}\approx0.0229。正态近似下,约 95% 的误差范围是 1.96×0.0229≈0.04491.96\times0.0229\approx0.0449,对应区间约为 [0.255,0.345][0.255,0.345]。该区间是根据抽样分布得到的近似结果;极小样本、非常稀少的成功事件、强相依数据或无限方差分布都可能使正态近似失准。

中心极限定理也不表示原始数据分布会变成正态分布。趋近正态的是经过中心化与缩放的样本和或样本均值。大数定律关心 Xˉn\bar X_n 的位置是否稳定,中心极限定理关心 Xˉn−μ\bar X_n-\mu 的波动尺度与近似形状。若要把两个极限定理延伸到部分和、随机游走与布朗运动,可以继续阅读随机过程 4:大数定律与中心极限定理。

统计推断的完整链条可以概括为:抽样设计决定数据是否具有代表性,统计量把数据压缩成可解释的数值,估计法把统计量连到未知参数,偏差与 MSE 评估有限样本质量,而大数定律与中心极限定理解释估计量在样本增加时如何稳定及波动。每一步都依赖明确的模型条件;公式本身无法补救错误的抽样方式或不合适的概率模型。