概率与统计 3介绍了样本均值 Xˉn\bar X_n 与样本方差 S2S^2,但只说明两者的期望值,没有说明它们本身作为随机变量的完整分布。要建立均值的置信区间、比较两组数据的方差是否有差异,都需要知道这些统计量真正的抽样分布。卡方、t 与 F 分布都是从标准正态分布推导出来的三个分布家族,专门用来描述样本方差,以及在方差未知时如何估计均值。

1. 从标准正态到卡方分布

1.1 卡方分布的定义

Z1,,ZkZ_1,\dots,Z_kkk 个独立的标准正态随机变量,则平方和 Q=Z12++Zk2Q=Z_1^2+\cdots+Z_k^2 服从卡方分布(chi-square distribution),记为 Qχk2Q\sim\chi^2_k,其中 kk 称为自由度(degrees of freedom)。卡方分布只取非负值,且形状随自由度改变:自由度小时右偏明显,自由度愈大则愈接近正态分布。卡方分布的期望值为 E[Q]=kE[Q]=k,方差为 Var(Q)=2k\text{Var}(Q)=2k;例如 χ92\chi^2_9 的期望值是 9,方差是 18。

1.2 样本方差的抽样分布

X1,,XnN(μ,σ2)X_1,\dots,X_n\sim N(\mu,\sigma^2) 独立抽样,可以证明 (n1)S2σ2χn12\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1},其中 S2S^2 是系列第三篇定义的无偏样本方差。自由度是 n1n-1 而不是 nn,原因与 S2S^2 本身的定义一致:样本均值 Xˉn\bar X_n 已经用掉数据中的一个自由度,剩下 n1n-1 个独立的离均差信息。这个关系式让 S2S^2 的变异程度可以用卡方分布精确描述,是构建方差置信区间的基础。

2. t 分布:方差未知时估计均值

2.1 t 分布的定义与动机

若总体方差 σ2\sigma^2 已知,Xˉnμσ/n\dfrac{\bar X_n-\mu}{\sigma/\sqrt n} 服从标准正态分布。但实务上 σ2\sigma^2 通常未知,只能用样本方差 S2S^2 代替,这时统计量 XˉnμS/n\dfrac{\bar X_n-\mu}{S/\sqrt n} 不再是标准正态,而是服从自由度 n1n-1t 分布(Student’s t-distribution),记为 tn1t_{n-1}。t 分布可以定义为标准正态除以独立卡方变量的均方根:T=Z/V/kT=Z/\sqrt{V/k},其中 ZN(0,1)Z\sim N(0,1)Vχk2V\sim\chi^2_k

t 分布的形状与正态分布相似,同样以 0 为中心对称,但尾部比正态分布更厚,自由度愈小尾部愈厚,因为用 SS 取代 σ\sigma 额外引入了估计方差的不确定性。当自由度趋近无限大时,t 分布趋近标准正态分布。

2.2 用 t 分布建立均值的置信区间

当样本数不大且 σ2\sigma^2 未知时,均值的 95% 置信区间为 xˉ±t0.025,n1×s/n\bar x\pm t_{0.025,\,n-1}\times s/\sqrt n,其中 t0.025,n1t_{0.025,\,n-1} 是 t 分布的双尾临界值。

假设某次测量 n=10n=10 个样本,样本均值 xˉ=52.3\bar x=52.3,样本标准差 s=4.8s=4.8,查表得 t0.025,92.262t_{0.025,9}\approx2.262。置信区间的误差范围为 2.262×4.8/103.432.262\times4.8/\sqrt{10}\approx3.43,因此 95% 置信区间约为 (48.87,55.73)(48.87,55.73)。自由度较小时 t0.025,9t_{0.025,9} 明显大于正态分布对应的临界值 1.96,这正是 t 分布厚尾特性反映在置信区间上的结果:样本数愈少,对方差的估计愈不确定,置信区间也应该相应加宽。

3. F 分布:比较两个方差

3.1 F 分布的定义

Uχd12U\sim\chi^2_{d_1}Vχd22V\sim\chi^2_{d_2} 且两者独立,则比值 F=U/d1V/d2F=\dfrac{U/d_1}{V/d_2} 服从自由度为 (d1,d2)(d_1,d_2)F 分布,记为 FFd1,d2F\sim F_{d_1,d_2}。F 分布只取非负值,形状由两个自由度共同决定,且与卡方、t 分布一样可以由标准正态推导出来,三者都是同一套”正态抽样理论”下的自然结果。

3.2 比较两组样本的方差

对两组独立的正态样本,各自的无偏方差 S12,S22S_1^2,S_2^2 满足 S12/σ12S22/σ22Fn11,n21\dfrac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F_{n_1-1,n_2-1}。若两个总体方差相等(σ12=σ22\sigma_1^2=\sigma_2^2),此统计量会化简成 S12/S22Fn11,n21S_1^2/S_2^2\sim F_{n_1-1,n_2-1},可以直接用观测到的方差比值判断”两组方差相等”这个假设是否合理。

假设两组样本大小分别为 n1=13n_1=13n2=16n_2=16,样本方差为 S12=15.2S_1^2=15.2S22=8.7S_2^2=8.7,比值为 F=15.2/8.71.747F=15.2/8.7\approx1.747。对应自由度 (12,15)(12,15) 的临界值 F0.05,12,152.475F_{0.05,12,15}\approx2.475。由于观测到的比值 1.747 小于临界值 2.475,这组数据不足以在 5% 显著水平下判定两个总体方差不同。F 分布也是方差分析(ANOVA)比较多组均值时使用的核心分布。

4. 小结:抽样分布连接估计与推断

χ2\chi^2、t 与 F 分布都建立在”独立标准正态变量的组合”之上:卡方分布描述平方和,t 分布描述正态与卡方的比值,F 分布描述两个卡方的比值。三者分别对应统计推断中最常见的三种问题:卡方分布描述单一方差的抽样分布,t 分布让方差未知时仍能估计均值,F 分布让两组方差可以直接比较。这些抽样分布是置信区间与假设检验共用的计算基础。