概率与统计 3介绍了样本均值 Xˉn 与样本方差 S2,但只说明两者的期望值,没有说明它们本身作为随机变量的完整分布。要建立均值的置信区间、比较两组数据的方差是否有差异,都需要知道这些统计量真正的抽样分布。卡方、t 与 F 分布都是从标准正态分布推导出来的三个分布家族,专门用来描述样本方差,以及在方差未知时如何估计均值。
1. 从标准正态到卡方分布
1.1 卡方分布的定义
若 Z1,…,Zk 是 k 个独立的标准正态随机变量,则平方和 Q=Z12+⋯+Zk2 服从卡方分布(chi-square distribution),记为 Q∼χk2,其中 k 称为自由度(degrees of freedom)。卡方分布只取非负值,且形状随自由度改变:自由度小时右偏明显,自由度愈大则愈接近正态分布。卡方分布的期望值为 E[Q]=k,方差为 Var(Q)=2k;例如 χ92 的期望值是 9,方差是 18。
1.2 样本方差的抽样分布
对 X1,…,Xn∼N(μ,σ2) 独立抽样,可以证明 σ2(n−1)S2∼χn−12,其中 S2 是系列第三篇定义的无偏样本方差。自由度是 n−1 而不是 n,原因与 S2 本身的定义一致:样本均值 Xˉn 已经用掉数据中的一个自由度,剩下 n−1 个独立的离均差信息。这个关系式让 S2 的变异程度可以用卡方分布精确描述,是构建方差置信区间的基础。
2. t 分布:方差未知时估计均值
2.1 t 分布的定义与动机
若总体方差 σ2 已知,σ/nXˉn−μ 服从标准正态分布。但实务上 σ2 通常未知,只能用样本方差 S2 代替,这时统计量 S/nXˉn−μ 不再是标准正态,而是服从自由度 n−1 的 t 分布(Student’s t-distribution),记为 tn−1。t 分布可以定义为标准正态除以独立卡方变量的均方根:T=Z/V/k,其中 Z∼N(0,1)、V∼χk2。
t 分布的形状与正态分布相似,同样以 0 为中心对称,但尾部比正态分布更厚,自由度愈小尾部愈厚,因为用 S 取代 σ 额外引入了估计方差的不确定性。当自由度趋近无限大时,t 分布趋近标准正态分布。
2.2 用 t 分布建立均值的置信区间
当样本数不大且 σ2 未知时,均值的 95% 置信区间为 xˉ±t0.025,n−1×s/n,其中 t0.025,n−1 是 t 分布的双尾临界值。
假设某次测量 n=10 个样本,样本均值 xˉ=52.3,样本标准差 s=4.8,查表得 t0.025,9≈2.262。置信区间的误差范围为 2.262×4.8/10≈3.43,因此 95% 置信区间约为 (48.87,55.73)。自由度较小时 t0.025,9 明显大于正态分布对应的临界值 1.96,这正是 t 分布厚尾特性反映在置信区间上的结果:样本数愈少,对方差的估计愈不确定,置信区间也应该相应加宽。
3. F 分布:比较两个方差
3.1 F 分布的定义
若 U∼χd12、V∼χd22 且两者独立,则比值 F=V/d2U/d1 服从自由度为 (d1,d2) 的 F 分布,记为 F∼Fd1,d2。F 分布只取非负值,形状由两个自由度共同决定,且与卡方、t 分布一样可以由标准正态推导出来,三者都是同一套”正态抽样理论”下的自然结果。
3.2 比较两组样本的方差
对两组独立的正态样本,各自的无偏方差 S12,S22 满足 S22/σ22S12/σ12∼Fn1−1,n2−1。若两个总体方差相等(σ12=σ22),此统计量会化简成 S12/S22∼Fn1−1,n2−1,可以直接用观测到的方差比值判断”两组方差相等”这个假设是否合理。
假设两组样本大小分别为 n1=13、n2=16,样本方差为 S12=15.2、S22=8.7,比值为 F=15.2/8.7≈1.747。对应自由度 (12,15) 的临界值 F0.05,12,15≈2.475。由于观测到的比值 1.747 小于临界值 2.475,这组数据不足以在 5% 显著水平下判定两个总体方差不同。F 分布也是方差分析(ANOVA)比较多组均值时使用的核心分布。
4. 小结:抽样分布连接估计与推断
χ2、t 与 F 分布都建立在”独立标准正态变量的组合”之上:卡方分布描述平方和,t 分布描述正态与卡方的比值,F 分布描述两个卡方的比值。三者分别对应统计推断中最常见的三种问题:卡方分布描述单一方差的抽样分布,t 分布让方差未知时仍能估计均值,F 分布让两组方差可以直接比较。这些抽样分布是置信区间与假设检验共用的计算基础。