機率與統計 3介紹了樣本平均 Xˉn\bar X_n 與樣本變異數 S2S^2,但只說明兩者的期望值,沒有說明它們本身作為隨機變數的完整分佈。要建立平均值的信賴區間、比較兩組資料的變異數是否有差異,都需要知道這些統計量真正的抽樣分佈。卡方、t 與 F 分佈都是從標準常態分佈推導出來的三個分佈家族,專門用來描述樣本變異數,以及在變異數未知時如何估計平均值。

1. 從標準常態到卡方分佈

1.1 卡方分佈的定義

Z1,,ZkZ_1,\dots,Z_kkk 個獨立的標準常態隨機變數,則平方和 Q=Z12++Zk2Q=Z_1^2+\cdots+Z_k^2 服從卡方分佈(chi-square distribution),記為 Qχk2Q\sim\chi^2_k,其中 kk 稱為自由度(degrees of freedom)。卡方分佈只取非負值,且形狀隨自由度改變:自由度小時右偏明顯,自由度愈大則愈接近常態分佈。卡方分佈的期望值為 E[Q]=kE[Q]=k,變異數為 Var(Q)=2k\text{Var}(Q)=2k;例如 χ92\chi^2_9 的期望值是 9,變異數是 18。

1.2 樣本變異數的抽樣分佈

X1,,XnN(μ,σ2)X_1,\dots,X_n\sim N(\mu,\sigma^2) 獨立抽樣,可以證明 (n1)S2σ2χn12\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1},其中 S2S^2 是系列第三篇定義的不偏樣本變異數。自由度是 n1n-1 而不是 nn,原因與 S2S^2 本身的定義一致:樣本平均 Xˉn\bar X_n 已經用掉資料中的一個自由度,剩下 n1n-1 個獨立的離均差資訊。這個關係式讓 S2S^2 的變異程度可以用卡方分佈精確描述,是建構變異數信賴區間的基礎。

2. t 分佈:變異數未知時估計平均值

2.1 t 分佈的定義與動機

若母體變異數 σ2\sigma^2 已知,Xˉnμσ/n\dfrac{\bar X_n-\mu}{\sigma/\sqrt n} 服從標準常態分佈。但實務上 σ2\sigma^2 通常未知,只能用樣本變異數 S2S^2 代替,這時統計量 XˉnμS/n\dfrac{\bar X_n-\mu}{S/\sqrt n} 不再是標準常態,而是服從自由度 n1n-1t 分佈(Student’s t-distribution),記為 tn1t_{n-1}。t 分佈可以定義為標準常態除以獨立卡方變數的均方根:T=Z/V/kT=Z/\sqrt{V/k},其中 ZN(0,1)Z\sim N(0,1)Vχk2V\sim\chi^2_k

t 分佈的形狀與常態分佈相似,同樣以 0 為中心對稱,但尾部比常態分佈更厚,自由度愈小尾部愈厚,因為用 SS 取代 σ\sigma 額外引入了估計變異數的不確定性。當自由度趨近無限大時,t 分佈趨近標準常態分佈。

2.2 用 t 分佈建立平均值的信賴區間

當樣本數不大且 σ2\sigma^2 未知時,平均值的 95% 信賴區間為 xˉ±t0.025,n1×s/n\bar x\pm t_{0.025,\,n-1}\times s/\sqrt n,其中 t0.025,n1t_{0.025,\,n-1} 是 t 分佈的雙尾臨界值。

假設某次量測 n=10n=10 個樣本,樣本平均 xˉ=52.3\bar x=52.3,樣本標準差 s=4.8s=4.8,查表得 t0.025,92.262t_{0.025,9}\approx2.262。信賴區間的誤差範圍為 2.262×4.8/103.432.262\times4.8/\sqrt{10}\approx3.43,因此 95% 信賴區間約為 (48.87,55.73)(48.87,55.73)。自由度較小時 t0.025,9t_{0.025,9} 明顯大於常態分佈對應的臨界值 1.96,這正是 t 分佈厚尾特性反映在信賴區間上的結果:樣本數愈少,對變異數的估計愈不確定,信賴區間也應該相應加寬。

3. F 分佈:比較兩個變異數

3.1 F 分佈的定義

Uχd12U\sim\chi^2_{d_1}Vχd22V\sim\chi^2_{d_2} 且兩者獨立,則比值 F=U/d1V/d2F=\dfrac{U/d_1}{V/d_2} 服從自由度為 (d1,d2)(d_1,d_2)F 分佈,記為 FFd1,d2F\sim F_{d_1,d_2}。F 分佈只取非負值,形狀由兩個自由度共同決定,且與卡方、t 分佈一樣可以由標準常態推導出來,三者都是同一套「常態抽樣理論」下的自然結果。

3.2 比較兩組樣本的變異數

對兩組獨立的常態樣本,各自的不偏變異數 S12,S22S_1^2,S_2^2 滿足 S12/σ12S22/σ22Fn11,n21\dfrac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F_{n_1-1,n_2-1}。若兩個母體變異數相等(σ12=σ22\sigma_1^2=\sigma_2^2),此統計量會化簡成 S12/S22Fn11,n21S_1^2/S_2^2\sim F_{n_1-1,n_2-1},可以直接用觀測到的變異數比值判斷「兩組變異數相等」這個假設是否合理。

假設兩組樣本大小分別為 n1=13n_1=13n2=16n_2=16,樣本變異數為 S12=15.2S_1^2=15.2S22=8.7S_2^2=8.7,比值為 F=15.2/8.71.747F=15.2/8.7\approx1.747。對應自由度 (12,15)(12,15) 的臨界值 F0.05,12,152.475F_{0.05,12,15}\approx2.475。由於觀測到的比值 1.747 小於臨界值 2.475,這組資料不足以在 5% 顯著水準下判定兩個母體變異數不同。F 分佈也是變異數分析(ANOVA)比較多組平均值時使用的核心分佈。

4. 小結:抽樣分佈連接估計與推論

χ2\chi^2、t 與 F 分佈都建立在「獨立標準常態變數的組合」之上:卡方分佈描述平方和,t 分佈描述常態與卡方的比值,F 分佈描述兩個卡方的比值。三者分別對應統計推論中最常見的三種問題:卡方分佈描述單一變異數的抽樣分佈,t 分佈讓變異數未知時仍能估計平均值,F 分佈讓兩組變異數可以直接比較。這些抽樣分佈是信賴區間與假設檢定共用的計算基礎。