系列第一篇建立了機率空間、條件機率與隨機變數,系列第二篇介紹常見分布、數值摘要、聯合分布與相關性。前兩篇從機率模型出發,假定分布或參數已知;統計推斷面對相反方向的問題:研究者只看得到有限資料,卻想知道產生資料的母體分布和未知參數。

本文以一組實際數值貫穿計算,區分統計量、估計量與估計值,介紹矩估計和最大概似估計,並說明偏差、變異數、均方誤差與一致性。最後從 Markov 與 Chebyshev 不等式推導樣本平均為何穩定,再解釋大數定律、中心極限定理和標準誤各自回答什麼問題。

1. 從母體到隨機樣本

1.1 母體、樣本與觀測值

母體(population)是研究問題關心的全部個體或生成機制,例如某條產線製造的全部零件、服務未來會收到的全部請求,或某個隨機變數的完整分布。母體平均數 μ\mu、母體變異數 σ2\sigma^2 和 Bernoulli 成功機率 pp 都是參數(parameter);參數描述母體,通常未知且固定。

研究者從母體取得 nn 個觀測。觀測之前,X1,,XnX_1,\ldots,X_n 是隨機變數;觀測之後,x1,,xnx_1,\ldots,x_n 是已經得到的數值。大寫與小寫的區分很重要:Xˉ\bar X 在重複抽樣時會改變,因此具有抽樣分布;某次資料算出的 xˉ=3\bar x=3 只是單一數值。

最常用的理論模型是獨立同分布(independent and identically distributed, IID)隨機樣本:每個 XiX_i 服從相同分布,而且不同觀測彼此獨立。IID 不是資料自動具備的性質。連續量測的網路延遲可能具有時間相依性,同一使用者產生的多筆記錄可能群聚,便利抽樣也可能無法代表母體。抽樣機制違反獨立性或代表性時,增加資料筆數不會自動消除系統性偏差。

1.2 統計量、估計量與估計值

**統計量(statistic)**是樣本的函數,而且公式不能含有未知參數。樣本平均 Xˉ=n1i=1nXi\bar X=n^{-1}\sum_{i=1}^nX_i、樣本最大值 maxiXi\max_iX_i 和經驗分布函數都屬於統計量。Xˉμ\bar X-\mu 含有未知的 μ\mu,因此不是可以直接由資料算出的統計量。

統計量若用來推測未知參數,就稱為估計量(estimator)。例如 μ^=Xˉ\hat\mu=\bar X 是母體平均數的估計量。把實際資料代入估計量後得到的數值稱為估計值(estimate);若五筆觀測為 1,2,2,4,61,2,2,4,6,則 μ^=3\hat\mu=3。同一條估計公式在抽樣前是隨機變數,在抽樣後產生確定結果。

2. 從樣本計算常用統計量

2.1 中心位置、比例、矩與變異數

考慮五天的故障次數 x=(1,2,2,4,6)x=(1,2,2,4,6)。樣本平均為 xˉ=(1+2+2+4+6)/5=3\bar x=(1+2+2+4+6)/5=3,樣本中位數為 2。中位數只取決於排序後的中間位置,平均數則會受到每個數值影響;故障次數 6 若改成 60,中位數仍為 2,平均數會從 3 增加到 13.8。

二元資料常用樣本比例。十件產品的檢測結果若為 0,1,0,0,1,0,0,0,1,00,1,0,0,1,0,0,0,1,0,其中 1 表示不合格,則不合格數 K=3K=3,樣本比例 p^=K/n=0.3\hat p=K/n=0.3。因為二元數值的平均數也等於 1 的比例,所以 Bernoulli 樣本同時滿足 xˉ=p^\bar x=\hat p

kk樣本原點矩mk=n1ixikm'_k=n^{-1}\sum_i x_i^k。故障資料的第一階原點矩 m1=3m'_1=3,第二階原點矩 m2=(12+22+22+42+62)/5=12.2m'_2=(1^2+2^2+2^2+4^2+6^2)/5=12.2。第 kk樣本中心矩mk=n1i(xixˉ)km_k=n^{-1}\sum_i(x_i-\bar x)^k;第二階中心矩為 m2=[(2)2+(1)2+(1)2+12+32]/5=3.2m_2=[(-2)^2+(-1)^2+(-1)^2+1^2+3^2]/5=3.2

分母為 nnm2m_2 描述目前五筆資料的平均平方離差,也會出現在常態分布的最大概似估計中。若目標是無偏估計母體變異數,通常使用 s2=(n1)1i(xixˉ)2=16/4=4s^2=(n-1)^{-1}\sum_i(x_i-\bar x)^2=16/4=4。分母 nnn1n-1 對應不同目的,不能只憑習慣互換。樣本標準差為 s=2s=2,單位與原始故障次數相同。

2.2 經驗分布、分位數與共變異數

**經驗累積分布函數(empirical CDF)**定義為 Fn(t)=n1i1(xit)F_n(t)=n^{-1}\sum_i\mathbf 1(x_i\le t),也就是樣本中不大於 tt 的比例。故障資料滿足 Fn(2)=3/5=0.6F_n(2)=3/5=0.6Fn(4)=4/5=0.8F_n(4)=4/5=0.8。經驗 CDF 保留整組一維資料的分布資訊,不必先假設常態、Poisson 或其他參數分布。

若採用經驗分位數定義 qp=inf{t:Fn(t)p}q_p=\inf\{t:F_n(t)\ge p\},故障資料的 q0.25=2q_{0.25}=2q0.5=2q_{0.5}=2q0.9=6q_{0.9}=6。不同軟體可能對相鄰次序統計量插值,因此小樣本的分位數結果可能略有差異。報告分位數時應註明所用定義或軟體預設,不能把不同插值規則的差異誤認為計算錯誤。

成對資料需要描述共同變化。假設四次實驗的輸入量為 x=(1,2,3,4)x=(1,2,3,4),輸出量為 y=(2,3,5,8)y=(2,3,5,8),兩組平均數分別為 xˉ=2.5\bar x=2.5yˉ=4.5\bar y=4.5。樣本共變異數為 sxy=(n1)1i(xixˉ)(yiyˉ)=10/33.33s_{xy}=(n-1)^{-1}\sum_i(x_i-\bar x)(y_i-\bar y)=10/3\approx3.33。正號表示較大的輸入量通常伴隨較大的輸出量,但共變異數的大小會隨量測單位改變。

將共變異數標準化可得樣本相關係數 r=sxy/(sxsy)=10/1050.976r=s_{xy}/(s_xs_y)=10/\sqrt{105}\approx0.976。相關係數接近 1 表示資料具有強烈的正線性關係,卻不能單獨證明輸入量造成輸出量增加;共同原因、選樣方式與非線性關係都需要另外分析。聯合分布、邊際分布與相關性的模型層面定義可回到系列第二篇查閱。

3. 用矩估計與最大概似估計參數

3.1 矩估計把理論矩對準樣本矩

**矩估計法(method of moments)**先寫出分布矩與參數的關係,再令理論矩等於對應的樣本矩。若 XBernoulli(p)X\sim\operatorname{Bernoulli}(p),則 E[X]=pE[X]=p;令 E[X]=XˉE[X]=\bar X 可得 p^MM=Xˉ\hat p_{\mathrm{MM}}=\bar X。前述十件產品有三件不合格,因此矩估計值為 0.3。Poisson 分布滿足 E[X]=λE[X]=\lambda,所以 Poisson 率參數也可用 λ^MM=Xˉ\hat\lambda_{\mathrm{MM}}=\bar X 估計。

XN(μ,σ2)X\sim N(\mu,\sigma^2),前兩個原點矩滿足 E[X]=μE[X]=\muE[X2]=μ2+σ2E[X^2]=\mu^2+\sigma^2。令理論矩分別等於 m1m'_1m2m'_2,可得 μ^MM=Xˉ\hat\mu_{\mathrm{MM}}=\bar Xσ^MM2=m2Xˉ2=n1i(XiXˉ)2\hat\sigma^2_{\mathrm{MM}}=m'_2-\bar X^2=n^{-1}\sum_i(X_i-\bar X)^2。故障資料產生 μ^=3\hat\mu=3σ^2=12.232=3.2\hat\sigma^2=12.2-3^2=3.2

矩估計通常容易計算,也適合提供數值最佳化的初始值,但矩估計不一定充分利用分布資訊。高階樣本矩也容易受到極端值影響。選擇哪些矩、估計結果是否落在合法參數範圍內,都需要按模型檢查。

3.2 最大概似選擇最能解釋資料的參數

給定觀測 x1,,xnx_1,\ldots,x_n,**概似函數(likelihood)**把聯合 PMF 或 PDF 視為參數 θ\theta 的函數,記為 L(θ;x)=if(xi;θ)L(\theta;x)=\prod_i f(x_i;\theta)。資料已經固定,最大概似估計(maximum likelihood estimation, MLE)尋找使 L(θ;x)L(\theta;x) 最大的參數值。概似不是「參數為真的機率」;在頻率學派模型中,參數不是隨機變數,L(θ1;x)/L(θ2;x)L(\theta_1;x)/L(\theta_2;x) 只比較同一筆資料對兩個參數值的相對支持。

對 Bernoulli 樣本,若 nn 次試驗中有 kk 次成功,概似為 L(p)=pk(1p)nkL(p)=p^k(1-p)^{n-k}。乘積常改寫成對數概似 (p)=klogp+(nk)log(1p)\ell(p)=k\log p+(n-k)\log(1-p),因為對數不改變最大值位置,並把乘積變成較容易處理的加總。令導數 (p)=k/p(nk)/(1p)\ell'(p)=k/p-(n-k)/(1-p) 等於 0,可得 p^MLE=k/n\hat p_{\mathrm{MLE}}=k/n。十件產品中的三件不合格仍得到 p^=0.3\hat p=0.3

對 IID 常態樣本,對數概似為 (μ,σ2)=n2log(2πσ2)12σ2i(xiμ)2\ell(\mu,\sigma^2)=-\frac n2\log(2\pi\sigma^2)-\frac{1}{2\sigma^2}\sum_i(x_i-\mu)^2。分別對 μ\muσ2\sigma^2 求最大值,可得 μ^MLE=xˉ\hat\mu_{\mathrm{MLE}}=\bar xσ^MLE2=n1i(xixˉ)2\hat\sigma^2_{\mathrm{MLE}}=n^{-1}\sum_i(x_i-\bar x)^2。故障資料的常態 MLE 是 μ^=3\hat\mu=3σ^2=3.2\hat\sigma^2=3.2。常態變異數 MLE 使用分母 nn,即使分母 n1n-1 的樣本變異數才是無偏估計;最大概似與無偏是兩套不同準則。

MLE 的答案依賴完整模型。若觀測彼此相依、截尾機制被忽略,或錯把計數資料當成常態資料,形式正確的微分仍可能產生沒有意義的估計。開始最佳化之前,應先寫清楚每筆觀測的分布、參數範圍與聯合概似如何分解。

4. 判斷估計量是否可靠

4.1 偏差、變異數與均方誤差

估計量需要在「重複抽取同樣大小的樣本」下評估。估計 θ\theta 的偏差定義為 Bias(θ^)=E[θ^]θ\operatorname{Bias}(\hat\theta)=E[\hat\theta]-\theta;期望等於參數時,估計量稱為無偏(unbiased)。對 IID 樣本,E[Xˉ]=μE[\bar X]=\mu,所以樣本平均無偏;Bernoulli 樣本比例 p^=Xˉ\hat p=\bar X 也無偏。

分母為 nn 的樣本變異數 S~2=n1i(XiXˉ)2\tilde S^2=n^{-1}\sum_i(X_i-\bar X)^2 滿足 E[S~2]=(n1)σ2/nE[\tilde S^2]=(n-1)\sigma^2/n,會系統性低估母體變異數。原因是同一批資料先估計了 Xˉ\bar X,離差因此受到一個線性限制,只剩 n1n-1 個自由度。乘上 n/(n1)n/(n-1) 得到 S2=(n1)1i(XiXˉ)2S^2=(n-1)^{-1}\sum_i(X_i-\bar X)^2,並滿足 E[S2]=σ2E[S^2]=\sigma^2

無偏不等於估計結果一定靠近真值。估計量的均方誤差為 MSE(θ^)=E[(θ^θ)2]=Var(θ^)+Bias(θ^)2\operatorname{MSE}(\hat\theta)=E[(\hat\theta-\theta)^2]=\operatorname{Var}(\hat\theta)+\operatorname{Bias}(\hat\theta)^2。MSE 同時懲罰抽樣波動和系統性偏移,因此一個偏差很小但變異數很大的估計量,可能比帶有少量偏差的穩定估計量更差。小樣本 Bernoulli 問題有時使用 Laplace 平滑 p~=(K+1)/(n+2)\tilde p=(K+1)/(n+2);該估計量通常有偏,卻能避免 K=0K=0K=nK=n 時直接估出 0 或 1,並可能降低極端參數區域以外的 MSE。

4.2 一致性與標準誤

若樣本量增加時 θ^n\hat\theta_n 依機率收斂到 θ\theta,估計量稱為一致(consistent),也就是對每個 ε>0\varepsilon>0 都有 P(θ^nθ>ε)0P(|\hat\theta_n-\theta|>\varepsilon)\to0。一致性描述大樣本極限,不保證某個有限樣本準確;無偏性描述每個固定樣本量的抽樣平均,也不保證變異數很小。兩個性質回答不同問題。

估計量抽樣分布的標準差稱為標準誤(standard error, SE)。若 IID 樣本的母體變異數為 σ2\sigma^2,則 Var(Xˉ)=σ2/n\operatorname{Var}(\bar X)=\sigma^2/n,所以 SE(Xˉ)=σ/n\operatorname{SE}(\bar X)=\sigma/\sqrt n;未知的 σ\sigma 通常以 ss 代替,得到估計標準誤 s/ns/\sqrt n。樣本標準差 ss 描述個別觀測的離散程度,標準誤 s/ns/\sqrt n 描述樣本平均的抽樣波動,兩個數值不能互換。

5. 從機率不等式到極限定理

5.1 Markov 與 Chebyshev 不等式

若隨機變數 Y0Y\ge0E[Y]<E[Y]<\inftyMarkov 不等式給出 P(Ya)E[Y]/aP(Y\ge a)\le E[Y]/a,其中 a>0a>0。若請求延遲非負且平均為 100 ms,Markov 不等式只能保證 P(Y500 ms)0.2P(Y\ge500\text{ ms})\le0.2。界限可能很寬,但結論不需要知道延遲的完整分布。

將 Markov 不等式套用到非負變數 (Xμ)2(X-\mu)^2,可以得到 Chebyshev 不等式P(Xμa)σ2/a2P(|X-\mu|\ge a)\le\sigma^2/a^2。若改用標準差倍數 a=kσa=k\sigma,公式成為 P(Xμkσ)1/k2P(|X-\mu|\ge k\sigma)\le1/k^2。例如任何具有有限變異數的分布都滿足 P(Xμ2σ)1/4P(|X-\mu|\ge2\sigma)\le1/4;Chebyshev 不等式沒有假設常態分布,因此不能擅自替換成常態分布的 95% 經驗法則。

5.2 弱大數定律、強大數定律與中心極限定理

對平均數為 μ\mu、變異數為 σ2<\sigma^2<\infty 的 IID 樣本,樣本平均滿足 E[Xˉn]=μE[\bar X_n]=\muVar(Xˉn)=σ2/n\operatorname{Var}(\bar X_n)=\sigma^2/n。把 Chebyshev 不等式套用到 Xˉn\bar X_n 可得 P(Xˉnμε)σ2/(nε2)P(|\bar X_n-\mu|\ge\varepsilon)\le\sigma^2/(n\varepsilon^2)。右側隨 nn 增加而趨近 0,因此 Xˉn\bar X_n 依機率收斂到 μ\mu。該推導給出有限變異數條件下的弱大數定律(weak law of large numbers)

**強大數定律(strong law of large numbers)**敘述更強的樣本路徑性質:在適當條件下,P(limnXˉn=μ)=1P(\lim_{n\to\infty}\bar X_n=\mu)=1。弱大數定律表示固定的大樣本量下,偏離 μ\mu 的機率趨近 0;強大數定律表示除了機率為 0 的樣本路徑集合,沿著同一條無限抽樣序列計算的平均數會收斂。幾乎必然收斂不代表每一條可想像的序列都收斂,也不代表任何有限樣本平均恰好等於 μ\mu

大數定律回答估計量是否趨近目標,卻沒有描述剩餘誤差的形狀。若 IID 樣本具有有限平均數 μ\mu 與正的有限變異數 σ2\sigma^2,經典**中心極限定理(central limit theorem, CLT)**給出 n(Xˉnμ)/σN(0,1)\sqrt n(\bar X_n-\mu)/\sigma\Rightarrow N(0,1)。因此大樣本下可以近似寫成 XˉnN(μ,σ2/n)\bar X_n\sim N(\mu,\sigma^2/n),而典型誤差尺度為 1/n1/\sqrt n。樣本量增加四倍,標準誤約縮小一半;樣本量增加一百倍,標準誤約縮小為原來的十分之一。

n=400n=400 的 Bernoulli 樣本為例,若觀察到 p^=0.30\hat p=0.30,代入估計標準誤可得 SE^(p^)=0.3×0.7/4000.0229\widehat{\operatorname{SE}}(\hat p)=\sqrt{0.3\times0.7/400}\approx0.0229。常態近似下,約 95% 的誤差範圍是 1.96×0.02290.04491.96\times0.0229\approx0.0449,對應區間約為 [0.255,0.345][0.255,0.345]。該區間是根據抽樣分布得到的近似結果;極小樣本、非常稀少的成功事件、強相依資料或無限變異數分布都可能使常態近似失準。

中心極限定理也不表示原始資料分布會變成常態分布。趨近常態的是經過中心化與縮放的樣本和或樣本平均。大數定律關心 Xˉn\bar X_n 的位置是否穩定,中心極限定理關心 Xˉnμ\bar X_n-\mu 的波動尺度與近似形狀。若要把兩個極限定理延伸到部分和、隨機遊走與布朗運動,可以繼續閱讀隨機過程 4:大數定律與中心極限定理

統計推斷的完整鏈條可以概括為:抽樣設計決定資料是否具有代表性,統計量把資料壓縮成可解釋的數值,估計法把統計量連到未知參數,偏差與 MSE 評估有限樣本品質,而大數定律與中心極限定理解釋估計量在樣本增加時如何穩定及波動。每一步都依賴明確的模型條件;公式本身無法補救錯誤的抽樣方式或不合適的機率模型。