隨機變數把試驗結果轉成數值,分佈則說明各個數值出現的機率。只記住分佈名稱和公式不夠:建模時還要知道參數代表什麼、資料是否符合模型假設,以及平均數與變異數遺漏了哪些資訊。

本文先建立描述單一分佈的數值工具,再比較常見離散與連續分佈,最後把一個隨機變數推廣到隨機向量。本文會在使用 PMF、PDF 與 CDF 時交代所需定義,因此不要求讀者先完成系列其他文章。

1. 用分佈與數值摘要描述隨機變數

1.1 PMF、PDF 與 CDF 回答不同問題

離散隨機變數 XX 使用機率質量函數(PMF)pX(x)=P(X=x)p_X(x)=P(X=x),所有可能值的機率必須滿足 pX(x)0p_X(x)\ge 0xpX(x)=1\sum_x p_X(x)=1。連續隨機變數使用機率密度函數(PDF)fX(x)f_X(x),區間機率是 P(aXb)=abfX(x)dxP(a\le X\le b)=\int_a^b f_X(x)\,dx。密度本身不是機率;連續變數通常滿足 P(X=x)=0P(X=x)=0,真正有意義的是一段區間下方的面積。

累積分佈函數(CDF)FX(x)=P(Xx)F_X(x)=P(X\le x) 同時適用於離散與連續變數。CDF 可以直接計算區間與尾端機率,例如 P(X>x)=1FX(x)P(X>x)=1-F_X(x);若 XX 為連續變數,則 P(a<Xb)=FX(b)FX(a)P(a<X\le b)=F_X(b)-F_X(a)。比較兩個模型時,先確認使用的是單點機率、密度還是累積機率,能避免把 PDF 高度誤當成事件機率。

1.2 期望值、變異數與動差

期望值描述分佈的重心。離散情況為 E[X]=xxpX(x)E[X]=\sum_x xp_X(x),連續情況為 E[X]=xfX(x)dxE[X]=\int_{-\infty}^{\infty}xf_X(x)\,dx。期望值不一定是可能觀測到的值:公平六面骰子的期望值是 3.53.5,但任何一次擲骰都不會出現 3.53.5。期望值也不保證存在;尾端衰減過慢的分佈可能使積分發散。

變異數 Var(X)=E[(Xμ)2]=E[X2]μ2\operatorname{Var}(X)=E[(X-\mu)^2]=E[X^2]-\mu^2 衡量觀測值相對平均數 μ=E[X]\mu=E[X] 的平方偏差。標準差 σ=Var(X)\sigma=\sqrt{\operatorname{Var}(X)}XX 具有相同單位,因此比變異數容易解讀。若伺服器延遲的平均值是 100 ms、標準差是 10 ms,標準差直接以毫秒描述波動;變異數的單位則是平方毫秒。

kk 階原始動差是 E[Xk]E[X^k]kk 階中心動差是 E[(Xμ)k]E[(X-\mu)^k]。一階原始動差就是平均數,二階中心動差就是變異數;標準化三階中心動差形成偏度,用來描述左右不對稱;標準化四階中心動差與峰度相關,用來描述尾端與集中程度。有限個動差通常不能完整決定分佈,而且某些分佈沒有高階動差,所以動差是摘要,不是分佈本身。

1.3 中位數、分位數與尾端風險

中位數是 0.5 分位數。更一般地,可以把 pp 分位數定義為 qp=inf{x:FX(x)p}q_p=\inf\{x:F_X(x)\ge p\};第 25、50、75 百分位數分別描述分佈的四分位位置。四分位距 IQR=q0.75q0.25IQR=q_{0.75}-q_{0.25} 對極端值較不敏感,適合描述偏斜或含離群值的資料。

平均數與中位數的差異能揭示偏斜。九次延遲都是 20 ms、一次延遲是 1020 ms 時,平均值為 120 ms,中位數仍是 20 ms。平均值反映極端延遲造成的總成本,中位數反映典型請求;兩個數值回答不同問題。服務可靠性通常還要報告 p95p_{95}p99p_{99} 或超過門檻的尾端機率 P(X>c)P(X>c),因為相同平均值與標準差的分佈仍可能具有截然不同的尾端。

2. 常見離散分佈

2.1 Bernoulli、Binomial 與 Geometric

Bernoulli 分佈描述一次只有成功或失敗的試驗。若 X{0,1}X\in\{0,1\} 且成功機率為 pp,寫成 XBernoulli(p)X\sim\operatorname{Bernoulli}(p);其期望值為 pp,變異數為 p(1p)p(1-p)。參數 pp 必須在每次指定的試驗中具有明確含義,例如「一個請求在 200 ms 內完成」的機率,而不是沒有時間範圍或服務範圍的抽象成功率。

Binomial 分佈描述 nn 次獨立、成功率相同的 Bernoulli 試驗中成功的總次數。若 XBinomial(n,p)X\sim\operatorname{Binomial}(n,p),則 P(X=k)=(nk)pk(1p)nkP(X=k)={n\choose k}p^k(1-p)^{n-k}E[X]=npE[X]=npVar(X)=np(1p)\operatorname{Var}(X)=np(1-p)。假設 20 個獨立請求各有 5% 機率失敗,失敗數 XX 可建模為 Binomial(20,0.05)\operatorname{Binomial}(20,0.05),恰好兩次失敗的機率是 (202)(0.05)2(0.95)180.189{20\choose2}(0.05)^2(0.95)^{18}\approx0.189。若請求共享同一個故障節點,失敗事件可能高度相關,Binomial 的獨立假設便不成立。

Geometric 分佈描述第一次成功前需要多少次試驗。若把成功所在的試驗次數記為 T{1,2,}T\in\{1,2,\ldots\},則 P(T=k)=(1p)k1pP(T=k)=(1-p)^{k-1}pE[T]=1/pE[T]=1/p。不同教材也會把失敗次數記為從 0 開始的變數;使用公式前必須確認計數起點。Geometric 分佈具有離散無記憶性,適合成功率固定且每次試驗獨立的等待問題。

2.2 Poisson 分佈

Poisson 分佈描述固定區間內的事件數。若 XPoisson(λ)X\sim\operatorname{Poisson}(\lambda),則 P(X=k)=eλλk/k!P(X=k)=e^{-\lambda}\lambda^k/k!,而且 E[X]=Var(X)=λE[X]=\operatorname{Var}(X)=\lambda。參數 λ\lambda 是指定區間內的平均事件數;若平均每分鐘有 3 個請求,十分鐘區間的平均數在齊次假設下是 30,不能仍把參數填成 3。

Poisson 模型通常假設事件在極短區間內單獨發生、互不影響,而且平均速率在研究區間內固定。平均值與樣本變異數差距很大,可能表示資料有過度離散、速率隨時間改變或事件群聚。固定區間的 Poisson 分佈只描述一個計數變數;若要描述計數如何隨時間累積,以及計數與等待時間的關係,可閱讀隨機過程 9:泊松過程

2.3 Categorical 與 Multinomial

Categorical 分佈把 Bernoulli 的兩種結果擴充為 KK 個互斥類別,參數為機率向量 (p1,,pK)(p_1,\dots,p_K),其中每個 pi0p_i\ge0 且總和為 1。單次請求的狀態可能分為成功、客戶端錯誤與伺服器錯誤,三類機率共同定義一次 Categorical 試驗。

Multinomial 分佈再把單次 Categorical 試驗擴充到 nn 次獨立同分佈試驗,輸出每一類的計數 (X1,,XK)(X_1,\dots,X_K),並滿足 iXi=n\sum_iX_i=n。各類計數不能彼此獨立,因為某一類多一次就會壓縮其他類可用的總數。該限制預告了一個重要觀念:多維資料的每個分量都可能有簡單的邊緣分佈,但分量之間仍受聯合結構約束。

3. 常見連續分佈

3.1 Uniform、Exponential 與 Gamma

Uniform 分佈 XUniform(a,b)X\sim\operatorname{Uniform}(a,b) 在區間 [a,b][a,b] 內具有固定密度 1/(ba)1/(b-a),期望值為 (a+b)/2(a+b)/2,變異數為 (ba)2/12(b-a)^2/12。模型假設每個等長子區間具有相同機率,適合描述有限範圍內沒有偏好的位置;Uniform 不適合僅因資料落在某個範圍內就直接採用,觀測機制仍需支持均勻假設。

Exponential 分佈 TExponential(λ)T\sim\operatorname{Exponential}(\lambda) 常用來描述 Poisson 過程中的事件間隔,密度為 fT(t)=λeλtf_T(t)=\lambda e^{-\lambda t}t0t\ge0),期望值為 1/λ1/\lambda,變異數為 1/λ21/\lambda^2。速率 λ\lambda 越大,平均等待時間越短。Exponential 的無記憶性 P(T>s+tT>s)=P(T>t)P(T>s+t\mid T>s)=P(T>t) 意味著已等待時間不改變剩餘等待時間的分佈;具有老化、磨損或排隊群聚的壽命資料通常不符合該假設。

Gamma 分佈可以描述累積多個獨立 Exponential 等待時間。採用 shape-rate 參數化 TGamma(α,λ)T\sim\operatorname{Gamma}(\alpha,\lambda) 時,期望值是 α/λ\alpha/\lambda,變異數是 α/λ2\alpha/\lambda^2。不同軟體可能用 scale θ=1/λ\theta=1/\lambda 代替 rate;看到 Gamma 參數時必須先確認第二個參數是 rate 還是 scale。

3.2 Normal 分佈與標準化

Normal 分佈 XN(μ,σ2)X\sim N(\mu,\sigma^2) 由位置參數 μ\mu 與尺度參數 σ>0\sigma>0 決定,期望值為 μ\mu,變異數為 σ2\sigma^2。標準化 Z=(Xμ)/σZ=(X-\mu)/\sigma 會得到 ZN(0,1)Z\sim N(0,1),因此不同單位的觀測值可以轉換成距離平均值多少個標準差。

若零件長度可近似為 N(100,22)N(100,2^2) mm,規格要求 96 至 104 mm,標準化後的界線是 -2 與 2,因此合格率約為 P(2Z2)0.9545P(-2\le Z\le2)\approx0.9545。計算結果依賴 Normal 假設;分佈若偏斜、有厚尾或混合了多個生產批次,僅憑平均值與標準差套用 68–95–99.7 規則會低估尾端機率。

Normal 分佈常見於許多微小影響相加的測量誤差與樣本平均,但「資料很多」不會自動讓原始資料服從 Normal。中心極限定理通常描述經過中心化與縮放的總和或平均值,而不是任意母體的每一筆觀測。

3.3 依資料型態選擇候選模型

分佈名稱應由隨機機制和支撐集合共同決定。二元結果可先考慮 Bernoulli;固定試驗次數內的成功數可考慮 Binomial;固定時間內的稀疏事件數可考慮 Poisson;正值等待時間可比較 Exponential、Gamma 或其他壽命分佈;上下界內近似無偏好的位置可考慮 Uniform;多個微小誤差相加的實值量可考慮 Normal。

候選模型仍需接受資料檢查。研究者可以比較直方圖、經驗 CDF、分位數與模型分位數,並檢查平均值和變異數是否符合參數限制。模型是帶假設的近似;選擇分佈時,生成機制、支撐集合與尾端行為比曲線外觀更重要。

4. 聯合、邊緣與條件分佈

4.1 聯合分佈保留變數如何共同出現

兩個離散隨機變數的聯合 PMF 是 pX,Y(x,y)=P(X=x,Y=y)p_{X,Y}(x,y)=P(X=x,Y=y);兩個連續隨機變數則可使用聯合密度 fX,Y(x,y)f_{X,Y}(x,y)。聯合分佈需要對所有可能組合規範化,並且包含單一變數分佈與變數依賴關係的完整資訊。

考慮一個等機率抽取的資料表:(X,Y)(X,Y) 分別以機率 1/41/4 取值 (0,0),(0,1),(1,1),(1,2)(0,0),(0,1),(1,1),(1,2)XX 的分佈只告訴讀者 P(X=0)=P(X=1)=1/2P(X=0)=P(X=1)=1/2YY 的分佈只告訴讀者 P(Y=0)=1/4P(Y=0)=1/4P(Y=1)=1/2P(Y=1)=1/2P(Y=2)=1/4P(Y=2)=1/4。聯合 PMF 還保留 X=0X=0YY 不會等於 2,以及 X=1X=1YY 不會等於 0 的依賴結構。

聯合分佈可以推廣到隨機向量 X=(X1,,Xd)T\mathbf X=(X_1,\dots,X_d)^\mathsf T。每個觀測不再是一個數,而是 dd 維空間中的一個點。例如一個請求可由延遲、回應大小和 CPU 時間組成三維隨機向量;多元分佈同時描述三個分量各自的變化及共同變化。

4.2 邊緣分佈與條件分佈

從聯合 PMF 對不關心的變數求和,可以得到邊緣 PMF:pX(x)=ypX,Y(x,y)p_X(x)=\sum_y p_{X,Y}(x,y)。連續情況改為積分:fX(x)=fX,Y(x,y)dyf_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy。上述操作稱為 marginalization,含義是忽略 YY 的具體值,只保留 XX 的分佈。

觀察到 Y=yY=y 後,離散條件分佈為 pXY(xy)=pX,Y(x,y)/pY(y)p_{X\mid Y}(x\mid y)=p_{X,Y}(x,y)/p_Y(y),前提是 pY(y)>0p_Y(y)>0。在前述四點例子中,P(Y=2)=1/4P(Y=2)=1/4 且只有 (1,2)(1,2) 符合條件,所以 P(X=1Y=2)=1P(X=1\mid Y=2)=1;沒有條件資訊時 P(X=1)=1/2P(X=1)=1/2。條件分佈量化新增資訊如何改變不確定性,也是迴歸、分類、Bayes 推斷與序列模型的共同基礎。

知道所有邊緣分佈仍不足以重建聯合分佈。兩個 Bernoulli(1/2)(1/2) 變數可以互相獨立,也可以滿足 Y=XY=X,還可以滿足 Y=1XY=1-X;三種情況具有相同邊緣分佈,但聯合行為完全不同。隨機過程因而必須研究不同時間點的聯合分佈,而不能只逐點列出分佈;更完整的延伸可閱讀隨機過程 2:聯合分佈、相關性與依賴結構

5. 獨立性、共變異數與相關性

5.1 獨立性是對整個聯合分佈的要求

離散變數 XXYY 獨立時,所有可能組合都滿足 pX,Y(x,y)=pX(x)pY(y)p_{X,Y}(x,y)=p_X(x)p_Y(y);連續變數則滿足 fX,Y(x,y)=fX(x)fY(y)f_{X,Y}(x,y)=f_X(x)f_Y(y)。等價地,知道 YY 不會改變 XX 的條件分佈。獨立性比「兩個變數看起來沒有趨勢」更強,必須由聯合分佈或合理的生成機制支持。

XXYY 獨立且相關期望存在,任何合適函數 g,hg,h 都滿足 E[g(X)h(Y)]=E[g(X)]E[h(Y)]E[g(X)h(Y)]=E[g(X)]E[h(Y)]。反方向通常不成立:一組特定期望能分解,無法證明整個聯合分佈都能分解。

5.2 共變異數與相關係數

共變異數 Cov(X,Y)=E[(XE[X])(YE[Y])]=E[XY]E[X]E[Y]\operatorname{Cov}(X,Y)=E[(X-E[X])(Y-E[Y])]=E[XY]-E[X]E[Y] 描述線性共同變化。正值表示兩個變數傾向同方向偏離各自平均數,負值表示反方向偏離,零表示沒有線性共同變化。共變異數受單位影響;把公尺換成公分會把共變異數放大 100 倍。

Pearson 相關係數 ρX,Y=Cov(X,Y)/(σXσY)\rho_{X,Y}=\operatorname{Cov}(X,Y)/(\sigma_X\sigma_Y) 消除尺度,並落在 [1,1][-1,1] 內,前提是兩個標準差都大於 0。ρ\rho 接近 1 或 -1 表示強線性關係,ρ\rho 接近 0 只表示線性關係弱。相關係數不提供因果方向,也可能被極端值、群組混合或非線性關係誤導。

零相關不代表獨立。令 XX[1,1][-1,1] 上均勻分佈,並令 Y=X2Y=X^2。對稱性使 E[X]=0E[X]=0E[X3]=0E[X^3]=0,所以 Cov(X,Y)=E[X3]E[X]E[X2]=0\operatorname{Cov}(X,Y)=E[X^3]-E[X]E[X^2]=0;但 YY 完全由 XX 決定,兩者顯然不獨立。獨立且二階動差存在會推出零共變異數;只有在多元 Normal 等額外條件成立時,零共變異數才足以推出獨立。

5.3 共變異數矩陣與線性組合

dd 維隨機向量 X\mathbf X,平均向量記為 μ=E[X]\boldsymbol\mu=E[\mathbf X],共變異數矩陣記為 Σ=E[(Xμ)(Xμ)T]\boldsymbol\Sigma=E[(\mathbf X-\boldsymbol\mu)(\mathbf X-\boldsymbol\mu)^\mathsf T]。矩陣元素 Σij=Cov(Xi,Xj)\Sigma_{ij}=\operatorname{Cov}(X_i,X_j);對角線是各分量的變異數,非對角線是成對共變異數。共變異數矩陣必定對稱且半正定,因此任意向量 a\mathbf a 都滿足 Var(aTX)=aTΣa0\operatorname{Var}(\mathbf a^\mathsf T\mathbf X)=\mathbf a^\mathsf T\boldsymbol\Sigma\mathbf a\ge0。多元 Normal 分佈 Nd(μ,Σ)N_d(\boldsymbol\mu,\boldsymbol\Sigma) 由平均向量和共變異數矩陣決定;在該分佈族內,零共變異數也會推出對應分量獨立。

假設兩台服務的每分鐘負載分別為 X1,X2X_1,X_2,標準差都是 10。若相關係數為 0.8,兩者總負載的變異數是 102+102+2(0.8)(10)(10)=36010^2+10^2+2(0.8)(10)(10)=360,標準差約為 18.97;若兩者獨立,總負載標準差是 20014.14\sqrt{200}\approx14.14。單機波動相同,正相關仍會提高總容量的不確定性。資源配置、投資組合與多感測器融合都需要保留共變異數矩陣,不能只分別保存每個分量的標準差。

分佈描述可能值及其機率,數值摘要壓縮分佈特徵,聯合分佈則補上多個變數共同出現的規律。完成三層區分後,後續的參數估計、信賴區間、大數定律與中心極限定理才有清楚的對象:資料來自哪個分佈、未知參數是什麼,以及統計量在重複抽樣下如何變化。