隨機變數把試驗結果轉成數值,分佈則說明各個數值出現的機率。只記住分佈名稱和公式不夠:建模時還要知道參數代表什麼、資料是否符合模型假設,以及平均數與變異數遺漏了哪些資訊。
本文先建立描述單一分佈的數值工具,再比較常見離散與連續分佈,最後把一個隨機變數推廣到隨機向量。本文會在使用 PMF、PDF 與 CDF 時交代所需定義,因此不要求讀者先完成系列其他文章。
1. 用分佈與數值摘要描述隨機變數
1.1 PMF、PDF 與 CDF 回答不同問題
離散隨機變數 X X X 使用機率質量函數(PMF)p X ( x ) = P ( X = x ) p_X(x)=P(X=x) p X ( x ) = P ( X = x ) ,所有可能值的機率必須滿足 p X ( x ) ≥ 0 p_X(x)\ge 0 p X ( x ) ≥ 0 與 ∑ x p X ( x ) = 1 \sum_x p_X(x)=1 ∑ x p X ( x ) = 1 。連續隨機變數使用機率密度函數(PDF)f X ( x ) f_X(x) f X ( x ) ,區間機率是 P ( a ≤ X ≤ b ) = ∫ a b f X ( x ) d x P(a\le X\le b)=\int_a^b f_X(x)\,dx P ( a ≤ X ≤ b ) = ∫ a b f X ( x ) d x 。密度本身不是機率;連續變數通常滿足 P ( X = x ) = 0 P(X=x)=0 P ( X = x ) = 0 ,真正有意義的是一段區間下方的面積。
累積分佈函數(CDF)F X ( x ) = P ( X ≤ x ) F_X(x)=P(X\le x) F X ( x ) = P ( X ≤ x ) 同時適用於離散與連續變數。CDF 可以直接計算區間與尾端機率,例如 P ( X > x ) = 1 − F X ( x ) P(X>x)=1-F_X(x) P ( X > x ) = 1 − F X ( x ) ;若 X X X 為連續變數,則 P ( a < X ≤ b ) = F X ( b ) − F X ( a ) P(a<X\le b)=F_X(b)-F_X(a) P ( a < X ≤ b ) = F X ( b ) − F X ( a ) 。比較兩個模型時,先確認使用的是單點機率、密度還是累積機率,能避免把 PDF 高度誤當成事件機率。
1.2 期望值、變異數與動差
期望值描述分佈的重心。離散情況為 E [ X ] = ∑ x x p X ( x ) E[X]=\sum_x xp_X(x) E [ X ] = ∑ x x p X ( x ) ,連續情況為 E [ X ] = ∫ − ∞ ∞ x f X ( x ) d x E[X]=\int_{-\infty}^{\infty}xf_X(x)\,dx E [ X ] = ∫ − ∞ ∞ x f X ( x ) d x 。期望值不一定是可能觀測到的值:公平六面骰子的期望值是 3.5 3.5 3.5 ,但任何一次擲骰都不會出現 3.5 3.5 3.5 。期望值也不保證存在;尾端衰減過慢的分佈可能使積分發散。
變異數 Var ( X ) = E [ ( X − μ ) 2 ] = E [ X 2 ] − μ 2 \operatorname{Var}(X)=E[(X-\mu)^2]=E[X^2]-\mu^2 Var ( X ) = E [( X − μ ) 2 ] = E [ X 2 ] − μ 2 衡量觀測值相對平均數 μ = E [ X ] \mu=E[X] μ = E [ X ] 的平方偏差。標準差 σ = Var ( X ) \sigma=\sqrt{\operatorname{Var}(X)} σ = Var ( X ) 與 X X X 具有相同單位,因此比變異數容易解讀。若伺服器延遲的平均值是 100 ms、標準差是 10 ms,標準差直接以毫秒描述波動;變異數的單位則是平方毫秒。
k k k 階原始動差是 E [ X k ] E[X^k] E [ X k ] ,k k k 階中心動差是 E [ ( X − μ ) k ] E[(X-\mu)^k] E [( X − μ ) k ] 。一階原始動差就是平均數,二階中心動差就是變異數;標準化三階中心動差形成偏度,用來描述左右不對稱;標準化四階中心動差與峰度相關,用來描述尾端與集中程度。有限個動差通常不能完整決定分佈,而且某些分佈沒有高階動差,所以動差是摘要,不是分佈本身。
1.3 中位數、分位數與尾端風險
中位數是 0.5 分位數。更一般地,可以把 p p p 分位數定義為 q p = inf { x : F X ( x ) ≥ p } q_p=\inf\{x:F_X(x)\ge p\} q p = inf { x : F X ( x ) ≥ p } ;第 25、50、75 百分位數分別描述分佈的四分位位置。四分位距 I Q R = q 0.75 − q 0.25 IQR=q_{0.75}-q_{0.25} I QR = q 0.75 − q 0.25 對極端值較不敏感,適合描述偏斜或含離群值的資料。
平均數與中位數的差異能揭示偏斜。九次延遲都是 20 ms、一次延遲是 1020 ms 時,平均值為 120 ms,中位數仍是 20 ms。平均值反映極端延遲造成的總成本,中位數反映典型請求;兩個數值回答不同問題。服務可靠性通常還要報告 p 95 p_{95} p 95 、p 99 p_{99} p 99 或超過門檻的尾端機率 P ( X > c ) P(X>c) P ( X > c ) ,因為相同平均值與標準差的分佈仍可能具有截然不同的尾端。
2. 常見離散分佈
2.1 Bernoulli、Binomial 與 Geometric
Bernoulli 分佈描述一次只有成功或失敗的試驗。若 X ∈ { 0 , 1 } X\in\{0,1\} X ∈ { 0 , 1 } 且成功機率為 p p p ,寫成 X ∼ Bernoulli ( p ) X\sim\operatorname{Bernoulli}(p) X ∼ Bernoulli ( p ) ;其期望值為 p p p ,變異數為 p ( 1 − p ) p(1-p) p ( 1 − p ) 。參數 p p p 必須在每次指定的試驗中具有明確含義,例如「一個請求在 200 ms 內完成」的機率,而不是沒有時間範圍或服務範圍的抽象成功率。
Binomial 分佈描述 n n n 次獨立、成功率相同的 Bernoulli 試驗中成功的總次數。若 X ∼ Binomial ( n , p ) X\sim\operatorname{Binomial}(n,p) X ∼ Binomial ( n , p ) ,則 P ( X = k ) = ( n k ) p k ( 1 − p ) n − k P(X=k)={n\choose k}p^k(1-p)^{n-k} P ( X = k ) = ( k n ) p k ( 1 − p ) n − k 、E [ X ] = n p E[X]=np E [ X ] = n p 、Var ( X ) = n p ( 1 − p ) \operatorname{Var}(X)=np(1-p) Var ( X ) = n p ( 1 − p ) 。假設 20 個獨立請求各有 5% 機率失敗,失敗數 X X X 可建模為 Binomial ( 20 , 0.05 ) \operatorname{Binomial}(20,0.05) Binomial ( 20 , 0.05 ) ,恰好兩次失敗的機率是 ( 20 2 ) ( 0.05 ) 2 ( 0.95 ) 18 ≈ 0.189 {20\choose2}(0.05)^2(0.95)^{18}\approx0.189 ( 2 20 ) ( 0.05 ) 2 ( 0.95 ) 18 ≈ 0.189 。若請求共享同一個故障節點,失敗事件可能高度相關,Binomial 的獨立假設便不成立。
Geometric 分佈描述第一次成功前需要多少次試驗。若把成功所在的試驗次數記為 T ∈ { 1 , 2 , … } T\in\{1,2,\ldots\} T ∈ { 1 , 2 , … } ,則 P ( T = k ) = ( 1 − p ) k − 1 p P(T=k)=(1-p)^{k-1}p P ( T = k ) = ( 1 − p ) k − 1 p 與 E [ T ] = 1 / p E[T]=1/p E [ T ] = 1/ p 。不同教材也會把失敗次數記為從 0 開始的變數;使用公式前必須確認計數起點。Geometric 分佈具有離散無記憶性,適合成功率固定且每次試驗獨立的等待問題。
2.2 Poisson 分佈
Poisson 分佈描述固定區間內的事件數。若 X ∼ Poisson ( λ ) X\sim\operatorname{Poisson}(\lambda) X ∼ Poisson ( λ ) ,則 P ( X = k ) = e − λ λ k / k ! P(X=k)=e^{-\lambda}\lambda^k/k! P ( X = k ) = e − λ λ k / k ! ,而且 E [ X ] = Var ( X ) = λ E[X]=\operatorname{Var}(X)=\lambda E [ X ] = Var ( X ) = λ 。參數 λ \lambda λ 是指定區間內的平均事件數;若平均每分鐘有 3 個請求,十分鐘區間的平均數在齊次假設下是 30,不能仍把參數填成 3。
Poisson 模型通常假設事件在極短區間內單獨發生、互不影響,而且平均速率在研究區間內固定。平均值與樣本變異數差距很大,可能表示資料有過度離散、速率隨時間改變或事件群聚。固定區間的 Poisson 分佈只描述一個計數變數;若要描述計數如何隨時間累積,以及計數與等待時間的關係,可閱讀隨機過程 9:泊松過程 。
2.3 Categorical 與 Multinomial
Categorical 分佈把 Bernoulli 的兩種結果擴充為 K K K 個互斥類別,參數為機率向量 ( p 1 , … , p K ) (p_1,\dots,p_K) ( p 1 , … , p K ) ,其中每個 p i ≥ 0 p_i\ge0 p i ≥ 0 且總和為 1。單次請求的狀態可能分為成功、客戶端錯誤與伺服器錯誤,三類機率共同定義一次 Categorical 試驗。
Multinomial 分佈再把單次 Categorical 試驗擴充到 n n n 次獨立同分佈試驗,輸出每一類的計數 ( X 1 , … , X K ) (X_1,\dots,X_K) ( X 1 , … , X K ) ,並滿足 ∑ i X i = n \sum_iX_i=n ∑ i X i = n 。各類計數不能彼此獨立,因為某一類多一次就會壓縮其他類可用的總數。該限制預告了一個重要觀念:多維資料的每個分量都可能有簡單的邊緣分佈,但分量之間仍受聯合結構約束。
3. 常見連續分佈
Uniform 分佈 X ∼ Uniform ( a , b ) X\sim\operatorname{Uniform}(a,b) X ∼ Uniform ( a , b ) 在區間 [ a , b ] [a,b] [ a , b ] 內具有固定密度 1 / ( b − a ) 1/(b-a) 1/ ( b − a ) ,期望值為 ( a + b ) / 2 (a+b)/2 ( a + b ) /2 ,變異數為 ( b − a ) 2 / 12 (b-a)^2/12 ( b − a ) 2 /12 。模型假設每個等長子區間具有相同機率,適合描述有限範圍內沒有偏好的位置;Uniform 不適合僅因資料落在某個範圍內就直接採用,觀測機制仍需支持均勻假設。
Exponential 分佈 T ∼ Exponential ( λ ) T\sim\operatorname{Exponential}(\lambda) T ∼ Exponential ( λ ) 常用來描述 Poisson 過程中的事件間隔,密度為 f T ( t ) = λ e − λ t f_T(t)=\lambda e^{-\lambda t} f T ( t ) = λ e − λ t (t ≥ 0 t\ge0 t ≥ 0 ),期望值為 1 / λ 1/\lambda 1/ λ ,變異數為 1 / λ 2 1/\lambda^2 1/ λ 2 。速率 λ \lambda λ 越大,平均等待時間越短。Exponential 的無記憶性 P ( T > s + t ∣ T > s ) = P ( T > t ) P(T>s+t\mid T>s)=P(T>t) P ( T > s + t ∣ T > s ) = P ( T > t ) 意味著已等待時間不改變剩餘等待時間的分佈;具有老化、磨損或排隊群聚的壽命資料通常不符合該假設。
Gamma 分佈可以描述累積多個獨立 Exponential 等待時間。採用 shape-rate 參數化 T ∼ Gamma ( α , λ ) T\sim\operatorname{Gamma}(\alpha,\lambda) T ∼ Gamma ( α , λ ) 時,期望值是 α / λ \alpha/\lambda α / λ ,變異數是 α / λ 2 \alpha/\lambda^2 α / λ 2 。不同軟體可能用 scale θ = 1 / λ \theta=1/\lambda θ = 1/ λ 代替 rate;看到 Gamma 參數時必須先確認第二個參數是 rate 還是 scale。
3.2 Normal 分佈與標準化
Normal 分佈 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) 由位置參數 μ \mu μ 與尺度參數 σ > 0 \sigma>0 σ > 0 決定,期望值為 μ \mu μ ,變異數為 σ 2 \sigma^2 σ 2 。標準化 Z = ( X − μ ) / σ Z=(X-\mu)/\sigma Z = ( X − μ ) / σ 會得到 Z ∼ N ( 0 , 1 ) Z\sim N(0,1) Z ∼ N ( 0 , 1 ) ,因此不同單位的觀測值可以轉換成距離平均值多少個標準差。
若零件長度可近似為 N ( 100 , 2 2 ) N(100,2^2) N ( 100 , 2 2 ) mm,規格要求 96 至 104 mm,標準化後的界線是 -2 與 2,因此合格率約為 P ( − 2 ≤ Z ≤ 2 ) ≈ 0.9545 P(-2\le Z\le2)\approx0.9545 P ( − 2 ≤ Z ≤ 2 ) ≈ 0.9545 。計算結果依賴 Normal 假設;分佈若偏斜、有厚尾或混合了多個生產批次,僅憑平均值與標準差套用 68–95–99.7 規則會低估尾端機率。
Normal 分佈常見於許多微小影響相加的測量誤差與樣本平均,但「資料很多」不會自動讓原始資料服從 Normal。中心極限定理通常描述經過中心化與縮放的總和或平均值,而不是任意母體的每一筆觀測。
3.3 依資料型態選擇候選模型
分佈名稱應由隨機機制和支撐集合共同決定。二元結果可先考慮 Bernoulli;固定試驗次數內的成功數可考慮 Binomial;固定時間內的稀疏事件數可考慮 Poisson;正值等待時間可比較 Exponential、Gamma 或其他壽命分佈;上下界內近似無偏好的位置可考慮 Uniform;多個微小誤差相加的實值量可考慮 Normal。
候選模型仍需接受資料檢查。研究者可以比較直方圖、經驗 CDF、分位數與模型分位數,並檢查平均值和變異數是否符合參數限制。模型是帶假設的近似;選擇分佈時,生成機制、支撐集合與尾端行為比曲線外觀更重要。
4. 聯合、邊緣與條件分佈
4.1 聯合分佈保留變數如何共同出現
兩個離散隨機變數的聯合 PMF 是 p X , Y ( x , y ) = P ( X = x , Y = y ) p_{X,Y}(x,y)=P(X=x,Y=y) p X , Y ( x , y ) = P ( X = x , Y = y ) ;兩個連續隨機變數則可使用聯合密度 f X , Y ( x , y ) f_{X,Y}(x,y) f X , Y ( x , y ) 。聯合分佈需要對所有可能組合規範化,並且包含單一變數分佈與變數依賴關係的完整資訊。
考慮一個等機率抽取的資料表:( X , Y ) (X,Y) ( X , Y ) 分別以機率 1 / 4 1/4 1/4 取值 ( 0 , 0 ) , ( 0 , 1 ) , ( 1 , 1 ) , ( 1 , 2 ) (0,0),(0,1),(1,1),(1,2) ( 0 , 0 ) , ( 0 , 1 ) , ( 1 , 1 ) , ( 1 , 2 ) 。X X X 的分佈只告訴讀者 P ( X = 0 ) = P ( X = 1 ) = 1 / 2 P(X=0)=P(X=1)=1/2 P ( X = 0 ) = P ( X = 1 ) = 1/2 ,Y Y Y 的分佈只告訴讀者 P ( Y = 0 ) = 1 / 4 P(Y=0)=1/4 P ( Y = 0 ) = 1/4 、P ( Y = 1 ) = 1 / 2 P(Y=1)=1/2 P ( Y = 1 ) = 1/2 、P ( Y = 2 ) = 1 / 4 P(Y=2)=1/4 P ( Y = 2 ) = 1/4 。聯合 PMF 還保留 X = 0 X=0 X = 0 時 Y Y Y 不會等於 2,以及 X = 1 X=1 X = 1 時 Y Y Y 不會等於 0 的依賴結構。
聯合分佈可以推廣到隨機向量 X = ( X 1 , … , X d ) T \mathbf X=(X_1,\dots,X_d)^\mathsf T X = ( X 1 , … , X d ) T 。每個觀測不再是一個數,而是 d d d 維空間中的一個點。例如一個請求可由延遲、回應大小和 CPU 時間組成三維隨機向量;多元分佈同時描述三個分量各自的變化及共同變化。
4.2 邊緣分佈與條件分佈
從聯合 PMF 對不關心的變數求和,可以得到邊緣 PMF:p X ( x ) = ∑ y p X , Y ( x , y ) p_X(x)=\sum_y p_{X,Y}(x,y) p X ( x ) = ∑ y p X , Y ( x , y ) 。連續情況改為積分:f X ( x ) = ∫ − ∞ ∞ f X , Y ( x , y ) d y f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy f X ( x ) = ∫ − ∞ ∞ f X , Y ( x , y ) d y 。上述操作稱為 marginalization,含義是忽略 Y Y Y 的具體值,只保留 X X X 的分佈。
觀察到 Y = y Y=y Y = y 後,離散條件分佈為 p X ∣ Y ( x ∣ y ) = p X , Y ( x , y ) / p Y ( y ) p_{X\mid Y}(x\mid y)=p_{X,Y}(x,y)/p_Y(y) p X ∣ Y ( x ∣ y ) = p X , Y ( x , y ) / p Y ( y ) ,前提是 p Y ( y ) > 0 p_Y(y)>0 p Y ( y ) > 0 。在前述四點例子中,P ( Y = 2 ) = 1 / 4 P(Y=2)=1/4 P ( Y = 2 ) = 1/4 且只有 ( 1 , 2 ) (1,2) ( 1 , 2 ) 符合條件,所以 P ( X = 1 ∣ Y = 2 ) = 1 P(X=1\mid Y=2)=1 P ( X = 1 ∣ Y = 2 ) = 1 ;沒有條件資訊時 P ( X = 1 ) = 1 / 2 P(X=1)=1/2 P ( X = 1 ) = 1/2 。條件分佈量化新增資訊如何改變不確定性,也是迴歸、分類、Bayes 推斷與序列模型的共同基礎。
知道所有邊緣分佈仍不足以重建聯合分佈。兩個 Bernoulli( 1 / 2 ) (1/2) ( 1/2 ) 變數可以互相獨立,也可以滿足 Y = X Y=X Y = X ,還可以滿足 Y = 1 − X Y=1-X Y = 1 − X ;三種情況具有相同邊緣分佈,但聯合行為完全不同。隨機過程因而必須研究不同時間點的聯合分佈,而不能只逐點列出分佈;更完整的延伸可閱讀隨機過程 2:聯合分佈、相關性與依賴結構 。
5. 獨立性、共變異數與相關性
5.1 獨立性是對整個聯合分佈的要求
離散變數 X X X 與 Y Y Y 獨立時,所有可能組合都滿足 p X , Y ( x , y ) = p X ( x ) p Y ( y ) p_{X,Y}(x,y)=p_X(x)p_Y(y) p X , Y ( x , y ) = p X ( x ) p Y ( y ) ;連續變數則滿足 f X , Y ( x , y ) = f X ( x ) f Y ( y ) f_{X,Y}(x,y)=f_X(x)f_Y(y) f X , Y ( x , y ) = f X ( x ) f Y ( y ) 。等價地,知道 Y Y Y 不會改變 X X X 的條件分佈。獨立性比「兩個變數看起來沒有趨勢」更強,必須由聯合分佈或合理的生成機制支持。
若 X X X 與 Y Y Y 獨立且相關期望存在,任何合適函數 g , h g,h g , h 都滿足 E [ g ( X ) h ( Y ) ] = E [ g ( X ) ] E [ h ( Y ) ] E[g(X)h(Y)]=E[g(X)]E[h(Y)] E [ g ( X ) h ( Y )] = E [ g ( X )] E [ h ( Y )] 。反方向通常不成立:一組特定期望能分解,無法證明整個聯合分佈都能分解。
5.2 共變異數與相關係數
共變異數 Cov ( X , Y ) = E [ ( X − E [ X ] ) ( Y − E [ Y ] ) ] = E [ X Y ] − E [ X ] E [ Y ] \operatorname{Cov}(X,Y)=E[(X-E[X])(Y-E[Y])]=E[XY]-E[X]E[Y] Cov ( X , Y ) = E [( X − E [ X ]) ( Y − E [ Y ])] = E [ X Y ] − E [ X ] E [ Y ] 描述線性共同變化。正值表示兩個變數傾向同方向偏離各自平均數,負值表示反方向偏離,零表示沒有線性共同變化。共變異數受單位影響;把公尺換成公分會把共變異數放大 100 倍。
Pearson 相關係數 ρ X , Y = Cov ( X , Y ) / ( σ X σ Y ) \rho_{X,Y}=\operatorname{Cov}(X,Y)/(\sigma_X\sigma_Y) ρ X , Y = Cov ( X , Y ) / ( σ X σ Y ) 消除尺度,並落在 [ − 1 , 1 ] [-1,1] [ − 1 , 1 ] 內,前提是兩個標準差都大於 0。ρ \rho ρ 接近 1 或 -1 表示強線性關係,ρ \rho ρ 接近 0 只表示線性關係弱。相關係數不提供因果方向,也可能被極端值、群組混合或非線性關係誤導。
零相關不代表獨立。令 X X X 在 [ − 1 , 1 ] [-1,1] [ − 1 , 1 ] 上均勻分佈,並令 Y = X 2 Y=X^2 Y = X 2 。對稱性使 E [ X ] = 0 E[X]=0 E [ X ] = 0 與 E [ X 3 ] = 0 E[X^3]=0 E [ X 3 ] = 0 ,所以 Cov ( X , Y ) = E [ X 3 ] − E [ X ] E [ X 2 ] = 0 \operatorname{Cov}(X,Y)=E[X^3]-E[X]E[X^2]=0 Cov ( X , Y ) = E [ X 3 ] − E [ X ] E [ X 2 ] = 0 ;但 Y Y Y 完全由 X X X 決定,兩者顯然不獨立。獨立且二階動差存在會推出零共變異數;只有在多元 Normal 等額外條件成立時,零共變異數才足以推出獨立。
5.3 共變異數矩陣與線性組合
對 d d d 維隨機向量 X \mathbf X X ,平均向量記為 μ = E [ X ] \boldsymbol\mu=E[\mathbf X] μ = E [ X ] ,共變異數矩陣記為 Σ = E [ ( X − μ ) ( X − μ ) T ] \boldsymbol\Sigma=E[(\mathbf X-\boldsymbol\mu)(\mathbf X-\boldsymbol\mu)^\mathsf T] Σ = E [( X − μ ) ( X − μ ) T ] 。矩陣元素 Σ i j = Cov ( X i , X j ) \Sigma_{ij}=\operatorname{Cov}(X_i,X_j) Σ ij = Cov ( X i , X j ) ;對角線是各分量的變異數,非對角線是成對共變異數。共變異數矩陣必定對稱且半正定,因此任意向量 a \mathbf a a 都滿足 Var ( a T X ) = a T Σ a ≥ 0 \operatorname{Var}(\mathbf a^\mathsf T\mathbf X)=\mathbf a^\mathsf T\boldsymbol\Sigma\mathbf a\ge0 Var ( a T X ) = a T Σ a ≥ 0 。多元 Normal 分佈 N d ( μ , Σ ) N_d(\boldsymbol\mu,\boldsymbol\Sigma) N d ( μ , Σ ) 由平均向量和共變異數矩陣決定;在該分佈族內,零共變異數也會推出對應分量獨立。
假設兩台服務的每分鐘負載分別為 X 1 , X 2 X_1,X_2 X 1 , X 2 ,標準差都是 10。若相關係數為 0.8,兩者總負載的變異數是 10 2 + 10 2 + 2 ( 0.8 ) ( 10 ) ( 10 ) = 360 10^2+10^2+2(0.8)(10)(10)=360 1 0 2 + 1 0 2 + 2 ( 0.8 ) ( 10 ) ( 10 ) = 360 ,標準差約為 18.97;若兩者獨立,總負載標準差是 200 ≈ 14.14 \sqrt{200}\approx14.14 200 ≈ 14.14 。單機波動相同,正相關仍會提高總容量的不確定性。資源配置、投資組合與多感測器融合都需要保留共變異數矩陣,不能只分別保存每個分量的標準差。
分佈描述可能值及其機率,數值摘要壓縮分佈特徵,聯合分佈則補上多個變數共同出現的規律。完成三層區分後,後續的參數估計、信賴區間、大數定律與中心極限定理才有清楚的對象:資料來自哪個分佈、未知參數是什麼,以及統計量在重複抽樣下如何變化。