機率論研究不確定性,但「不確定」不代表無法分析。機率模型先列出可能結果,再用數值描述不同結果出現的可能性。統計學則從已經觀察到的資料反推模型、估計未知參數,或判斷某個假設是否可信。

初學者常直接背排列組合或分佈公式,卻沒有分清楚樣本、事件、隨機變數和觀測值。概念混用會讓條件機率、期望值、統計推斷與隨機過程變得難以理解。本文先建立一套可以反覆使用的語言,再用擲骰子、品質檢測與伺服器請求等例子完成計算。

1. 從隨機試驗到機率空間

1.1 隨機試驗與樣本空間

一次操作如果在執行前無法確定結果,就可以視為隨機試驗(random experiment)。典型例子包括擲一顆骰子並記錄點數、抽取一件產品並檢查是否合格、記錄伺服器下一分鐘收到的請求數,以及測量一顆電子元件的壽命。機率模型需要清楚定義「一次試驗」和「要記錄的結果」;含糊的試驗定義無法產生含義明確的機率。

隨機試驗所有可能結果的集合稱為樣本空間(sample space),通常記為 Ω\Omega;樣本空間中的單個結果記為 ω\omega。擲一顆六面骰子的樣本空間是 Ω={1,2,3,4,5,6}\Omega=\{1,2,3,4,5,6\}。擲兩顆可區分的骰子時,可以用 Ω={(i,j):i,j{1,2,3,4,5,6}}\Omega=\{(i,j):i,j\in\{1,2,3,4,5,6\}\} 表示 36 個有序結果。(1,6)(1,6)(6,1)(6,1) 是不同結果,雖然兩個結果的點數和都是 7。

樣本空間也可以是無限集合。重複擲硬幣直到第一次正面,可以用 {1,2,3,}\{1,2,3,\dots\} 表示等待次數;電子元件壽命可以用 [0,)[0,\infty) 表示;一段時間內的溫度曲線則需要用函數集合表示。有限樣本空間適合用計數處理,連續或函數型樣本空間需要密度、積分和測度等工具。

1.2 事件與集合運算

**事件(event)**是樣本空間的子集合。擲一顆骰子時,令 A={2,4,6}A=\{2,4,6\} 表示「點數為偶數」,令 B={4,5,6}B=\{4,5,6\} 表示「點數大於 3」。觀測結果落在事件集合內,就表示事件發生。

集合表示事件含義
ABA\cap BAABB 同時發生
ABA\cup BAABB 至少一個發生
AcA^cAA 不發生
ABA\setminus BAA 發生但 BB 不發生
AB=A\cap B=\varnothingAABB 不可能同時發生

上例滿足 AB={4,6}A\cap B=\{4,6\},因此「偶數且大於 3」包含點數 4 和 6。

有限樣本空間通常可以把所有子集合都當作事件。無限樣本空間中存在無法一致賦予機率的病態集合,因此嚴格的機率模型會指定一個事件集合族 F\mathcal FF\mathcal F 對補集與可數聯集封閉,稱為 σ\sigma-algebra。初學階段可以把 F\mathcal F 理解為模型允許詢問並能賦予機率的事件集合。

1.3 機率測度與等可能假設

機率測度 PP 把事件 AFA\in\mathcal F 映射成 [0,1][0,1] 內的數值。Kolmogorov 公理要求非負性 P(A)0P(A)\ge 0、規範化 P(Ω)=1P(\Omega)=1,以及互斥事件的可數可加性。三元組 (Ω,F,P)(\Omega,\mathcal F,P) 稱為機率空間(probability space)

公理可以推出 P(Ac)=1P(A)P(A^c)=1-P(A)P(AB)=P(A)+P(B)P(AB)P(A\cup B)=P(A)+P(B)-P(A\cap B)。聯集公式減去交集,因為直接把 P(A)P(A)P(B)P(B) 相加會重複計算交集。

有限樣本空間中的基本結果若等可能,便可使用 P(A)=A/ΩP(A)=|A|/|\Omega|。兩顆公平骰子的 36 個有序結果等可能,而點數和並不等可能。和為 7 有 (1,6),(2,5),(3,4),(4,3),(5,2),(6,1)(1,6),(2,5),(3,4),(4,3),(5,2),(6,1) 六種結果,所以 P(D1+D2=7)=6/36=1/6P(D_1+D_2=7)=6/36=1/6;和為 2 只有 (1,1)(1,1) 一種結果。把 2 到 12 當成 11 個等可能的和會得到錯誤答案。

計數公式不能套用到不均勻骰子、故障率不同的元件或連續測量。使用排列組合之前,必須先確認有限與等可能假設。

2. 隨機變數與分佈

2.1 隨機變數是函數

**隨機變數(random variable)**不是一個隨機改變的符號,而是從樣本空間映射到數值集合的函數,寫成 X:ΩRX:\Omega\rightarrow\mathbb R。在兩顆骰子的實驗中,可以定義 X(i,j)=i+jX(i,j)=i+j。基本結果是 (2,5)(2,5),隨機變數的觀測值則是 X(2,5)=7X(2,5)=7

同一個樣本空間可以定義多個隨機變數,例如點數和、最大點數、兩顆骰子的差,或第一顆骰子是否為偶數。隨機變數讓研究者忽略不需要的試驗細節,只保留問題關心的數量。

2.2 離散變數、連續變數與 CDF

離散隨機變數的可能值有限或可數,例如骰子點數、請求數與故障次數。離散變數使用機率質量函數(PMF) pX(x)=P(X=x)p_X(x)=P(X=x)

如果 XX 是兩顆公平骰子的點數和,則 pX(2)=1/36p_X(2)=1/36pX(7)=6/36p_X(7)=6/36。PMF 需要對每個可能值累積所有能產生該值的基本結果,並且所有 PMF 值的總和必須等於 1。

連續隨機變數通常在一段區間內取值,例如時間、溫度與電壓。連續變數常使用機率密度函數(PDF) fX(x)f_X(x),而區間機率為 P(aXb)=abfX(x)dxP(a\le X\le b)=\int_a^b f_X(x)\,dx。連續變數的單點機率通常是 0;密度值可以大於 1,真正受到 [0,1][0,1] 限制的是曲線下面積所表示的機率。

任意實值隨機變數都能使用累積分佈函數(CDF) FX(x)=P(Xx)F_X(x)=P(X\le x)。CDF 單調不減,並滿足 limxFX(x)=0\lim_{x\to-\infty}F_X(x)=0limxFX(x)=1\lim_{x\to\infty}F_X(x)=1。離散變數的 CDF 呈階梯狀;如果連續變數具有 PDF,則 FX(x)=xfX(u)duF_X(x)=\int_{-\infty}^{x}f_X(u)\,du

3. 條件機率、獨立性與 Bayes 定理

3.1 條件機率縮小樣本範圍

觀察到事件 BB 已經發生後,事件 AA 的條件機率定義為 P(AB)=P(AB)/P(B)P(A\mid B)=P(A\cap B)/P(B),其中 P(B)>0P(B)>0。條件機率把分析範圍限制在 BB 內,再用 P(B)P(B) 重新規範化機率。

以兩顆公平骰子為例,令 AA 表示「點數和為 8」,令 BB 表示「第一顆骰子為偶數」。事件 BB 含有 18 個等可能結果;同時符合 AABB 的結果為 (2,6),(4,4),(6,2)(2,6),(4,4),(6,2),所以 P(AB)=3/18=1/6P(A\mid B)=3/18=1/6。如果不知道第一顆骰子的奇偶性,則和為 8 有五個結果,P(A)=5/36P(A)=5/36。額外資訊改變了可比較的結果集合,因此也改變事件機率。

乘法公式 P(AB)=P(AB)P(B)P(A\cap B)=P(A\mid B)P(B) 可以延伸到多個事件。對事件序列 A1,,AnA_1,\dots,A_n,聯合機率可以分解為逐步條件機率的乘積。機器學習的自迴歸模型也使用相同的 chain rule,把 token 序列的聯合機率拆成每個 token 在先前 token 條件下的機率。

3.2 獨立性是聯合分佈的條件

事件 AABB 獨立時滿足 P(AB)=P(A)P(B)P(A\cap B)=P(A)P(B)。若 P(B)>0P(B)>0,等價條件是 P(AB)=P(A)P(A\mid B)=P(A):得知 BB 發生不會改變 AA 的機率。

互斥與獨立具有不同含義。兩個具有正機率的互斥事件不可能同時發生,所以 P(AB)=0P(A\cap B)=0,但 P(A)P(B)>0P(A)P(B)>0;互斥事件因此不獨立。獨立性也不能只靠直覺宣告,必須來自抽樣設計、生成機制或可以檢驗的聯合分佈假設。

多個事件的兩兩獨立只要求每一對事件的聯合機率可以分解;相互獨立還要求任意子集合的聯合機率都能分解。相互獨立一定推出兩兩獨立,反向推論通常不成立。

3.3 全機率公式與 Bayes 定理

B1,,BmB_1,\dots,B_m 兩兩互斥且聯集為整個樣本空間,則事件 AA 的機率可以按不同來源拆分:P(A)=iP(ABi)P(Bi)P(A)=\sum_iP(A\mid B_i)P(B_i)。該公式稱為全機率公式

Bayes 定理反轉條件方向:P(BjA)=P(ABj)P(Bj)/P(A)P(B_j\mid A)=P(A\mid B_j)P(B_j)/P(A)。分子由似然 P(ABj)P(A\mid B_j) 與先驗機率 P(Bj)P(B_j) 組成,分母把所有可能來源的聯合機率加總,使後驗機率總和等於 1。

假設某疾病盛行率為 1%,檢測對患者的陽性率為 95%,對非患者的偽陽性率為 5%。令 DD 表示患病,令 ++ 表示陽性。陽性的總機率為 P(+)=0.95×0.01+0.05×0.99=0.059P(+)=0.95\times0.01+0.05\times0.99=0.059,所以陽性後真正患病的機率為 P(D+)=0.95×0.01/0.0590.161P(D\mid +)=0.95\times0.01/0.059\approx0.161。檢測靈敏度很高,陽性者的患病機率仍只有約 16.1%,原因是非患者人數遠多於患者,5% 偽陽性會累積出大量陽性結果。

Bayes 計算需要同時保留基準率與檢測條件機率。只看 P(+D)P(+\mid D) 並把 95% 誤認為 P(D+)P(D\mid +),就是常見的條件方向錯置。

4. 小結:機率空間是後續主題共用的語言

機率空間 (Ω,F,P)(\Omega,\mathcal F,P) 定義可能結果、可詢問事件與機率規則;隨機變數 XX 再把基本結果映射成可分析的數值。PMF、PDF 與 CDF 描述單一隨機變數的分佈,條件機率、獨立性與 Bayes 定理則說明多個事件如何互相影響、如何根據新證據更新機率判斷。樣本空間、事件、機率測度與隨機變數這套語言,是之後討論分佈比較、聯合分佈與統計估計時反覆使用的基礎。

讀者可以接著閱讀隨機過程 1:什麼是隨機過程,把隨機變數延伸成帶索引的隨機變數族;計數型應用可參考隨機過程 9:泊松過程