機率論研究不確定性,但「不確定」不代表無法分析。機率模型先列出可能結果,再用數值描述不同結果出現的可能性。統計學則從已經觀察到的資料反推模型、估計未知參數,或判斷某個假設是否可信。
初學者常直接背排列組合或分佈公式,卻沒有分清楚樣本、事件、隨機變數和觀測值。概念混用會讓條件機率、期望值、統計推斷與隨機過程變得難以理解。本文先建立一套可以反覆使用的語言,再用擲骰子、品質檢測與伺服器請求等例子完成計算。
1. 從隨機試驗到機率空間
1.1 隨機試驗與樣本空間
一次操作如果在執行前無法確定結果,就可以視為隨機試驗(random experiment)。典型例子包括擲一顆骰子並記錄點數、抽取一件產品並檢查是否合格、記錄伺服器下一分鐘收到的請求數,以及測量一顆電子元件的壽命。機率模型需要清楚定義「一次試驗」和「要記錄的結果」;含糊的試驗定義無法產生含義明確的機率。
隨機試驗所有可能結果的集合稱為樣本空間(sample space),通常記為 ;樣本空間中的單個結果記為 。擲一顆六面骰子的樣本空間是 。擲兩顆可區分的骰子時,可以用 表示 36 個有序結果。 與 是不同結果,雖然兩個結果的點數和都是 7。
樣本空間也可以是無限集合。重複擲硬幣直到第一次正面,可以用 表示等待次數;電子元件壽命可以用 表示;一段時間內的溫度曲線則需要用函數集合表示。有限樣本空間適合用計數處理,連續或函數型樣本空間需要密度、積分和測度等工具。
1.2 事件與集合運算
**事件(event)**是樣本空間的子集合。擲一顆骰子時,令 表示「點數為偶數」,令 表示「點數大於 3」。觀測結果落在事件集合內,就表示事件發生。
| 集合表示 | 事件含義 |
|---|---|
| 與 同時發生 | |
| 或 至少一個發生 | |
| 不發生 | |
| 發生但 不發生 | |
| 與 不可能同時發生 |
上例滿足 ,因此「偶數且大於 3」包含點數 4 和 6。
有限樣本空間通常可以把所有子集合都當作事件。無限樣本空間中存在無法一致賦予機率的病態集合,因此嚴格的機率模型會指定一個事件集合族 。 對補集與可數聯集封閉,稱為 -algebra。初學階段可以把 理解為模型允許詢問並能賦予機率的事件集合。
1.3 機率測度與等可能假設
機率測度 把事件 映射成 內的數值。Kolmogorov 公理要求非負性 、規範化 ,以及互斥事件的可數可加性。三元組 稱為機率空間(probability space)。
公理可以推出 和 。聯集公式減去交集,因為直接把 與 相加會重複計算交集。
有限樣本空間中的基本結果若等可能,便可使用 。兩顆公平骰子的 36 個有序結果等可能,而點數和並不等可能。和為 7 有 六種結果,所以 ;和為 2 只有 一種結果。把 2 到 12 當成 11 個等可能的和會得到錯誤答案。
計數公式不能套用到不均勻骰子、故障率不同的元件或連續測量。使用排列組合之前,必須先確認有限與等可能假設。
2. 隨機變數與分佈
2.1 隨機變數是函數
**隨機變數(random variable)**不是一個隨機改變的符號,而是從樣本空間映射到數值集合的函數,寫成 。在兩顆骰子的實驗中,可以定義 。基本結果是 ,隨機變數的觀測值則是 。
同一個樣本空間可以定義多個隨機變數,例如點數和、最大點數、兩顆骰子的差,或第一顆骰子是否為偶數。隨機變數讓研究者忽略不需要的試驗細節,只保留問題關心的數量。
2.2 離散變數、連續變數與 CDF
離散隨機變數的可能值有限或可數,例如骰子點數、請求數與故障次數。離散變數使用機率質量函數(PMF) 。
如果 是兩顆公平骰子的點數和,則 、。PMF 需要對每個可能值累積所有能產生該值的基本結果,並且所有 PMF 值的總和必須等於 1。
連續隨機變數通常在一段區間內取值,例如時間、溫度與電壓。連續變數常使用機率密度函數(PDF) ,而區間機率為 。連續變數的單點機率通常是 0;密度值可以大於 1,真正受到 限制的是曲線下面積所表示的機率。
任意實值隨機變數都能使用累積分佈函數(CDF) 。CDF 單調不減,並滿足 與 。離散變數的 CDF 呈階梯狀;如果連續變數具有 PDF,則 。
3. 條件機率、獨立性與 Bayes 定理
3.1 條件機率縮小樣本範圍
觀察到事件 已經發生後,事件 的條件機率定義為 ,其中 。條件機率把分析範圍限制在 內,再用 重新規範化機率。
以兩顆公平骰子為例,令 表示「點數和為 8」,令 表示「第一顆骰子為偶數」。事件 含有 18 個等可能結果;同時符合 與 的結果為 ,所以 。如果不知道第一顆骰子的奇偶性,則和為 8 有五個結果,。額外資訊改變了可比較的結果集合,因此也改變事件機率。
乘法公式 可以延伸到多個事件。對事件序列 ,聯合機率可以分解為逐步條件機率的乘積。機器學習的自迴歸模型也使用相同的 chain rule,把 token 序列的聯合機率拆成每個 token 在先前 token 條件下的機率。
3.2 獨立性是聯合分佈的條件
事件 與 獨立時滿足 。若 ,等價條件是 :得知 發生不會改變 的機率。
互斥與獨立具有不同含義。兩個具有正機率的互斥事件不可能同時發生,所以 ,但 ;互斥事件因此不獨立。獨立性也不能只靠直覺宣告,必須來自抽樣設計、生成機制或可以檢驗的聯合分佈假設。
多個事件的兩兩獨立只要求每一對事件的聯合機率可以分解;相互獨立還要求任意子集合的聯合機率都能分解。相互獨立一定推出兩兩獨立,反向推論通常不成立。
3.3 全機率公式與 Bayes 定理
若 兩兩互斥且聯集為整個樣本空間,則事件 的機率可以按不同來源拆分:。該公式稱為全機率公式。
Bayes 定理反轉條件方向:。分子由似然 與先驗機率 組成,分母把所有可能來源的聯合機率加總,使後驗機率總和等於 1。
假設某疾病盛行率為 1%,檢測對患者的陽性率為 95%,對非患者的偽陽性率為 5%。令 表示患病,令 表示陽性。陽性的總機率為 ,所以陽性後真正患病的機率為 。檢測靈敏度很高,陽性者的患病機率仍只有約 16.1%,原因是非患者人數遠多於患者,5% 偽陽性會累積出大量陽性結果。
Bayes 計算需要同時保留基準率與檢測條件機率。只看 並把 95% 誤認為 ,就是常見的條件方向錯置。
4. 小結:機率空間是後續主題共用的語言
機率空間 定義可能結果、可詢問事件與機率規則;隨機變數 再把基本結果映射成可分析的數值。PMF、PDF 與 CDF 描述單一隨機變數的分佈,條件機率、獨立性與 Bayes 定理則說明多個事件如何互相影響、如何根據新證據更新機率判斷。樣本空間、事件、機率測度與隨機變數這套語言,是之後討論分佈比較、聯合分佈與統計估計時反覆使用的基礎。
讀者可以接著閱讀隨機過程 1:什麼是隨機過程,把隨機變數延伸成帶索引的隨機變數族;計數型應用可參考隨機過程 9:泊松過程。