概率论研究不确定性,但”不确定”不代表无法分析。概率模型先列出可能结果,再用数值描述不同结果出现的可能性。统计学则从已经观察到的数据反推模型、估计未知参数,或判断某个假设是否可信。

初学者常直接背排列组合或分布公式,却没有分清楚样本、事件、随机变量和观测值。概念混用会让条件概率、期望值、统计推断与随机过程变得难以理解。本文先建立一套可以反复使用的语言,再用掷骰子、质量检测与服务器请求等例子完成计算。

1. 从随机试验到概率空间

1.1 随机试验与样本空间

一次操作如果在执行前无法确定结果,就可以视为随机试验(random experiment)。典型例子包括掷一颗骰子并记录点数、抽取一件产品并检查是否合格、记录服务器下一分钟收到的请求数,以及测量一颗电子元件的寿命。概率模型需要清楚定义”一次试验”和”要记录的结果”;含糊的试验定义无法产生含义明确的概率。

随机试验所有可能结果的集合称为样本空间(sample space),通常记为 Ω\Omega;样本空间中的单个结果记为 ω\omega。掷一颗六面骰子的样本空间是 Ω={1,2,3,4,5,6}\Omega=\{1,2,3,4,5,6\}。掷两颗可区分的骰子时,可以用 Ω={(i,j):i,j{1,2,3,4,5,6}}\Omega=\{(i,j):i,j\in\{1,2,3,4,5,6\}\} 表示 36 个有序结果。(1,6)(1,6)(6,1)(6,1) 是不同结果,虽然两个结果的点数和都是 7。

样本空间也可以是无限集合。重复掷硬币直到第一次正面,可以用 {1,2,3,}\{1,2,3,\dots\} 表示等待次数;电子元件寿命可以用 [0,)[0,\infty) 表示;一段时间内的温度曲线则需要用函数集合表示。有限样本空间适合用计数处理,连续或函数型样本空间需要密度、积分和测度等工具。

1.2 事件与集合运算

**事件(event)**是样本空间的子集合。掷一颗骰子时,令 A={2,4,6}A=\{2,4,6\} 表示”点数为偶数”,令 B={4,5,6}B=\{4,5,6\} 表示”点数大于 3”。观测结果落在事件集合内,就表示事件发生。

集合表示事件含义
ABA\cap BAABB 同时发生
ABA\cup BAABB 至少一个发生
AcA^cAA 不发生
ABA\setminus BAA 发生但 BB 不发生
AB=A\cap B=\varnothingAABB 不可能同时发生

上例满足 AB={4,6}A\cap B=\{4,6\},因此”偶数且大于 3”包含点数 4 和 6。

有限样本空间通常可以把所有子集合都当作事件。无限样本空间中存在无法一致赋予概率的病态集合,因此严格的概率模型会指定一个事件集合族 F\mathcal FF\mathcal F 对补集与可数并集封闭,称为 σ\sigma-代数。初学阶段可以把 F\mathcal F 理解为模型允许询问并能赋予概率的事件集合。

1.3 概率测度与等可能假设

概率测度 PP 把事件 AFA\in\mathcal F 映射成 [0,1][0,1] 内的数值。柯尔莫哥洛夫公理要求非负性 P(A)0P(A)\ge 0、规范化 P(Ω)=1P(\Omega)=1,以及互斥事件的可数可加性。三元组 (Ω,F,P)(\Omega,\mathcal F,P) 称为概率空间(probability space)

公理可以推出 P(Ac)=1P(A)P(A^c)=1-P(A)P(AB)=P(A)+P(B)P(AB)P(A\cup B)=P(A)+P(B)-P(A\cap B)。并集公式减去交集,因为直接把 P(A)P(A)P(B)P(B) 相加会重复计算交集。

有限样本空间中的基本结果若等可能,便可使用 P(A)=A/ΩP(A)=|A|/|\Omega|。两颗公平骰子的 36 个有序结果等可能,而点数和并不等可能。和为 7 有 (1,6),(2,5),(3,4),(4,3),(5,2),(6,1)(1,6),(2,5),(3,4),(4,3),(5,2),(6,1) 六种结果,所以 P(D1+D2=7)=6/36=1/6P(D_1+D_2=7)=6/36=1/6;和为 2 只有 (1,1)(1,1) 一种结果。把 2 到 12 当成 11 个等可能的和会得到错误答案。

计数公式不能套用到不均匀骰子、故障率不同的元件或连续测量。使用排列组合之前,必须先确认有限与等可能假设。

2. 随机变量与分布

2.1 随机变量是函数

**随机变量(random variable)**不是一个随机改变的符号,而是从样本空间映射到数值集合的函数,写成 X:ΩRX:\Omega\rightarrow\mathbb R。在两颗骰子的实验中,可以定义 X(i,j)=i+jX(i,j)=i+j。基本结果是 (2,5)(2,5),随机变量的观测值则是 X(2,5)=7X(2,5)=7

同一个样本空间可以定义多个随机变量,例如点数和、最大点数、两颗骰子的差,或第一颗骰子是否为偶数。随机变量让研究者忽略不需要的试验细节,只保留问题关心的数量。

2.2 离散变量、连续变量与 CDF

离散随机变量的可能值有限或可数,例如骰子点数、请求数与故障次数。离散变量使用概率质量函数(PMF) pX(x)=P(X=x)p_X(x)=P(X=x)

如果 XX 是两颗公平骰子的点数和,则 pX(2)=1/36p_X(2)=1/36pX(7)=6/36p_X(7)=6/36。PMF 需要对每个可能值累积所有能产生该值的基本结果,并且所有 PMF 值的总和必须等于 1。

连续随机变量通常在一段区间内取值,例如时间、温度与电压。连续变量常使用概率密度函数(PDF) fX(x)f_X(x),而区间概率为 P(aXb)=abfX(x)dxP(a\le X\le b)=\int_a^b f_X(x)\,dx。连续变量的单点概率通常是 0;密度值可以大于 1,真正受到 [0,1][0,1] 限制的是曲线下面积所表示的概率。

任意实值随机变量都能使用累积分布函数(CDF) FX(x)=P(Xx)F_X(x)=P(X\le x)。CDF 单调不减,并满足 limxFX(x)=0\lim_{x\to-\infty}F_X(x)=0limxFX(x)=1\lim_{x\to\infty}F_X(x)=1。离散变量的 CDF 呈阶梯状;如果连续变量具有 PDF,则 FX(x)=xfX(u)duF_X(x)=\int_{-\infty}^{x}f_X(u)\,du

3. 条件概率、独立性与贝叶斯定理

3.1 条件概率缩小样本范围

观察到事件 BB 已经发生后,事件 AA 的条件概率定义为 P(AB)=P(AB)/P(B)P(A\mid B)=P(A\cap B)/P(B),其中 P(B)>0P(B)>0。条件概率把分析范围限制在 BB 内,再用 P(B)P(B) 重新规范化概率。

以两颗公平骰子为例,令 AA 表示”点数和为 8”,令 BB 表示”第一颗骰子为偶数”。事件 BB 含有 18 个等可能结果;同时符合 AABB 的结果为 (2,6),(4,4),(6,2)(2,6),(4,4),(6,2),所以 P(AB)=3/18=1/6P(A\mid B)=3/18=1/6。如果不知道第一颗骰子的奇偶性,则和为 8 有五个结果,P(A)=5/36P(A)=5/36。额外信息改变了可比较的结果集合,因此也改变事件概率。

乘法公式 P(AB)=P(AB)P(B)P(A\cap B)=P(A\mid B)P(B) 可以延伸到多个事件。对事件序列 A1,,AnA_1,\dots,A_n,联合概率可以分解为逐步条件概率的乘积。机器学习的自回归模型也使用相同的 chain rule,把 token 序列的联合概率拆成每个 token 在先前 token 条件下的概率。

3.2 独立性是联合分布的条件

事件 AABB 独立时满足 P(AB)=P(A)P(B)P(A\cap B)=P(A)P(B)。若 P(B)>0P(B)>0,等价条件是 P(AB)=P(A)P(A\mid B)=P(A):得知 BB 发生不会改变 AA 的概率。

互斥与独立具有不同含义。两个具有正概率的互斥事件不可能同时发生,所以 P(AB)=0P(A\cap B)=0,但 P(A)P(B)>0P(A)P(B)>0;互斥事件因此不独立。独立性也不能只靠直觉宣称,必须来自抽样设计、生成机制或可以检验的联合分布假设。

多个事件的两两独立只要求每一对事件的联合概率可以分解;相互独立还要求任意子集合的联合概率都能分解。相互独立一定推出两两独立,反向推论通常不成立。

3.3 全概率公式与贝叶斯定理

B1,,BmB_1,\dots,B_m 两两互斥且并集为整个样本空间,则事件 AA 的概率可以按不同来源拆分:P(A)=iP(ABi)P(Bi)P(A)=\sum_iP(A\mid B_i)P(B_i)。该公式称为全概率公式

贝叶斯定理反转条件方向:P(BjA)=P(ABj)P(Bj)/P(A)P(B_j\mid A)=P(A\mid B_j)P(B_j)/P(A)。分子由似然 P(ABj)P(A\mid B_j) 与先验概率 P(Bj)P(B_j) 组成,分母把所有可能来源的联合概率加总,使后验概率总和等于 1。

假设某疾病患病率为 1%,检测对患者的阳性率为 95%,对非患者的假阳性率为 5%。令 DD 表示患病,令 ++ 表示阳性。阳性的总概率为 P(+)=0.95×0.01+0.05×0.99=0.059P(+)=0.95\times0.01+0.05\times0.99=0.059,所以阳性后真正患病的概率为 P(D+)=0.95×0.01/0.0590.161P(D\mid +)=0.95\times0.01/0.059\approx0.161。检测灵敏度很高,阳性者的患病概率仍只有约 16.1%,原因是非患者人数远多于患者,5% 假阳性会累积出大量阳性结果。

贝叶斯计算需要同时保留基准率与检测条件概率。只看 P(+D)P(+\mid D) 并把 95% 误认为 P(D+)P(D\mid +),就是常见的条件方向错置。

4. 小结:概率空间是后续主题共用的语言

概率空间 (Ω,F,P)(\Omega,\mathcal F,P) 定义可能结果、可询问事件与概率规则;随机变量 XX 再把基本结果映射成可分析的数值。PMF、PDF 与 CDF 描述单一随机变量的分布,条件概率、独立性与贝叶斯定理则说明多个事件如何互相影响、如何根据新证据更新概率判断。样本空间、事件、概率测度与随机变量这套语言,是之后讨论分布比较、联合分布与统计估计时反复使用的基础。

读者可以接着阅读随机过程 1:什么是随机过程,把随机变量延伸成带索引的随机变量族;计数型应用可参考随机过程 9:泊松过程