Appearance
#目录
概率论与随机现象:从基础到中心极限定理
大纲阅读说明
本大纲按 “基本概念 → 条件概率与公式 → 随机变量 → 常见分布 → 极限定理” 的逻辑链条组织,已对你给出的术语进行排序、归类与补充。每个一级标题下的 Callout 会解释该部分的设计思路,并给出典型例子,确保达到教科书级别的严密性。
1. 随机事件与概率的基本语言
设计逻辑
这一部分是整个概率论的基石。我们首先定义什么是“随机事件”,然后通过分类(互斥、对立、独立)掌握事件之间的结构关系,最后用“等可能事件”引出概率的古典定义。此外补充概率的公理化体系,确保所有后续公式都有严格基础。
1.1 随机事件与样本空间
- 随机试验:可在相同条件下重复进行、结果不止一个且事先无法确定、但所有可能结果已知的试验。
- 样本空间 $\Omega$:随机试验所有可能结果的集合。
- 例:掷一枚硬币两次,$\Omega = \lbrace HH, HT, TH, TT\rbrace $。
- 样本点:$\Omega$中的单个结果,记为$\omega$。
- 随机事件 $A$:样本空间的子集,即某些样本点的集合。
- 例:“至少出现一次正面”对应 $A = \lbrace HH, HT, TH\rbrace $。
- 必然事件与不可能事件:$\Omega$本身是必然事件,空集$\varnothing$ 是不可能事件。
- 事件的关系与运算(与集合论对应):
- 和事件 $A \cup B$:$A$与$B$ 至少有一个发生。
- 积事件 $A \cap B$(或 $AB$):$A$与$B$ 同时发生。
- 差事件 $A \setminus B$:$A$发生而$B$ 不发生。
- 补事件 $\bar{A} = \Omega \setminus A$:$A$ 不发生。
1.2 概率的公理化定义(补充内容)
公理化体系(柯尔莫哥洛夫,1933)
- 公理 1(非负性):对任意事件 $A$,有 $P(A) \ge 0$。
- 公理 2(规范性):$P(\Omega) = 1$。
- 公理 3(可列可加性):若 $A_1, A_2, \dots$两两互斥,则$P(\bigcup_{i=1}^{\infty} A_i) = \sum_{i=1}^{\infty} P(A_i)$。
由公理可推出概率的基本性质:
- $P(\varnothing) = 0$;
- 有限可加性:两两互斥事件之和的概率等于各自概率之和;
- 单调性:若 $A \subseteq B$,则 $P(A) \le P(B)$;
- 减法公式:$P(A - B) = P(A) - P(AB)$;
- 加法公式:$P(A \cup B) = P(A) + P(B) - P(AB)$。
1.3 等可能事件(古典概型)
- 定义:样本空间有限,且每个样本点发生的可能性相等。
- 概率计算:若 $|\Omega|=n$,事件 $A$包含$k$ 个基本事件,则
$$P(A) = \frac{k}{n}.$$- 例:掷一颗公平骰子,出现偶数点的概率 $P(\lbrace 2,4,6\rbrace ) = \frac{3}{6} = \frac{1}{2}$。
1.4 互斥事件与对立事件
- 互斥事件:$A \cap B = \varnothing$,即两个事件不可能同时发生。
- 例:掷骰子,“出现 1 点”与“出现 6 点”互斥。
- 对立事件:$\bar{A} = \Omega \setminus A$,满足 $A \cap \bar{A} = \varnothing$且$A \cup \bar{A} = \Omega$。
- 概率性质:$P(\bar{A}) = 1 - P(A)$。
- 关键区别:对立一定互斥,但互斥不一定对立(除非它们的并是整个样本空间)。
1.5 独立事件
- 定义:事件 $A$与$B$满足$P(A \cap B) = P(A)P(B)$,则称 $A,B$ 相互独立。
- 直觉:一个事件的发生不影响另一个事件发生的概率。
- 推广:$n$ 个事件相互独立要求任意有限个交的概率等于各自概率的乘积。
- 注意:独立不能与互斥混淆;若 $A,B$互斥且各自概率大于零,则它们一定不独立(因为$P(AB)=0 \ne P(A)P(B)$)。
- 例:抛两枚硬币,第一枚正面与第二枚正面独立;掷一颗骰子,“点数为偶数”与“点数大于 3”不独立。
2. 条件概率与三大核心公式
设计逻辑
条件概率是更新信念的数学工具。全概率公式用于“由因推果”,贝叶斯公式用于“由果溯因”。这三者共同构成了概率推理的骨架。
2.1 条件概率
- 定义:在事件 $B$发生的条件下,事件$A$ 的概率为
$$P(A|B) = \frac{P(A \cap B)}{P(B)}, \quad P(B) > 0.$$ - 直观:将样本空间缩小到 $B$中,再考察$A$ 的比例。
- 例:一副扑克抽一张,已知抽到的是红色牌,问是红桃的概率。
$P(\text{红桃}|\text{红色}) = \frac{13/52}{26/52} = \frac{1}{2}$。 - 乘法公式:由定义可得 $P(A \cap B) = P(B) P(A|B) = P(A) P(B|A)$,可推广到多个事件。
2.2 全概率公式
- 作用:将复杂事件的概率分解为互斥的“条件”之和。
- 公式:若 $B_1, B_2, \dots, B_n$是样本空间的一个划分(互斥且穷尽,即$\bigcup_{i=1}^n B_i = \Omega$,且 $B_i \cap B_j = \varnothing$对$i \ne j$),则对任意事件 $A$,有
$$P(A) = \sum_{i=1}^n P(A|B_i) P(B_i).$$ - 例:某产品由三条生产线生产,产量占比分别为 30%、30%、40%,次品率分别为 2%、1%、3%。随机抽一件,总次品率
$P(\text{次品}) = 0.3\times0.02 + 0.3\times0.01 + 0.4\times0.03 = 0.021$。
2.3 贝叶斯公式
- 作用:在已知结果 $A$发生后,反推某个原因$B_j$ 的概率(后验概率)。
- 公式:
$$P(B_j|A) = \frac{P(A|B_j)P(B_j)}{\sum_{i=1}^n P(A|B_i)P(B_i)}.$$ - 术语:$P(B_j)$ 称为先验概率,$P(B_j|A)$ 称为后验概率。
- 例:接上例,若抽到一件次品,它是生产线 3 产出的概率为
$$P(B_3|次品) = \frac{0.4 \times 0.03}{0.021} \approx 0.571.$$ 贝叶斯公式揭示了“证据”如何更新我们的信念。
3. 随机变量及其数字特征
设计逻辑
事件是用集合描述的,不够简洁。引入“随机变量”可以将结果映射为实数,从而用数学分析的工具研究概率。期望与方差是描述随机变量最核心的两个数字特征。
3.1 随机变量的概念
- 定义:从样本空间 $\Omega$到实数集$\mathbb{R}$的函数$X: \Omega \to \mathbb{R}$。
- 离散型:取值可数(如掷骰子点数)。对应 概率质量函数 $p(x) = P(X=x)$,满足 $\sum_x p(x) = 1$。
- 连续型:取值充满区间。对应 概率密度函数 $f(x)$,满足 $f(x) \ge 0$且$\int_{-\infty}^{\infty} f(x)\thinspace{}dx = 1$。概率通过积分求得:$P(a \le X \le b) = \int_a^b f(x)\thinspace{}dx$。
- 累积分布函数 (CDF)(补充重要概念):
- 定义:$F(x) = P(X \le x)$,$x \in \mathbb{R}$。
- 性质:单调不减、右连续、$\lim_{x\to -\infty}F(x)=0$,$\lim_{x\to \infty}F(x)=1$。
- 离散型:$F(x)$ 是阶梯函数;连续型:$F(x)$连续,且$f(x) = F'(x)$ 几乎处处成立。
3.2 期望与方差
- 期望 $E[X]$:随机变量取值的“加权平均”,代表中心位置。
- 离散:$E[X] = \sum_x x \cdot p(x)$
- 连续:$E[X] = \int_{-\infty}^{\infty} x f(x)\thinspace{}dx$
- 方差 $\text{Var}(X)$:衡量取值围绕期望的离散程度。
- 定义:$\text{Var}(X) = E[(X - E[X])^2]$
- 计算式:$\text{Var}(X) = E[X^2] - (E[X])^2$
- 标准差:$\sigma = \sqrt{\text{Var}(X)}$
- 期望与方差的性质(部分):
- 线性:$E[aX + b] = aE[X] + b$
- 方差缩放:$\text{Var}(aX + b) = a^2 \text{Var}(X)$(常数对方差无影响)
- 独立变量的和:若 $X$与$Y$独立,则$E[XY]=E[X]E[Y]$,$\text{Var}(X+Y)=\text{Var}(X)+\text{Var}(Y)$
- 例:公平骰子点数的期望 $E[X] = 3.5$,方差 $\text{Var}(X) \approx 2.92$。
4. 重要离散分布:二项分布与泊松分布
设计逻辑
二项分布是“$n$次独立重复试验成功次数”的精确模型,累积二项分布用于计算“成功次数不超过某个值”的概率。当$n$很大而$p$ 很小时,泊松分布可作为二项分布的极佳近似,并描述单位时间内随机事件的发生次数。
4.1 伯努利试验与二项分布
- 伯努利试验:一次只有“成功”或“失败”两种结果的试验,成功概率为 $p$。
- 二项分布 $X \sim \text{Binomial}(n,p)$:$n$ 重伯努利试验中成功的总次数。
- 概率质量函数:$P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k=0,1,\dots,n$
- 例:抛硬币 10 次,正面朝上次数服从 $n=10, p=0.5$ 的二项分布。
- 二项累积分布函数:
$$F(x) = P(X \le x) = \sum_{k=0}^{\lfloor x \rfloor} \binom{n}{k} p^k (1-p)^{n-k}$$ 用于计算“最多成功 $x$ 次”的概率。 - 数字特征(补充):
- $E[X] = np$
- $\text{Var}(X) = np(1-p)$
4.2 泊松分布与泊松概率
- 泊松分布 $X \sim \text{Poisson}(\lambda)$:
- 概率质量函数:$P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \quad k=0,1,2,\dots$
- 参数 $\lambda > 0$ 表示单位时间(或空间)内事件发生的平均次数。
- 泊松概率:即 $P(X = k)$ 的具体数值。
- 例:某客服中心平均每小时接听 5 个电话,下一小时接到 8 个电话的概率为 $P(X=8)=\frac{5^8 e^{-5}}{8!}$。
- 二项分布的泊松近似:当 $n$ 大、$p$小且$np \approx \lambda$ 时,$\text{Binomial}(n,p) \approx \text{Poisson}(np)$。此近似在 $n \ge 20, p \le 0.05$ 时已较为准确。
- 数字特征(补充):
- $E[X] = \lambda$
- $\text{Var}(X) = \lambda$ (均值与方差相等是泊松分布的显著特征)
5. 正态分布、反正态与极限定理
设计逻辑
正态分布是连续型分布的核心。你提到的“高斯曲线”就是它的密度函数图像。“反正态分布”通常指正态分布的分位数函数(逆累积分布),用来已知概率求临界值。中心极限定理则解释了正态分布为何无处不在:大量独立随机变量的均值近似服从正态分布。本章还补充大数定律,它告诉我们频率如何逼近概率。
5.1 正态分布(高斯曲线)
- 记法:$X \sim \mathcal{N}(\mu, \sigma^2)$,其中 $\mu$ 为均值,$\sigma^2$ 为方差($\sigma > 0$)。
- 概率密度函数:
$$f(x) = \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}}, \quad x \in \mathbb{R}.$$ - 高斯曲线:密度函数的图像呈钟形,关于直线 $x=\mu$对称,在$x=\mu \pm \sigma$ 处有拐点。$\sigma$ 越大越扁平。
- 标准正态分布:$\mu=0, \sigma=1$,记 $Z \sim \mathcal{N}(0,1)$。任何正态变量可通过线性变换标准化:
$$Z = \frac{X-\mu}{\sigma} \sim \mathcal{N}(0,1).$$ - 经验法则(68-95-99.7 规则)(补充):
- 约 68% 的数据落在 $(\mu-\sigma, \mu+\sigma)$ 内;
- 约 95% 落在 $(\mu-2\sigma, \mu+2\sigma)$ 内;
- 约 99.7% 落在 $(\mu-3\sigma, \mu+3\sigma)$ 内。
- 重要性质:正态分布的线性组合仍为正态;独立正态变量之和也服从正态分布。
5.2 反正态分布(逆正态分布 / 分位数函数)
- 定义:给定累积概率 $p$,求对应的 $z$值使得$P(Z \le z) = p$。这个 $z$称为 标准正态的$p$ 分位数(或 逆正态值)。
- 记法:$z_p = \Phi^{-1}(p)$,其中 $\Phi(z) = P(Z \le z)$ 是标准正态的累积分布函数。
- 例:$\Phi^{-1}(0.975) \approx 1.96$,常用于 95% 置信区间的构造。双侧 95% 时,尾部概率每侧 0.025,临界值为 $\pm 1.96$。
- 一般正态的分位数:若 $X \sim \mathcal{N}(\mu,\sigma^2)$,其 $p$分位数为$\mu + \sigma \cdot \Phi^{-1}(p)$。
5.3 大数定律(补充)
直觉
大数定律告诉我们:试验次数足够多时,频率会无限接近概率。这是统计推断的根基。
- 弱大数定律:设 $X_1, X_2, \dots$ 独立同分布,$E[X_i]=\mu$,则对任意 $\varepsilon > 0$, $$\lim_{n\to\infty} P\left( \left| \frac{1}{n}\sum_{i=1}^n X_i - \mu \right| \ge \varepsilon \right) = 0.$$ 即样本均值依概率收敛于 $\mu$。
- 强大数定律:样本均值几乎必然收敛于 $\mu$。
- 例:反复投掷一枚公平硬币,正面频率将逐渐稳定在 0.5 附近。
5.4 中心极限定理
- 基本思想:设独立同分布的随机变量 $X_1, X_2, \dots, X_n$具有均值$\mu$和方差$\sigma^2$(有限),当 $n$足够大时,样本均值$\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i$近似服从正态分布$\mathcal{N}(\mu, \sigma^2/n)$。
- 标准化形式:
$$\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} \mathcal{N}(0,1) \quad \text{当 } n \to \infty.$$ 这里 $\xrightarrow{d}$ 表示依分布收敛。 - 意义:无论原始分布是什么(只要方差有限),大样本下均值的分布都接近正态。这解释了自然界和社会科学中许多数据呈现钟形曲线的原因。
- 应用:二项分布的正态近似。当 $n$ 较大时,$\text{Binomial}(n,p) \approx \mathcal{N}(np, np(1-p))$,常加上连续性校正。
6. 拓展视角:无限猴子问题
设计逻辑
无限猴子问题是独立事件与概率极限思想的趣味体现,可用它来串联独立性、大数定律和极低概率事件的意义。
- 问题陈述:一只猴子在键盘上随机无限次敲击(每次击键独立且等可能),几乎必然(概率为 1)终将打出任意给定的有限文本(如《莎士比亚全集》)。
- 概率模型:
- 设有 $m$个字符,目标文本长度为$L$,每次击键产生特定字符的概率为 $1/m$。
- 将无限次击键分成不重叠的连续 $L$次击键块。每一块恰好打出目标文本的概率$p = (1/m)^L$,是一个极小的正数。
- 不同块之间相互独立。无限次独立尝试中,至少成功一次的概率为 $1 - \prod_{k=1}^\infty (1-p) = 1$。
- 深化理解:
- “几乎必然”并非逻辑必然:存在一种可能——猴子永远只敲字母 a,但该事件的概率为 0。
- 问题的本质是 波莱尔–坎特利引理(Borel–Cantelli):若一系列独立事件发生的概率之和无穷大,则它们会无穷多次发生;这里成功事件虽小,但经无限次尝试后总发生次数无穷。
- 关联概念:独立性、伯努利试验、大数定律、零一律。
推荐学习路径
- 先吃透 第 1 节 的事件分类、概率公理与独立性,形成精确的概率直觉。
- 熟练 第 2 节 三个公式,做到能独立推导并换场景应用(尤其贝叶斯的后验更新思维)。
- 学习随机变量后,将 期望与方差 的性质与具体分布(第 4、5 节)绑定练习,重点掌握二项、泊松和正态的均值与方差。
- 理解 大数定律 如何确保频率稳定性,再上升到 中心极限定理 的“钟形曲线普适性”,并用 无限猴子问题 体会概率论中“无穷”与“几乎必然”的威力。
#正文
1. 随机事件与概率的基本语言
本章目标
建立概率论最基本的概念体系:从随机试验到样本空间,从事件关系到概率公理。掌握这些语言后,我们才能严格地谈论“可能性”。本章的概念是后续一切公式与定理的基石。
1.1 随机事件与样本空间
概率论的研究对象是随机现象——在相同条件下重复进行,结果不止一个且事先无法确定的现象。我们用“试验”来模拟它。
1.1.1 随机试验与样本空间
定义:随机试验
一个随机试验(random experiment)满足三条:
- 可在相同条件下重复进行;
- 所有可能的结果不止一个,且事先能明确所有可能结果;
- 每次试验的具体结果在试验前无法确定。
例 1.1
- $E_1$:掷一枚均匀硬币,观察正反面。
- $E_2$:掷一枚均匀骰子,观察出现的点数。
- $E_3$:记录某城市一天内发生交通事故的次数。
定义:样本空间
随机试验 $E$ 的样本空间(sample space)$\Omega$是该试验所有可能结果的集合。集合中的每个元素称为一个样本点(sample point),记作$\omega$。
样本空间的例子:
- $E_1$:$\Omega_1 = \lbrace \text{正面}, \text{反面} \rbrace $,或用 $\lbrace H, T\rbrace $。
- $E_2$:$\Omega_2 = \lbrace 1, 2, 3, 4, 5, 6\rbrace $。
- $E_3$:$\Omega_3 = \lbrace 0, 1, 2, \dots\rbrace $,所有非负整数。
样本空间可以是有限的、无限可数的,或连续的(如某地的气温,此时 $\Omega = \mathbb{R}$)。
1.1.2 随机事件
试验中我们关心的常常不是单个结果,而是某些结果构成的集合。
定义:随机事件
样本空间 $\Omega$的一个子集$A$称为一个随机事件(random event),简称事件。当且仅当试验结果$\omega \in A$时,称事件$A$ 发生。
特殊事件:
- 基本事件:只包含一个样本点的集合,如 $\lbrace 1\rbrace $。
- 必然事件:$\Omega$ 本身,每次试验必然发生。
- 不可能事件:空集 $\varnothing$,每次试验都不可能发生。
例 1.2 在掷骰子试验中:
- 事件 $A$:“出现的点数为偶数” $= \lbrace 2, 4, 6\rbrace $。
- 事件 $B$:“点数大于 3” $= \lbrace 4, 5, 6\rbrace $。
- 事件 $C$:“点数恰好为 6” $= \lbrace 6\rbrace $。
1.1.3 事件的关系与运算
事件是集合,因此可以自然地用集合的语言进行运算。
| 运算 | 符号 | 定义 | 含义 |
|---|---|---|---|
| 和事件 | $A \cup B$ | $\lbrace \omega \in \Omega \mid \omega \in A \text{ 或 } \omega \in B\rbrace $ | $A$与$B$ 至少有一个发生 |
| 积事件 | $A \cap B$(简记 $AB$) | $\lbrace \omega \mid \omega \in A \text{ 且 } \omega \in B\rbrace $ | $A$与$B$ 同时发生 |
| 差事件 | $A \setminus B$ | $\lbrace \omega \mid \omega \in A \text{ 且 } \omega \notin B\rbrace $ | $A$发生而$B$ 不发生 |
| 补事件(对立事件) | $\bar{A}$ | $\Omega \setminus A$ | $A$ 不发生 |
常用关系
- 若 $A \subseteq B$,则 $A$发生必然导致$B$ 发生。
- $A \cup \bar{A} = \Omega$,$A \cap \bar{A} = \varnothing$。
- 德·摩根律:$\overline{A \cup B} = \bar{A} \cap \bar{B}$,$\overline{A \cap B} = \bar{A} \cup \bar{B}$。
直观:“都不发生”是“至少有一个发生”的否定;“不都发生”是“同时发生”的否定。
例 1.3 掷骰子,$A=\lbrace 2,4,6\rbrace $,$B=\lbrace 4,5,6\rbrace $。则:
- $A \cup B = \lbrace 2,4,5,6\rbrace $(偶数或大于3)
- $A \cap B = \lbrace 4,6\rbrace $(偶数且大于3)
- $\bar{A} = \lbrace 1,3,5\rbrace $(奇数)
1.2 概率的公理化定义
我们不再满足于“可能性大小”的朴素直觉,而是用一组公理严格定义概率。
公理化定义(柯尔莫哥洛夫,1933)
设 $\Omega$ 是样本空间,$\mathcal{F}$是$\Omega$ 上的一个事件域($\sigma$-代数)。概率 $P$是定义在$\mathcal{F}$ 上的一个函数,满足以下三条概率公理:
- 非负性:对任意事件 $A \in \mathcal{F}$,有 $P(A) \ge 0$。
- 规范性:$P(\Omega) = 1$。
- 可列可加性:若 $A_1, A_2, \dots$是一列两两互不相容的事件(即$A_i \cap A_j = \varnothing, i \neq j$),则 $$P\left( \bigcup_{i=1}^{\infty} A_i \right) = \sum_{i=1}^{\infty} P(A_i).$$
解释
公理 1 要求概率不能是负数;公理 2 把必然事件的概率定为 1 作为尺度;公理 3 是无限可加性,它保证了概率在可数个互斥事件上的线性叠加是合理的。对于有限样本空间,可列可加性退化为有限可加性。
由公理导出的基本性质
利用三条公理,可以严格推导出概率的所有基本运算法则。
性质 1.1
$P(\varnothing) = 0$。
证:取 $A_1=\Omega, A_2=\varnothing, A_3=\varnothing,\dots$,它们两两互斥,由可列可加性 $P(\Omega) = P(\Omega) + P(\varnothing) + P(\varnothing) + \cdots$,结合 $P(\Omega)=1$可知$P(\varnothing)=0$。
性质 1.2(有限可加性)
若 $A_1, A_2, \dots, A_n$ 两两互斥,则
$$P\left( \bigcup_{i=1}^{n} A_i \right) = \sum_{i=1}^{n} P(A_i).$$ (取 $A_{n+1}=A_{n+2}=\cdots=\varnothing$ 即可由公理 3 推出。)
性质 1.3(互补性)
$P(\bar{A}) = 1 - P(A)$。
证:$A \cup \bar{A} = \Omega$且二者互斥,故$1 = P(\Omega) = P(A) + P(\bar{A})$。
性质 1.4(单调性)
若 $A \subseteq B$,则 $P(A) \le P(B)$。
证:$B = A \cup (B \setminus A)$ 且两项互斥,$P(B)=P(A)+P(B\setminus A) \ge P(A)$。
性质 1.5(减法公式)
$P(B \setminus A) = P(B) - P(A \cap B)$。特别地,若 $A \subseteq B$,则 $P(B \setminus A) = P(B) - P(A)$。
性质 1.6(一般加法公式)
对任意两个事件 $A, B$,
$$P(A \cup B) = P(A) + P(B) - P(A \cap B).$$ 该公式可以推广到三个事件: $$P(A \cup B \cup C) = P(A)+P(B)+P(C) - P(AB) - P(AC) - P(BC) + P(ABC).$$
例 1.4 已知 $P(A)=0.6$,$P(B)=0.5$,$P(A \cap B)=0.2$。求 $P(A \cup B)$和$P(\bar{A} \cap B)$。
解:$P(A \cup B)=0.6+0.5-0.2=0.9$。
$\bar{A} \cap B$是$B$发生而$A$ 不发生,$P(\bar{A} \cap B) = P(B) - P(A \cap B) = 0.5-0.2=0.3$。
1.3 等可能事件(古典概型)
当样本空间有限且每个基本事件“等可能”时,概率计算化为简单的计数问题。
定义:古典概型(等可能概型)
若样本空间 $\Omega$含有$n$个样本点,且每个样本点发生的概率相等,则对任意事件$A$,有 $$P(A) = \frac{|A|}{|\Omega|} = \frac{\text{有利于 } A \text{ 的基本事件数}}{\text{基本事件总数}}.$$
前提条件:
- 样本空间有限;
- 所有基本事件等可能(由对称性或随机化保证)。
经典例子
- 掷硬币:抛一枚均匀硬币,$P(\text{正面}) = \frac{1}{2}$。
- 掷骰子:出现点数为 3 的倍数(即 3 或 6)的概率 $P = \frac{2}{6} = \frac{1}{3}$。
- 抽牌:从一副 52 张扑克中随机抽一张,是黑桃的概率 $P = \frac{13}{52} = \frac{1}{4}$。
计算关键:计数时需要熟练使用排列组合、加法原理、乘法原理。
例 1.5(放球模型) 将 $r$个球随机放入$n$ 个盒子($r \le n$),每个盒子至多放一个球。求前 $r$ 个盒子各恰有一个球的概率。
解:基本事件总数为从 $n$个位置选$r$ 个排列:$P_n^r = n(n-1)\cdots(n-r+1)$。
有利事件数为 $r$个球恰好放入前$r$个盒子,固定位置只有$r!$ 种排列。
概率 $P = \frac{r!}{n(n-1)\cdots(n-r+1)}$。
1.4 互斥事件与对立事件
1.4.1 互斥事件
定义
若 $A \cap B = \varnothing$,则称事件 $A$与事件$B$ 互斥(mutually exclusive),即两者不可能同时发生。
例 1.6
- 掷一枚硬币,“正面朝上”与“反面朝上”互斥。
- 掷一颗骰子,“点数为 1”与“点数为 2”互斥。
多个事件互斥:指它们两两互斥,即任意两个交集为空。
1.4.2 对立事件
定义
事件 $A$ 的对立事件(complementary event)$\bar{A}$定义为$\Omega \setminus A$。它满足:
- $A \cap \bar{A} = \varnothing$(互斥),
- $A \cup \bar{A} = \Omega$(并集为全集)。
显然,对立事件一定是互斥的,但互斥事件不一定对立,除非它们的并正好是整个样本空间。
对比
- 掷骰子:$A = \lbrace 1,2\rbrace $,则 $\bar{A} = \lbrace 3,4,5,6\rbrace $,这是对立。
- $B = \lbrace 1,2\rbrace $,$C = \lbrace 3,4\rbrace $,它们互斥,但 $B \cup C = \lbrace 1,2,3,4\rbrace \neq \Omega$,所以并非对立。
对立事件概率公式:$P(\bar{A}) = 1 - P(A)$。这是“正难则反”概率计算的基石。
例 1.7 一批产品中有 2% 的次品,随机抽取一件。事件“抽到次品”的对立事件是“抽到正品”,其概率为 $1-0.02=0.98$。
1.5 独立事件
概率论中的“独立”描述的是事件之间发生与否互不影响的性质。
定义:两个事件的独立性
若事件 $A$与$B$ 满足 $$P(A \cap B) = P(A)\thinspace{}P(B),$$ 则称 $A$与$B$ 相互独立(mutually independent)。
直观解释:由条件概率公式 $P(A|B) = P(A \cap B)/P(B)$,当 $P(B)>0$时,独立等价于$P(A|B) = P(A)$,即 $B$的发生不影响$A$ 的概率。反之亦然。
例 1.8(无放回抽样不独立)
袋中有 3 红球 2 白球,依次抽两球,无放回。事件 $A$:第一球为红;事件 $B$:第二球为红。
$P(A)=3/5$;$P(B) = P(B|A)P(A)+P(B|\bar{A})P(\bar{A}) = (2/4)(3/5)+(3/4)(2/5)=3/5$。
但 $P(A \cap B) = P(\text{两红}) = (3/5)(2/4) = 3/10$,而 $P(A)P(B)=9/25$,两者不等,故 $A,B$ 不独立。
定义:多个事件的独立性
设 $A_1, A_2, \dots, A_n$为$n$个事件。若对任意整数$k$ ($2 \le k \le n$) 及任意 $i_1 < i_2 < \dots < i_k$,均有 $$P(A_{i_1} A_{i_2} \cdots A_{i_k}) = P(A_{i_1}) P(A_{i_2}) \cdots P(A_{i_k}),$$ 则称这 $n$ 个事件相互独立。
注意:两两独立不能推出相互独立。例如存在三个事件 $A,B,C$两两独立但$P(ABC) \neq P(A)P(B)P(C)$。
独立 $\neq$ 互斥
独立与互斥是两个极易混淆的概念:
- 互斥讨论的是事件是否可能同时发生(集合交集是否为空);
- 独立讨论的是概率上的乘积关系。 事实上,若 $A,B$互斥且$P(A)>0, P(B)>0$,则 $P(A \cap B)=0 \neq P(A)P(B)$,故它们必定不独立。
例 1.9(独立试验)
抛两枚均匀硬币,$A$:第一枚正面,$B$:第二枚正面。样本空间 $\lbrace (H,H),(H,T),(T,H),(T,T)\rbrace $。
$P(A)=1/2$,$P(B)=1/2$,$P(A \cap B)=1/4$,满足独立。这正是因为两次抛掷互不干扰。
在下一章中,独立性的概念将贯穿条件概率与贝叶斯公式的应用,也是二项分布和泊松过程模型的前提。
本章小结
- 样本空间是所有可能结果的集合,事件是它的子集。
- 概率由三条公理严格定义,并导出一系列运算性质。
- 古典概型是计数与概率的桥梁。
- 互斥与对立描述事件的结构,独立描述概率的乘积关系。
- 熟练掌握事件运算与概率性质,是学习条件概率和随机变量的必备基础。
2. 条件概率与三大核心公式
本章目标
在掌握了概率的基本语言后,我们引入一个强大思想:当已知部分信息时,概率如何更新。条件概率是这种“信息更新”的数学表达,全概率公式用于“由因推果”的综合,贝叶斯公式用于“由果溯因”的逆推。三者构成概率推理的核心骨架。
2.1 条件概率
随机事件不是孤立存在的,我们常常需要回答:“在已知某事件发生的条件下,另一事件发生的概率是多少?”
2.1.1 条件概率的定义与直观
定义:条件概率
设 $A, B$是两个事件,且$P(B) > 0$。在事件 $B$发生的条件下,事件$A$ 的条件概率(conditional probability)定义为 $$P(A \mid B) = \frac{P(A \cap B)}{P(B)}.$$
直观解释:
原样本空间为 $\Omega$。当我们得知 $B$已经发生时,样本空间就缩小为$B$,此时 $A$发生的部分只能是$A \cap B$。因此条件概率是在新样本空间 $B$中度量$A \cap B$ 的比例。
几何上,如果把概率看作面积: $$P(A \mid B) = \frac{\text{“}A \text{ 与 } B \text{ 重叠部分的面积”}}{\text{“}B \text{ 的面积”}}.$$
例 2.1(扑克牌问题)
从一副 52 张的扑克中随机抽取一张。已知抽到的牌是红色(事件 $B$),求它是红桃(事件 $A$)的概率。
解:一副牌中红桃有 13 张,红色牌共 26 张。
$P(A \cap B) = 13/52 = 1/4$,$P(B)=26/52=1/2$。
故 $P(A \mid B) = \frac{1/4}{1/2} = \frac{1}{2}$。
直观上:红色牌里一半是红桃,一半是方块,符合常识。
例 2.2(骰子点数)
掷一颗均匀骰子。设 $A = \lbrace \text{点数为偶数}\rbrace = \lbrace 2,4,6\rbrace $,$B = \lbrace \text{点数} \ge 4\rbrace = \lbrace 4,5,6\rbrace $。
$P(A) = 3/6 = 1/2$。
现已知 $B$ 发生(点数至少为4),求此时点数为偶数的概率。
$A \cap B = \lbrace 4,6\rbrace $,$P(A \cap B) = 2/6 = 1/3$,$P(B)=1/2$。
故 $P(A \mid B) = \frac{1/3}{1/2} = \frac{2}{3}$。
解释:$B$缩小了样本空间至$\lbrace 4,5,6\rbrace $,其中两个是偶数,所以概率是 $2/3$。
2.1.2 条件概率的性质
条件概率 $P(\cdot \mid B)$本质上是一个概率函数(只要$P(B)>0$),满足第1章的所有概率公理和性质:
- $P(\Omega \mid B) = 1$;
- $P(\varnothing \mid B) = 0$;
- $P(\bar{A} \mid B) = 1 - P(A \mid B)$;
- $P(A_1 \cup A_2 \mid B) = P(A_1 \mid B) + P(A_2 \mid B) - P(A_1 A_2 \mid B)$,等等。
这意味着所有概率公式在条件概率下依然成立,只需将原来每个概率项前加上“$\cdot \mid B$”即可。
2.1.3 乘法公式
将条件概率定义式改写,就得到计算两个事件交的概率的乘法公式。
乘法公式
若 $P(B) > 0$,则 $$P(A \cap B) = P(B) \thinspace P(A \mid B).$$ 对称地,若 $P(A) > 0$,也有 $P(A \cap B) = P(A) \thinspace P(B \mid A)$。
推广到多个事件:
$$P(A_1 A_2 \cdots A_n) = P(A_1) \cdot P(A_2 \mid A_1) \cdot P(A_3 \mid A_1 A_2) \cdots P(A_n \mid A_1 A_2 \cdots A_{n-1}).$$ (只要涉及的条件概率分母均大于零。)
例 2.3(无放回抽球)
袋中有 5 个红球、3 个蓝球。无放回地随机抽取 3 个球,求依次抽到红、蓝、红的概率。
解:设 $A_1$:第一次抽红;$A_2$:第二次抽蓝;$A_3$:第三次抽红。 $$P(A_1) = \frac{5}{8}.$$ $$P(A_2 \mid A_1) = \frac{3}{7} \quad (\text{剩 7 个球,3 个蓝})$$ $$P(A_3 \mid A_1 A_2) = \frac{4}{6} = \frac{2}{3} \quad (\text{剩 6 个球,4 个红})$$ 由乘法公式:$P(A_1 A_2 A_3) = \frac{5}{8} \cdot \frac{3}{7} \cdot \frac{2}{3} = \frac{5}{28}$。
2.2 全概率公式
全概率公式是概率论中最有力的“分解”工具之一。它解决的是:一个事件的概率不易直接计算,但可以划分为若干种互斥的情形,分别计算后再加权求和。
2.2.1 样本空间的划分
定义:划分
设 $B_1, B_2, \dots, B_n$ 是一组事件,满足:
- 两两互斥:$B_i \cap B_j = \varnothing$对$i \neq j$;
- 并集为全集:$\bigcup_{i=1}^n B_i = \Omega$。 则称 $\lbrace B_1, B_2, \dots, B_n\rbrace $是样本空间$\Omega$ 的一个划分(partition)。
直观上,划分就是把所有可能的结果分成若干个互不重叠的类别,且这些类别覆盖了一切。
2.2.2 全概率公式
全概率公式(Law of Total Probability)
设 $\lbrace B_1, B_2, \dots, B_n\rbrace $是$\Omega$的一个划分,且$P(B_i) > 0$($i=1,\dots,n$),则对任意事件 $A$,有 $$P(A) = \sum_{i=1}^n P(A \mid B_i) \thinspace P(B_i).$$
证明思路: $$A = A \cap \Omega = A \cap \left( \bigcup_{i=1}^n B_i \right) = \bigcup_{i=1}^n (A \cap B_i).$$ 由于 $B_i$ 互斥,$A \cap B_i$ 也互斥,由可加性: $$P(A) = \sum_{i=1}^n P(A \cap B_i) = \sum_{i=1}^n P(B_i) P(A \mid B_i).$$
直观上,全概率公式就是按照不同“原因”$B_i$的概率加权平均其下$A$ 发生的条件概率。
例 2.4(生产线次品率)
某工厂有三条生产线 $B_1, B_2, B_3$,产量分别占总产量的 30%、30%、40%。各生产线的次品率分别为 2%、1%、3%。现任取一件产品,求它为次品(事件 $A$)的概率。
解:划分就是三条生产线,已知: $$P(B_1)=0.3,\thickspace P(B_2)=0.3,\thickspace P(B_3)=0.4,$$ $$P(A \mid B_1)=0.02,\thickspace P(A \mid B_2)=0.01,\thickspace P(A \mid B_3)=0.03.$$ 由全概率公式: $$P(A) = 0.3 \times 0.02 + 0.3 \times 0.01 + 0.4 \times 0.03 = 0.006 + 0.003 + 0.012 = 0.021.$$ 总次品率是 2.1%。
例 2.5(复杂试验——两层抽球)
有两个外观相同的盒子。甲盒有 3 红 2 白,乙盒有 1 红 4 白。随机选一个盒子,再从该盒中随机取出一球。求取出红球的概率。
解:划分事件 $B_1$(选甲盒)、$B_2$(选乙盒),$P(B_1)=P(B_2)=1/2$。 $$P(\text{红} \mid B_1) = 3/5,\quad P(\text{红} \mid B_2) = 1/5.$$ 全概率公式: $$P(\text{红}) = \frac{1}{2}\cdot\frac{3}{5} + \frac{1}{2}\cdot\frac{1}{5} = \frac{2}{5}.$$
2.3 贝叶斯公式
全概率公式是“由因推果”:已知原因概率和原因下的结果概率,求结果的总概率。贝叶斯公式则是反过来的“由果溯因”:在结果 $A$已经发生的条件下,反过来推断某个原因$B_j$ 的概率。
2.3.1 贝叶斯公式
贝叶斯公式(Bayes' Theorem)
设 $\lbrace B_1, B_2, \dots, B_n\rbrace $是$\Omega$的一个划分,且$P(B_i) > 0$。对于任意事件 $A$且$P(A) > 0$,有 $$P(B_j \mid A) = \frac{P(A \mid B_j) \thinspace P(B_j)}{\sum_{i=1}^n P(A \mid B_i) \thinspace P(B_i)} = \frac{P(A \mid B_j) P(B_j)}{P(A)}.$$
其中 $P(B_j)$ 称为先验概率(prior probability),$P(B_j \mid A)$ 称为后验概率(posterior probability)。
推导: 由条件概率定义 $P(B_j \mid A) = \frac{P(B_j \cap A)}{P(A)}$,分子用乘法公式:$P(B_j \cap A) = P(B_j) P(A \mid B_j)$,分母用全概率公式展开即得。
贝叶斯公式的精髓在于:它提供了一种根据新证据($A$)更新信念的数学机制。我们先有对 $B_j$的初始判断$P(B_j)$(先验),观察到 $A$发生后,通过贝叶斯公式得到修正后的判断$P(B_j \mid A)$(后验)。
2.3.2 经典例题
例 2.6(生产线逆推——续例 2.4)
在例 2.4 中,若已知抽到的一件产品是次品($A$ 发生),求它来自生产线 3 的概率。
解:已知 $P(B_3)=0.4$,$P(A \mid B_3)=0.03$,以及全概率公式算出的 $P(A)=0.021$。 由贝叶斯公式: $$P(B_3 \mid A) = \frac{P(A \mid B_3) P(B_3)}{P(A)} = \frac{0.03 \times 0.4}{0.021} = \frac{0.012}{0.021} \approx 0.5714.$$ 尽管生产线 3 的产量只占 40%,但出现次品后,它来自生产线 3 的概率上升到约 57.1%,因为它的次品率最高。这就是贝叶斯更新的力量。
例 2.7(医学检验假阳性问题)
某种罕见病在人群中的发病率为 0.5%($P(D)=0.005$)。现有一项检测方法,患者检出阳性的概率为 95%(灵敏度 $P(+ \mid D)=0.95$),健康人检出阳性的概率(假阳性率)为 2%($P(+ \mid \bar{D})=0.02$)。若某人检测结果为阳性,问他真正患病的概率是多少?
解:划分事件为 $D$(患病)和 $\bar{D}$(不患病),$P(D)=0.005$,$P(\bar{D})=0.995$。 全概率公式: $$P(+) = P(+ \mid D) P(D) + P(+ \mid \bar{D}) P(\bar{D}) = 0.95 \times 0.005 + 0.02 \times 0.995 = 0.00475 + 0.0199 = 0.02465.$$ 贝叶斯公式: $$P(D \mid +) = \frac{P(+ \mid D) P(D)}{P(+)} = \frac{0.00475}{0.02465} \approx 0.1927.$$ 尽管检测呈阳性,真正患病的概率仅有约 19.3%!这是因为疾病本身极度罕见,多数阳性结果来自健康人的假阳性。这个例子直观地展示了先验概率的重要性,也是贝叶斯统计的经典案例。
2.3.3 贝叶斯公式的扩展与思考
连续形式的贝叶斯
当划分和参数是连续时,贝叶斯公式推广为连续形式,用概率密度函数表示,成为贝叶斯统计的基石。基本思想不变:后验概率分布 $\propto$似然函数$\times$ 先验分布。
贝叶斯更新的多次进行
如果有多个独立证据 $A_1, A_2, \dots$,可以逐次更新:以第一次后验作为第二次的先验,不断迭代。最终得到的后验概率与一次性使用所有证据等价,体现了学习过程的“一致性”。
本章小结
- 条件概率 $P(A \mid B)$是限制在$B$ 内的概率度量,乘法公式用于计算交事件概率。
- 全概率公式将复杂事件 $A$ 的概率分解为各互斥原因下条件概率的加权和,是“综合”工具。
- 贝叶斯公式是“逆概率”公式,用于在已知结果下反推原因的后验概率,体现了证据更新信念的过程。
- 三者结合,构成了概率推理的完整链条,在统计推断、机器学习、医学诊断等领域有极其广泛的应用。
3. 随机变量及其数字特征
本章目标
“事件”和“概率”是用集合语言描述的,虽然严谨但不够量化。本章引入随机变量这一核心概念,将随机试验的结果映射为实数,从而可以用函数、微积分等数学工具来研究随机现象。我们将学习如何用分布描述随机变量,并用期望和方差刻画其中心位置与离散程度。这些数字特征是后续学习具体分布(二项、泊松、正态等)的基础。
3.1 随机变量的概念
3.1.1 随机变量的定义
定义:随机变量
设 $\Omega$ 是随机试验的样本空间。一个随机变量(random variable)$X$是定义在$\Omega$ 上的实值函数: $$X : \Omega \to \mathbb{R},$$ 即对每一个样本点 $\omega \in \Omega$,都对应一个实数 $X(\omega)$。
直观理解:随机变量就是把试验结果“数字化”的规则。引入它之后,我们不再直接讨论抽象的样本点,而是讨论数值 $X$落在某个区间的概率,如$P(X \le a)$或$P(a < X \le b)$。
例 3.1
- 掷骰子:样本空间 $\Omega = \lbrace 1,2,3,4,5,6\rbrace $。定义 $X(\omega) = \omega$,则 $X$ 就是掷出的点数。
- 掷硬币 10 次:定义 $X$ 为“正面朝上的次数”,$X$的可能取值为$0,1,\dots,10$。
- 测量某地日最高温:定义 $X$ 为温度数值(连续变量)。
根据取值特点,随机变量分为两大类型:离散型和连续型。
3.1.2 离散型随机变量与概率质量函数
定义:离散型随机变量
若随机变量 $X$的全部可能取值是有限个或可数个(即能一一列举),则称$X$ 为离散型随机变量(discrete random variable)。
描述工具——概率质量函数 (PMF):
$$p_X(x) = P(X = x).$$ 它给出 $X$取每个具体值$x$ 的概率。
概率质量函数的性质:
- 非负性:$p_X(x) \ge 0$对所有$x$ 成立;
- 归一性:$\sum_{x} p_X(x) = 1$,求和遍及所有可能的取值。
例 3.2(公平骰子的PMF)
掷一颗公平骰子,$X$ 为点数。其概率质量函数为 $$p_X(x) = \frac{1}{6}, \quad x = 1,2,3,4,5,6.$$ 容易验证 $\sum_{x=1}^6 \frac{1}{6} = 1$。
例 3.3(二项分布的PMF预告)
后面会专门学习二项分布。若 $X \sim \text{Binomial}(n,p)$,则它的PMF是 $$P(X=k)=\binom{n}{k}p^k(1-p)^{n-k},\quad k=0,1,\dots,n.$$
3.1.3 连续型随机变量与概率密度函数
当随机变量的取值充满某个区间时,谈论“取单个值的概率”变得没有意义(因为连续分布下点概率为零),我们转而关注“落在某区间的概率”。
定义:连续型随机变量
对于随机变量 $X$,若存在一个非负可积函数 $f_X(x)$,使得对任意实数 $a \le b$,均有 $$P(a \le X \le b) = \int_a^b f_X(x)\thinspace{}dx,$$ 则称 $X$为连续型随机变量(continuous random variable),函数$f_X(x)$称为$X$ 的概率密度函数(probability density function, PDF)。
概率密度函数的性质:
- 非负性:$f_X(x) \ge 0$对所有$x$;
- 归一性:$\int_{-\infty}^{\infty} f_X(x)\thinspace{}dx = 1$;
- 对任意单点 $c$,$P(X=c) = \int_c^c f_X(x)dx = 0$。
密度不是概率
$f_X(x)$本身不是概率,它在某点的高度并不直接等于该点的概率。只有积分$\int_a^b f_X(x)dx$才是概率。可以通过$f_X(x) \cdot dx$理解为$X$落在$[x, x+dx]$ 的近似概率。
例 3.4(均匀分布)
设 $X$在区间$[0,1]$上服从均匀分布(uniform distribution),记$X \sim U(0,1)$。其密度函数为 $$f_X(x) = \begin{cases} 1, & 0 \le x \le 1, \newline 0, & \text{其他}. \end{cases}$$ 则 $P(0.2 \le X \le 0.5) = \int_{0.2}^{0.5} 1\thinspace{}dx = 0.3$。总积分 $\int_0^1 1\thinspace{}dx = 1$。
3.1.4 累积分布函数(CDF)——统一描述工具
定义:累积分布函数
对任意随机变量 $X$(离散或连续),其累积分布函数(cumulative distribution function, CDF)定义为 $$F_X(x) = P(X \le x), \quad x \in \mathbb{R}.$$ 它给出 $X$的取值不超过$x$ 的概率。
CDF 的基本性质(适用于所有随机变量):
- 单调不减:若 $x_1 < x_2$,则 $F_X(x_1) \le F_X(x_2)$。
- 右连续:$\lim_{x \to a^+} F_X(x) = F_X(a)$。
- 边界值:$\lim_{x \to -\infty} F_X(x) = 0$,$\lim_{x \to +\infty} F_X(x) = 1$。
与 PMF / PDF 的关系:
- 若 $X$ 离散:$F_X(x) = \sum_{t \le x} p_X(t)$,此时 $F_X$ 是阶梯函数。
- 若 $X$ 连续:$F_X(x) = \int_{-\infty}^x f_X(t)\thinspace{}dt$,在 $f_X$的连续点处有$F_X'(x) = f_X(x)$。
例 3.5(均匀分布的CDF)
对 $X \sim U(0,1)$: $$F_X(x) = \begin{cases} 0, & x < 0, \newline x, & 0 \le x \le 1, \newline 1, & x > 1. \end{cases}$$ 这里 $F_X(x)$在$(0,1)$ 上是斜率为 1 的直线,体现了累积概率的均匀增长。
CDF 是描述随机变量最完整的函数,无论离散还是连续,它都给出了一切区间概率:$P(a < X \le b) = F_X(b) - F_X(a)$。
3.2 期望与方差
知道分布后,我们还需要提炼出最关键的几个数字,来概括随机变量行为的中心位置与波动大小。
3.2.1 期望(数学期望)
定义:期望
期望(expectation / expected value)是随机变量取值的“加权平均”,权重为概率。
- 若 $X$离散,概率质量函数为$p(x)$: $$E[X] = \sum_x x \cdot p(x).$$
- 若 $X$连续,概率密度函数为$f(x)$: $$E[X] = \int_{-\infty}^{\infty} x \thinspace f(x) \thinspace dx.$$ 要求上述求和或积分绝对收敛(否则称期望不存在)。
记法:也常记为 $\mu_X$或简写$\mu$。
直观意义:
- 期望是“长期重复试验的平均结果”。如果在相同条件下无限次独立重复试验,每次记录 $X$的值,这些值的平均数将趋近于$E[X]$(大数定律)。
- 几何上,若把概率分布看作质量分布,$E[X]$ 就是其重心。
例 3.6(公平骰子点数的期望)
$X$ 为公平骰子的点数,$p(x)=1/6,\thinspace x=1,\dots,6$。 $$E[X] = 1\cdot\frac{1}{6} + 2\cdot\frac{1}{6} + 3\cdot\frac{1}{6} + 4\cdot\frac{1}{6} + 5\cdot\frac{1}{6} + 6\cdot\frac{1}{6} = \frac{21}{6} = 3.5.$$ 注意,期望 3.5 并不是一个可能的取值,但它代表长期平均。
例 3.7(均匀分布的期望)
$X \sim U(0,1)$,$f(x)=1$在$[0,1]$ 上。 $$E[X] = \int_0^1 x \cdot 1 \thinspace dx = \left[ \frac{x^2}{2} \right]_0^1 = \frac{1}{2}.$$ 确实,区间 $[0,1]$ 的重心在 0.5。
3.2.2 方差与标准差
期望告诉我们“平均大小”,但同期望的两个随机变量可以有截然不同的稳定程度。方差量化了取值围绕期望的散布程度。
定义:方差与标准差
设 $X$的期望$E[X] = \mu$。$X$ 的方差(variance)定义为 $$\operatorname{Var}(X) = E\big[(X - \mu)^2\big].$$ 即 $X$ 与其期望的偏差平方的期望。方差的量纲是原始数据的平方,为统一量纲常使用标准差: $$\sigma_X = \sqrt{\operatorname{Var}(X)}.$$
计算方差的重要公式(由期望线性性质推出):
$$\operatorname{Var}(X) = E[X^2] - (E[X])^2 = E[X^2] - \mu^2.$$ 推导:$\operatorname{Var}(X) = E[(X-\mu)^2] = E[X^2 - 2\mu X + \mu^2] = E[X^2] - 2\mu E[X] + \mu^2 = E[X^2] - \mu^2$。
根据类型具体计算:
- 离散:$E[X^2] = \sum_x x^2 p(x)$
- 连续:$E[X^2] = \int_{-\infty}^{\infty} x^2 f(x) dx$
例 3.8(骰子点数的方差)
骰子 $X$,已知 $\mu=3.5$。 先算 $E[X^2] = \frac{1}{6}(1^2+2^2+3^2+4^2+5^2+6^2) = \frac{91}{6} \approx 15.167$。 则 $\operatorname{Var}(X) = E[X^2] - \mu^2 = \frac{91}{6} - \left(\frac{21}{6}\right)^2 = \frac{91}{6} - \frac{441}{36} = \frac{546 - 441}{36} = \frac{105}{36} = \frac{35}{12} \approx 2.917.$ 标准差 $\sigma = \sqrt{35/12} \approx 1.708$。
例 3.9(均匀分布 $U(0,1)$ 的方差)
$X \sim U(0,1)$。$E[X]=0.5$。$E[X^2] = \int_0^1 x^2 \cdot 1\thinspace dx = \frac{1}{3}$。 $\operatorname{Var}(X) = \frac{1}{3} - \left(\frac{1}{2}\right)^2 = \frac{1}{3} - \frac{1}{4} = \frac{1}{12}$。
3.2.3 期望与方差的性质
这些性质在推导中极为常用,且对所有类型的随机变量(只要期望/方差存在)都成立。
性质 3.1(线性性)
对任意常数 $a, b$, $$E[aX + b] = aE[X] + b.$$ 证:连续情形下,$E[aX+b] = \int (ax+b)f(x)dx = a\int x f(x)dx + b\int f(x)dx = aE[X] + b$。离散类似。
性质 3.2(常数的方差)
$$\operatorname{Var}(c) = 0, \quad \text{对任意常数 } c.$$
性质 3.3(线性变换下的方差)
$$\operatorname{Var}(aX + b) = a^2 \operatorname{Var}(X).$$ 推导:$\operatorname{Var}(aX+b) = E\big[((aX+b) - (a\mu + b))^2\big] = E[a^2 (X-\mu)^2] = a^2 \operatorname{Var}(X)$。
注意常数 $b$ 只会平移分布,不改变离散程度,故不影响方差。
性质 3.4(独立随机变量之和的期望与方差)
若 $X$与$Y$ 独立,则 $$E[XY] = E[X]\thinspace{}E[Y].$$ 进而, $$\operatorname{Var}(X + Y) = \operatorname{Var}(X) + \operatorname{Var}(Y).$$ 对于独立变量的差,仍有 $\operatorname{Var}(X - Y) = \operatorname{Var}(X) + \operatorname{Var}(Y)$(注意仍然是加号)。
对于 $n$个独立随机变量$X_1, \dots, X_n$: $$\operatorname{Var}\negthinspace\left(\sum_{i=1}^n X_i\right) = \sum_{i=1}^n \operatorname{Var}(X_i).$$
注意:若 $X,Y$ 不独立,则方差公式需要加上协方差项: $$\operatorname{Var}(X+Y) = \operatorname{Var}(X) + \operatorname{Var}(Y) + 2\operatorname{Cov}(X,Y).$$
例 3.10(应用性质快速计算)
已知 $E[X]=5$,$\operatorname{Var}(X)=4$,求 $E[2X+3]$和$\operatorname{Var}(2X+3)$。
解:$E[2X+3] = 2E[X] + 3 = 2\times5 + 3 = 13$。
$\operatorname{Var}(2X+3) = 2^2 \operatorname{Var}(X) = 4 \times 4 = 16$。
3.2.4 期望与方差的存在性
并非所有分布都有期望或方差
有些分布(如柯西分布 $f(x) = \frac{1}{\pi(1+x^2)}$)的积分 $\int |x| f(x)dx$ 发散,导致期望不存在;期望不存在时,方差自然无定义。在经典应用中通常假设方差有限。
本章小结
- 随机变量是试验结果的数值化映射,分为离散型(用 PMF 描述)和连续型(用 PDF 描述)。
- 累积分布函数 CDF 提供了统一的描述方式,$F(x)=P(X\le x)$ 具有单调不减、右连续、边界 0/1 的性质。
- 期望 $E[X]$ 是长期平均,也是分布的重心;方差 $\operatorname{Var}(X)=E[(X-\mu)^2]$ 衡量取值围绕期望的离散程度,常用标准差 $\sigma$ 表示。
- 期望与方差满足若干运算性质,尤其是线性组合的期望和方差公式,以及独立随机变量之和的方差等于方差之和,这些是后续推导二项分布、泊松分布及中心极限定理的关键工具。
4. 重要离散分布:二项分布与泊松分布
本章目标
在前一章掌握了随机变量与数字特征的一般工具后,我们开始系统学习两种最核心的离散分布:二项分布和泊松分布。二项分布精确刻画了 $n$次独立重复试验中成功次数的规律;泊松分布则描述了单位时间(或空间)内随机事件发生次数的规律,并可作为二项分布在$n$ 很大、$p$ 很小条件下的极佳近似。我们将推导它们的概率质量函数、数字特征,并掌握累积分布函数的计算。
4.1 伯努利试验与二项分布
4.1.1 伯努利试验
许多随机现象只有两种结果:“成功”与“失败”。
定义:伯努利试验
若一次试验只有两种可能的结果,且每次试验中“成功”的概率恒为 $p$($0 < p < 1$),“失败”的概率为 $q = 1-p$,则称该试验为伯努利试验(Bernoulli trial)。
例 4.1:
- 掷一枚硬币,正面为成功,$p=0.5$。
- 抽检一件产品,次品为成功,$p$ 为次品率。
- 射击一次,命中为成功,$p$ 为命中率。
4.1.2 二项分布的定义
如果将相同的伯努利试验独立地重复 $n$次,我们关心的往往是“成功总次数$X$”。
定义:二项分布
进行 $n$重独立的伯努利试验,每次成功概率为$p$。令随机变量 $X$表示成功的总次数,则$X$服从参数为$(n, p)$ 的二项分布(binomial distribution),记为 $$X \sim \text{Binomial}(n, p).$$
其概率质量函数(PMF)为: $$P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k = 0, 1, 2, \dots, n.$$
推导思路: 要恰好发生 $k$次成功,需从$n$次试验中选出$k$个位置放置成功,其余$n-k$次为失败。每种特定序列(如“成败成败…”)的概率为$p^k (1-p)^{n-k}$。由独立性,总概率为组合数乘以此序列概率。
例 4.2(硬币问题)
抛一枚均匀硬币 10 次,令 $X$为正面朝上的次数。则$X \sim \text{Binomial}(10, 0.5)$。
- 恰好出现 5 次正面的概率:$P(X=5) = \binom{10}{5} (0.5)^5 (0.5)^5 = \frac{252}{1024} \approx 0.2461$。
- 至少出现 8 次正面的概率:$P(X \ge 8) = \sum_{k=8}^{10} \binom{10}{k} (0.5)^{10} \approx 0.0547$。
4.1.3 二项分布的数字特征
利用期望与方差的性质,可以方便地推出二项分布的均值和方差,而不必直接计算无穷级数。
推导:引入指示变量 $I_i$:第 $i$次试验成功为 1,失败为 0,则$X = \sum_{i=1}^n I_i$。
- 每个 $I_i \sim \text{Bernoulli}(p)$,$E[I_i] = 1\cdot p + 0\cdot (1-p) = p$。
- $\operatorname{Var}(I_i) = E[I_i^2] - (E[I_i])^2 = p - p^2 = p(1-p)$。
- 由于试验独立,$I_1, \dots, I_n$ 相互独立。
- 由期望线性:$E[X] = \sum_{i=1}^n E[I_i] = np$。
- 由独立变量方差可加性:$\operatorname{Var}(X) = \sum_{i=1}^n \operatorname{Var}(I_i) = np(1-p)$。
二项分布的期望与方差
若 $X \sim \text{Binomial}(n,p)$,则 $$E[X] = np, \qquad \operatorname{Var}(X) = np(1-p).$$
直观:成功次数的平均值就是试验次数乘以单次成功概率;方差在 $p=0.5$时最大(结果最不确定),在$p$ 接近 0 或 1 时很小(几乎确定成败)。
4.1.4 二项累积分布函数
在实际问题中,常需计算“成功次数不超过某值”或“至少多少次”的概率,这就用到了二项累积分布函数。
定义:二项累积分布函数(CDF)
对于 $X \sim \text{Binomial}(n,p)$,其累积分布函数为 $$F(x) = P(X \le x) = \sum_{k=0}^{\lfloor x \rfloor} \binom{n}{k} p^k (1-p)^{n-k},$$ 其中 $\lfloor x \rfloor$表示不超过$x$ 的最大整数。
一般我们直接写整数点 $x = 0,1,\dots,n$: $$P(X \le k) = \sum_{i=0}^{k} \binom{n}{i} p^i (1-p)^{n-i}.$$
由此可得区间概率: $$P(a < X \le b) = F(b) - F(a),$$ $$P(X \ge k) = 1 - P(X \le k-1) = 1 - F(k-1).$$
例 4.3(产品抽样验收)
一批产品的次品率为 $p=0.1$,随机抽取 $n=20$件进行检验。设$X$ 为样本中的次品数,求最多发现 2 件次品的概率,以及至少发现 3 件次品的概率。
解:$X \sim \text{Binomial}(20, 0.1)$。 $$P(X \le 2) = \sum_{k=0}^{2} \binom{20}{k} (0.1)^k (0.9)^{20-k}.$$ 计算:
- $k=0$: $(0.9)^{20} \approx 0.1216$
- $k=1$: $20 \times 0.1 \times (0.9)^{19} \approx 0.2702$
- $k=2$: $\binom{20}{2} (0.1)^2 (0.9)^{18} = 190 \times 0.01 \times 0.1501 \approx 0.2852$ 总和 $P(X \le 2) \approx 0.6770$。 $P(X \ge 3) = 1 - P(X \le 2) \approx 0.3230$。
图形特征:当 $p=0.5$时,二项分布对称;当$p \neq 0.5$ 时呈偏态,$p<0.5$ 正偏(右尾长),$p>0.5$ 负偏。$n$ 很大时,图形趋近于钟形(正态分布)。
4.2 泊松分布与泊松概率
许多随机现象关心的是:在一段固定时间、固定空间或固定区域内,某随机事件发生的次数。例如,某交换机 1 小时内接到的呼叫次数;一页书上的印刷错误个数;一天内地震的次数等。这些场景中,试验次数 $n$可以认为非常大,而每次“成功”(事件发生)的概率$p$非常小,但平均发生次数$np$ 保持稳定。泊松分布正是这种极限情况下的精确模型。
4.2.1 泊松分布的定义
定义:泊松分布
一个取非负整数的随机变量 $X$服从参数为$\lambda > 0$的泊松分布(Poisson distribution),记为$X \sim \text{Poisson}(\lambda)$,若其概率质量函数为 $$P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \quad k = 0, 1, 2, \dots$$ 其中 $\lambda$ 是单位时间(或空间)内事件发生的平均次数(比率参数)。
验证归一性:利用泰勒展开 $e^\lambda = \sum_{k=0}^\infty \frac{\lambda^k}{k!}$,有 $\sum_{k=0}^\infty P(X=k) = e^{-\lambda} \sum_{k=0}^\infty \frac{\lambda^k}{k!} = e^{-\lambda} e^{\lambda} = 1$。
4.2.2 泊松分布的数字特征
泊松分布的期望与方差
若 $X \sim \text{Poisson}(\lambda)$,则 $$E[X] = \lambda, \qquad \operatorname{Var}(X) = \lambda.$$ 均值与方差相等是泊松分布的一个显著特征,常用来初步判断数据是否适用泊松模型。
推导期望: $$E[X] = \sum_{k=0}^\infty k \frac{\lambda^k e^{-\lambda}}{k!} = e^{-\lambda} \sum_{k=1}^\infty \frac{\lambda^k}{(k-1)!} = \lambda e^{-\lambda} \sum_{j=0}^\infty \frac{\lambda^j}{j!} = \lambda e^{-\lambda} e^{\lambda} = \lambda.$$
类似可求 $E[X^2]$ 并得到方差。
例 4.4(呼叫中心)
某客服中心平均每小时接到 5 个电话,设 $X$为下一小时接到的电话数,假设$X \sim \text{Poisson}(5)$。计算恰好接到 8 个电话的概率,以及最多接到 3 个电话的概率。
解: $P(X=8) = \frac{5^8 e^{-5}}{8!}$。具体计算:$5^8 = 390625$,$e^{-5} \approx 0.006738$,$8! = 40320$,乘积约为 $0.0653$。 $P(X \le 3) = \sum_{k=0}^{3} \frac{5^k e^{-5}}{k!} = e^{-5}\left(1 + 5 + \frac{25}{2} + \frac{125}{6}\right) \approx 0.006738 \times (1+5+12.5+20.833) \approx 0.2650$。
4.2.3 泊松分布与二项分布的关系——泊松近似
泊松分布最初是作为二项分布的极限被推导出来的。考虑以下极限过程:设 $n \to \infty$,同时 $p \to 0$,但保持乘积 $np = \lambda$ 为常数。则二项分布的概率质量函数收敛到泊松分布。
泊松定理(二项分布的泊松近似)
设 $\lambda > 0$为一常数,若$np_n \to \lambda$(当 $n \to \infty$时),则对任意固定的非负整数$k$,有 $$\lim_{n\to\infty} \binom{n}{k} p_n^k (1-p_n)^{n-k} = \frac{\lambda^k e^{-\lambda}}{k!}.$$
证明梗概: 将 $p = \lambda/n$ 代入二项概率: $$\binom{n}{k} \left(\frac{\lambda}{n}\right)^k \left(1-\frac{\lambda}{n}\right)^{n-k} = \frac{n(n-1)\cdots(n-k+1)}{k!} \cdot \frac{\lambda^k}{n^k} \cdot \left(1-\frac{\lambda}{n}\right)^{n} \cdot \left(1-\frac{\lambda}{n}\right)^{-k}.$$ 当 $n\to\infty$,
- $\frac{n(n-1)\cdots(n-k+1)}{n^k} \to 1$;
- $\left(1-\frac{\lambda}{n}\right)^{n} \to e^{-\lambda}$;
- $\left(1-\frac{\lambda}{n}\right)^{-k} \to 1$。 因此极限为 $\frac{\lambda^k e^{-\lambda}}{k!}$。
近似条件: 在实际应用中,当 $n$很大(通常$n \ge 20$),$p$很小(通常$p \le 0.05$)且 $np$大小适中时,可用$\text{Poisson}(\lambda = np)$来近似$\text{Binomial}(n,p)$。该近似可大幅简化计算,因为泊松分布只涉及指数和阶乘,而二项分布组合数可能巨大。
例 4.5(近似计算)
某彩票中奖率为 $p=0.0001$。某人购买 $n=20000$ 张独立随机的彩票,求至少中奖 2 次的概率。
精确计算:$X \sim \text{Binomial}(20000, 0.0001)$。$P(X \ge 2) = 1 - P(X=0) - P(X=1)$ 极难手算。 用泊松近似:$\lambda = np = 20000 \times 0.0001 = 2$。 $$P(X \ge 2) \approx 1 - e^{-2}\left(\frac{2^0}{0!} + \frac{2^1}{1!}\right) = 1 - e^{-2}(1+2) = 1 - 3e^{-2} \approx 1 - 0.4060 = 0.5940.$$ 精确值(二项)约为 0.5940,误差极小。
4.2.4 泊松分布的累积分布
类似二项分布,泊松分布的累积分布函数对于计算区间概率非常重要: $$P(X \le k) = \sum_{i=0}^{k} \frac{\lambda^i e^{-\lambda}}{i!}.$$ 由于没有简单的闭形式,通常查表或使用统计软件。但其规律性强,递推关系为: $$P(X = i+1) = \frac{\lambda}{i+1} \cdot P(X = i),$$ 这有助于手算一系列概率。
例 4.6(泊松累积)
续例 4.4,$\lambda=5$,求接到电话数在 3 到 7 个之间的概率。 $$P(3 \le X \le 7) = P(X \le 7) - P(X \le 2).$$ $P(X \le 2) = e^{-5}(1+5+12.5) \approx 0.1247$(前面算过 $P(X\le3)$ 为0.265,需重算)。精确累积值可查表,此处仅示意。
本章小结
- 二项分布 $\text{Binomial}(n,p)$是$n$ 重伯努利试验的成功总次数模型。PMF:$\binom{n}{k} p^k (1-p)^{n-k}$,期望 $np$,方差 $np(1-p)$。
- 二项累积分布 $P(X \le k)$ 通过求和得到,用于计算“至多/至少”的概率。
- 泊松分布 $\text{Poisson}(\lambda)$ 描述随机事件在固定区间内的发生次数。PMF:$\frac{\lambda^k e^{-\lambda}}{k!}$,期望与方差均为 $\lambda$。
- 泊松定理:当 $n$大$p$小,且$np=\lambda$ 时,二项分布可由泊松分布近似,大大简化计算。
- 这两种分布是统计学中最常用的离散模型,为后续学习正态近似和中心极限定理奠定了基础。
5. 正态分布、反正态与极限定理
本章目标
正态分布是概率论与统计学中最重要的连续分布,其密度曲线(高斯曲线)呈钟形,广泛存在于自然与社会现象中。我们将学习正态分布的定义、性质与标准化方法,并通过经验法则建立直观理解。反正态分布(分位数函数)帮助我们由概率反查临界值,是区间估计与假设检验的核心工具。最后,我们引入大数定律与中心极限定理,后者解释了正态分布为何具有普适性:大量独立随机变量的和(或均值)近似服从正态分布。这两大极限定理是古典概率通向现代统计推断的桥梁。
5.1 正态分布(高斯曲线)
5.1.1 定义与密度函数
定义:正态分布
若连续型随机变量 $X$ 具有概率密度函数 $$f(x) = \frac{1}{\sqrt{2\pi}\thinspace\sigma} \exp\negthinspace\left( -\frac{(x-\mu)^2}{2\sigma^2} \right), \quad x \in \mathbb{R},$$ 其中 $\mu \in \mathbb{R}$,$\sigma > 0$为常数,则称$X$服从参数为$(\mu, \sigma^2)$ 的正态分布(normal distribution),记为 $$X \sim \mathcal{N}(\mu, \sigma^2).$$
- $\mu$ 是均值(位置参数),决定曲线的中心位置。
- $\sigma$ 是标准差(尺度参数),$\sigma^2$ 是方差,决定曲线的扁平程度。
密度函数性质:
- 非负性:$f(x) > 0$对所有$x$,且 $\int_{-\infty}^{\infty} f(x)dx = 1$(可通过极坐标变换验证)。
- 对称性:$f(\mu - x) = f(\mu + x)$,曲线关于直线 $x = \mu$ 对称。
- 钟形曲线:在 $x = \mu$处取得最大值$\frac{1}{\sqrt{2\pi}\sigma}$,向两侧单调递减,并以 $x$ 轴为渐近线。
- 拐点位置:在 $x = \mu \pm \sigma$ 处,曲线由“凸向下”变为“凸向上”。
为何称为“正态”
历史上由高斯(Gauss)在研究测量误差时系统推导,故又称高斯分布(Gaussian distribution)。其密度函数图像常被称为高斯曲线。
5.1.2 标准正态分布与标准化
任何正态随机变量都可以通过简单的线性变换转化为均值为 0、方差为 1 的标准正态分布。
定义:标准正态分布
若 $Z \sim \mathcal{N}(0, 1)$,其密度函数为 $$\varphi(z) = \frac{1}{\sqrt{2\pi}} e^{-z^2/2}, \quad z \in \mathbb{R}.$$ 累积分布函数记为 $$\Phi(z) = P(Z \le z) = \int_{-\infty}^z \frac{1}{\sqrt{2\pi}} e^{-t^2/2}\thinspace{}dt.$$ 该积分没有初等闭形式,通常通过查表或软件计算。
标准化公式
若 $X \sim \mathcal{N}(\mu, \sigma^2)$,则 $$Z = \frac{X - \mu}{\sigma} \sim \mathcal{N}(0, 1).$$ 反之,$X = \mu + \sigma Z$。
标准化使得我们只需掌握标准正态分布的表,即可计算任意正态分布的概率。
例 5.1(标准化求概率)
设 $X \sim \mathcal{N}(100, 15^2)$(某智商测试分数模型),求分数在 85 到 115 之间的概率。
解:标准化: $P(85 \le X \le 115) = P\negthinspace\left( \frac{85-100}{15} \le Z \le \frac{115-100}{15} \right) = P(-1 \le Z \le 1).$ 利用对称性和查表,$\Phi(1) \approx 0.8413$,故 $$P(-1 \le Z \le 1) = \Phi(1) - \Phi(-1) = \Phi(1) - (1 - \Phi(1)) = 2\Phi(1) - 1 \approx 0.6826.$$ 即约 68.3% 的人分数在 85 到 115 之间。
5.1.3 经验法则(68-95-99.7 规则)
对于正态分布,距均值若干标准差区间内的概率有非常稳定的近似值,无需每次查表。
经验法则(Empirical Rule)
若 $X \sim \mathcal{N}(\mu, \sigma^2)$,则
- 约 68.27% 的数据落在 $(\mu - \sigma, \mu + \sigma)$ 内;
- 约 95.45% 的数据落在 $(\mu - 2\sigma, \mu + 2\sigma)$ 内;
- 约 99.73% 的数据落在 $(\mu - 3\sigma, \mu + 3\sigma)$ 内。
精确概率:
- $P(|Z| < 1) = 2\Phi(1)-1 \approx 0.6827$
- $P(|Z| < 2) = 2\Phi(2)-1 \approx 0.9545$
- $P(|Z| < 3) = 2\Phi(3)-1 \approx 0.9973$
此法则在质量管理(如“6σ 管理”)中极其常用,也为后续假设检验提供了直观基准。
5.1.4 正态分布的数字特征
正态分布的期望与方差
若 $X \sim \mathcal{N}(\mu, \sigma^2)$,则 $$E[X] = \mu, \qquad \operatorname{Var}(X) = \sigma^2.$$ 证明:利用密度函数的对称性可得期望,方差由积分或标准化后得到。
重要运算性质:
- 正态分布的线性变换仍为正态:若 $X \sim \mathcal{N}(\mu, \sigma^2)$,则 $aX + b \sim \mathcal{N}(a\mu + b, a^2\sigma^2)$,$a \neq 0$。
- 独立正态变量之和仍服从正态分布:若 $X_i \sim \mathcal{N}(\mu_i, \sigma_i^2)$且相互独立,则$\sum X_i \sim \mathcal{N}\negthinspace\left(\sum \mu_i, \sum \sigma_i^2\right)$。
5.2 反正态分布(逆正态分布 / 分位数函数)
在实际问题中,常需“已知右尾(或左尾)概率,反求临界值”,这正是分位数函数的作用。
5.2.1 定义与记法
定义:标准正态分位数(逆累积分布函数)
对于给定的概率 $p \in (0,1)$,满足 $$\Phi(z_p) = P(Z \le z_p) = p$$ 的值 $z_p$ 称为标准正态分布的 $p$分位数(quantile),也记作$\Phi^{-1}(p)$。函数 $\Phi^{-1}$ 称为逆正态累积分布函数,或简称反正态。
几何意义:在标准正态密度曲线下,$z_p$左侧的面积(概率)恰为$p$。
常用分位数
- $z_{0.5} = 0$(中位数)。
- $z_{0.975} \approx 1.96$:右侧 2.5% 的临界值。
- $z_{0.95} \approx 1.645$:右侧 5% 的临界值。
- $z_{0.99} \approx 2.326$:右侧 1% 的临界值。
因对称性,$z_{1-p} = -z_p$。例如 $z_{0.025} = -1.96$。
例 5.2(一般正态的分位数)
设 $X \sim \mathcal{N}(100, 15^2)$,求 $x$使得$P(X \le x) = 0.95$(即 95% 分位数)。
解:$X = \mu + \sigma Z$,所以 $x = \mu + \sigma \thinspace z_{0.95}$。 查表 $z_{0.95} \approx 1.645$,故 $x = 100 + 15 \times 1.645 = 124.675$。 约 95% 的人分数不超过 124.7。
5.2.2 双侧分位数
在区间估计和假设检验中,常使用双侧分位数,使得两侧尾部概率各为 $\alpha/2$。
$$P(|Z| \ge z_{1-\alpha/2}) = \alpha \quad \Longleftrightarrow \quad P(Z > z_{1-\alpha/2}) = \alpha/2.$$ 例如对于 $\alpha=0.05$,$z_{1-0.025} = z_{0.975} \approx 1.96$,即 95% 的中心区间为 $(-1.96, 1.96)$。
5.3 大数定律
概率建立在长期频率稳定的信念之上,大数定律为这一直觉提供了严格的数学表述。
弱大数定律(Weak Law of Large Numbers)
设 $X_1, X_2, \dots$是独立同分布(i.i.d.)的随机变量,具有有限期望$E[X_i] = \mu$。令样本均值为 $\bar{X}_n = \frac{1}{n}\sum_{i=1}^n X_i$。则对任意 $\varepsilon > 0$, $$\lim_{n\to\infty} P\negthinspace\left( \left| \bar{X}_n - \mu \right| \ge \varepsilon \right) = 0.$$ 称 $\bar{X}_n$依概率收敛于$\mu$,记作 $\bar{X}_n \xrightarrow{P} \mu$。
直观:当样本量 $n$ 充分大时,样本均值与总体期望之间的“大偏差”发生的概率可以任意小。这就解释了为什么我们用样本均值去估计总体均值是合理的。
例 5.3(抛硬币)
多次抛一枚公平硬币,正面频率记为 $\bar{X}_n$。大数定律保证:当 $n \to \infty$ 时,$\bar{X}_n$ 趋于 0.5 的概率为 1(依概率收敛),而不保证每次恰好等于 0.5。
还有更强的版本——强大数定律,它断言 $\bar{X}_n$几乎必然收敛到$\mu$,但弱大数定律已足以支撑绝大部分统计应用。
5.4 中心极限定理
如果说大数定律定性地告诉我们均值会稳定,那么中心极限定理则定量地告诉我们均值的波动形态——竟然是正态分布!这是概率论中最令人震撼的结果之一。
5.4.1 定理陈述
中心极限定理(Central Limit Theorem, CLT)
设 $X_1, X_2, \dots$为独立同分布(i.i.d.)的随机变量,具有有限期望$\mu$和有限方差$\sigma^2 > 0$。令样本均值为 $\bar{X}_n = \frac{1}{n}\sum_{i=1}^n X_i$。则当 $n \to \infty$ 时,标准化后的样本均值的分布收敛到标准正态分布: $$\frac{\bar{X}_n - \mu}{\sigma / \sqrt{n}} \xrightarrow{d} \mathcal{N}(0, 1).$$ 等价地,样本总和 $S_n = \sum_{i=1}^n X_i$近似服从$\mathcal{N}(n\mu, n\sigma^2)$,当 $n$ 足够大时。
关键点:定理对原始分布没有特定形式要求,只要方差有限。无论 $X_i$是离散(如伯努利)、偏态(如指数)还是均匀分布,只要$n$ 足够大,均值的分布就呈现出钟形曲线。
5.4.2 应用之一:二项分布的正态近似
考虑 $X \sim \text{Binomial}(n,p)$,可看作 $n$ 个独立伯努利变量之和,$E[X]=np$,$\operatorname{Var}(X)=np(1-p)$。由 CLT,当 $n$ 较大时, $$X \approx \mathcal{N}\negthinspace\big(np,\thickspace np(1-p)\big).$$
连续性校正
由于二项分布是离散的,正态分布是连续的,在近似形如 $P(X \le k)$的概率时常加连续性校正:用$k + 0.5$代替$k$。即 $$P(X \le k) \approx \Phi\negthinspace\left(\frac{k + 0.5 - np}{\sqrt{np(1-p)}}\right).$$ 同理,$P(X = k) \approx \Phi\negthinspace\left(\frac{k + 0.5 - np}{\sqrt{np(1-p)}}\right) - \Phi\negthinspace\left(\frac{k - 0.5 - np}{\sqrt{np(1-p)}}\right)$。
例 5.4(正态近似二项)
抛一枚均匀硬币 100 次,$X$为正面次数,求$P(45 \le X \le 55)$ 的近似值。
$n=100, p=0.5$,故 $\mu = 50, \sigma = \sqrt{100 \times 0.5 \times 0.5} = 5$。用连续性校正: $$P(45 \le X \le 55) \approx \Phi\negthinspace\left(\frac{55.5 - 50}{5}\right) - \Phi\negthinspace\left(\frac{44.5 - 50}{5}\right) = \Phi(1.1) - \Phi(-1.1) = 2\Phi(1.1)-1.$$ 查表 $\Phi(1.1) \approx 0.8643$,概率约 $0.7286$。精确二项概率约为 $0.7287$,近似极好。
5.4.3 应用之二:泊松分布的正态近似
当 $\lambda$较大时(通常$\lambda > 10$),泊松分布也可用正态分布近似: $$\text{Poisson}(\lambda) \approx \mathcal{N}(\lambda, \lambda).$$ 同样可加连续性校正。
5.4.4 中心极限定理的意义
- 普适性:解释了为什么许多自然现象(身高、测量误差等)呈现正态分布——因为它们往往是大量微小独立因素叠加的结果。
- 统计推断的基石:在参数估计(置信区间)和假设检验中,我们常常基于“样本均值近似正态”这个事实构造检验统计量,哪怕原始数据并不正态。
- 与实际的区别:中心极限定理是极限定理,对于有限样本 $n$,近似程度依赖于原始分布的偏度和样本量。若原分布严重偏斜或存在厚尾,可能需要较大 $n$ 才能接近正态。在实际应用中,$n \ge 30$ 常被认为是大样本的粗略准则。
本章小结
- 正态分布 $\mathcal{N}(\mu,\sigma^2)$由均值$\mu$和方差$\sigma^2$完全决定,密度函数呈钟形。通过标准化$Z = \frac{X-\mu}{\sigma}$ 可转化为标准正态。
- 经验法则(68-95-99.7)提供了常用区间的概率近似。
- 反正态(分位数)$\Phi^{-1}(p)$ 用于已知概率反求临界值,是推断统计的必备工具。
- 大数定律保证样本均值依概率收敛于总体期望,为统计估计提供了理论依据。
- 中心极限定理表明,大样本下独立同分布变量的均值近似正态,这使得正态分布成为统计推断的核心纽带,并可以用于二项、泊松等分布的近似计算。
6. 拓展视角:无限猴子问题
本章目标
“无限猴子问题”是一个经典的趣味概率谜题,但它背后蕴含着深刻的概率极限思想。我们将用它串联起独立性、伯努利试验、大数定律以及零一律(波莱尔-坎特利引理)等重要概念,并理解“概率为 1”与“必然事件”之间的微妙区别。该问题也提供了一个关于“无穷”和“极低概率事件”在超大时间尺度上必然发生的生动模型。
6.1 问题陈述与历史背景
经典表述
一只猴子在打字机(或计算机键盘)上随机且无限次地敲击按键,每次敲击相互独立,且每个字符被敲出的概率均等。问题:这只猴子几乎必然(probability 1)会打出任意给定的有限文本,比如莎士比亚的《哈姆雷特》,甚至整个大英图书馆的藏书。
这一问题最早可追溯到埃米尔·博雷尔(Émile Borel)在 1913 年关于“无穷”与“随机性”的讨论,后来被广泛引用以说明:在一个无限的时间里,任何概率不为零的事件都必将发生。但我们需要更精确的概率分析来理解“几乎必然”的含义。
6.2 概率模型的建立
6.2.1 基本假设
为将问题形式化,我们做如下合理假设:
- 字符集有限:键盘共有 $m$个可敲击的字符(包括字母、空格、标点等),每次敲击相互独立,且每个字符被敲中的概率相等,均为$\frac{1}{m}$。
- 目标文本:设目标文本 $T$为一串长度为$L$的固定字符序列,例如$T = \text{"}TO\thickspace{}BE\thickspace{}OR\thickspace{}NOT\thickspace{}TO\thickspace{}BE\text{"}$,其中包含空格,共 $L$ 个字符。
- 无限次敲击:猴子进行无限次独立敲击,产生一个无限长的字符串。
6.2.2 单次尝试成功的概率
考虑将猴子的无限长字符串划分为不重叠的连续 $L$个字符的块。每一块可以视作一次“尝试”来输出目标文本$T$。
第 $1$块:敲击第$1$至$L$次;第$2$块:敲击第$L+1$至$2L$ 次;依此类推。
单块成功概率
对于任意一个长度为 $L$的块,它恰好等于目标文本$T$ 的概率为 $$p = \left(\frac{1}{m}\right)^L.$$ 由于每个位置独立同分布,且块之间也是独立的(它们由不重叠的敲击构成),因此各块是否成功是独立的伯努利试验。
例:若键盘只有 26 个小写字母和空格共 27 个字符($m=27$),目标文本是 “monkey”($L=6$),则单块成功概率 $$p = \left(\frac{1}{27}\right)^6 \approx 2.44 \times 10^{-9}.$$ 这是一个极小的正数。
6.3 无限次尝试下的概率分析
6.3.1 至少成功一次的概率
设 $A_k$为“第$k$个块成功打出目标文本”的事件,则$P(A_k) = p$且$\lbrace A_k\rbrace _{k=1}^\infty$ 相互独立。
事件“猴子最终至少成功一次”可表示为 $\bigcup_{k=1}^\infty A_k$。其对立事件是“所有块都失败”,其概率为: $$P\negthinspace\left(\bigcap_{k=1}^\infty \overline{A_k}\right) = \prod_{k=1}^\infty (1-p).$$ 因为 $\prod_{k=1}^\infty (1-p) = \lim_{N\to\infty} (1-p)^N = 0$(因为 $0 < p \le 1$),所以 $$P(\text{至少成功一次}) = 1 - 0 = 1.$$ 从而至少成功一次的概率为 1。即“几乎必然”发生。
概率为 1 不等于逻辑必然
注意:此结论并不意味着“猴子一定、绝对会打出目标文本”。存在一个可能的结果——猴子永远只敲字母 a 而不碰其他键,这个结果发生的概率为 $\lim_{n\to\infty} (1/m)^{n} = 0$,是零概率事件,但它并不是逻辑上的不可能事件。这体现了概率论中“几乎必然”与“必然”的区别:一个事件概率为 1,但仍可能不发生(只要该不发生的可能结果集合测度为 0)。
6.3.2 更细致的分析:成功次数趋于无穷
事实上,我们可以说得更强:猴子不仅会成功一次,而是会无穷多次成功打出目标文本。因为无限次独立尝试中,成功次数服从一个参数为 $p$ 的无限次伯努利试验的极限行为。
波莱尔–坎特利第二引理
若事件列 $\lbrace A_k\rbrace $相互独立,且$\sum_{k=1}^\infty P(A_k) = \infty$,则 $P(A_k \text{ 发生无穷多次}) = 1$。
在我们的问题中,$P(A_k)=p$ 为常数,$\sum_{k=1}^\infty p = \infty$,因此由波莱尔–坎特利第二引理,事件“成功发生无穷多次”的概率为 1。这意味着在无限长的字符串中,目标文本 $T$会出现无限多次,且每次出现间隔的期望长度为$1/p$个块(即$L/p$ 次敲击)。
6.4 与大数定律及二项分布的联系
如果将每个块看作一次伯努利试验,则前 $N$块中成功的次数$S_N \sim \text{Binomial}(N, p)$。当 $N$非常大时,由弱大数定律,成功频率$\frac{S_N}{N}$依概率收敛于$p$,但这并不意味着一定能保证至少有一次成功,因为频率是一个平均概念。而“至少一次成功”的概率计算依靠的是互补事件的乘积,它是严格为 1 的极限结果。
此外,我们可以用中心极限定理来近似概率:当 $N$ 充分大时,$S_N$近似服从正态分布$\mathcal{N}(Np, Np(1-p))$,但这个近似对于极端事件(如 $S_N \ge 1$)的精确概率计算并不必要,因为我们已经有了精确的 $1-(1-p)^N$ 形式。
6.5 无限猴子问题的现实启示
- 理解低概率 × 大次数 = 必然发生:即使事件在单次试验中极不可能,但只要给予足够多的独立试验机会,它发生的概率可以任意接近 1。这对于保险精算、风险管理中的“尾部事件”有警示意义。
- 几乎必然 vs. 必然:这是现代概率论严密化的一个重要动因。零测集的存在要求我们小心区分“必然”与“几乎必然”。
- 随机性与信息:从信息论角度看,一个无限随机的序列几乎必然包含所有可能的有限子序列(这一性质称为“通有性”或“正规性”),这也是算法信息论和柯尔莫哥洛夫复杂度理论的思想源头之一。
例 6.1(有限时间的近似)
假设一只猴子每秒敲一次键盘($m=27$),目标文本为 “monkey”($L=6$)。那么要在 $N$块内至少成功一次的概率为$1 - (1-p)^N$。若我们希望这个概率达到 99%,需要多少块?
解:令 $1 - (1-p)^N \ge 0.99 \Rightarrow (1-p)^N \le 0.01$。取对数,$N \ln(1-p) \le \ln(0.01)$。利用 $\ln(1-p) \approx -p$($p$很小),得$N \cdot (-p) \le \ln(0.01) \Rightarrow N \ge \frac{-\ln 0.01}{p} \approx \frac{4.605}{2.44 \times 10^{-9}} \approx 1.89 \times 10^9$块。每块 6 秒,需要时间约$1.13 \times 10^{10}$ 秒,即约 359 年。如果猴子寿命有限,那确实需要很多猴子或更长时间,但“无限”给了我们确定的结论。
6.6 关联概念总结
本章小结
- 问题模型:无限次独立等可能敲击,产生无限长字符串。目标文本长度 $L$,单块概率 $p = (1/m)^L$。
- 独立性:各块相互独立,成功事件列独立。
- 几乎必然发生:无限次试验中至少成功一次的概率为 1,由互补乘积或几何级数极限得到。
- 波莱尔–坎特利引理:成功发生无穷多次,概率为 1。
- 区分“必然”与“几乎必然”:概率为 0 的事件不一定是不可能事件,概率为 1 的事件不一定是必然事件。
- 与二项分布、大数定律的联系:前 $N$块成功次数服从二项分布,频率收敛于$p$,但“至少一次成功”是独立乘积的极限,两者一致且相互补充。