Appearance
随机变量与分布(Random Variables and Distributions)
核心定位
随机变量是将随机试验结果映射到实数的函数,是连接概率空间与数学分析的桥梁。本笔记从随机变量的定义出发,系统梳理离散型与连续型分布、期望与方差的性质,并连接 概率论、贝叶斯定理、最小二乘 等相关板块。
一、随机变量的定义
1.1 随机变量的概念
随机变量(Random Variable)
设 $(\Omega, \mathcal{F}, P)$是一个概率空间。随机变量$X$是定义在样本空间$\Omega$ 上的实值函数: $$X: \Omega \to \mathbb{R}$$ 且满足可测性条件:对任意实数 $x$,$\lbrace \omega \in \Omega : X(\omega) \le x\rbrace \in \mathcal{F}$。
直观理解:随机变量将「随机试验的结果」编码为一个实数。例如:
- 掷一枚硬币,定义 $X(\text{正面}) = 1$,$X(\text{反面}) = 0$。
- 测量某人的身高,$X$ 直接取身高的数值(单位:cm)。
随机变量不是「变量」也不是「随机」
「随机变量」一词略有误导——它本质是一个函数(从样本空间到实数),而不是一个取值不确定的变量。但由于历史原因,这一术语沿用至今。
1.2 离散型与连续型随机变量
| 类型 | 定义 | 取值集合 | 描述工具 |
|---|---|---|---|
| 离散型(Discrete) | 取值有限个或可列无限个 | $\lbrace x_1, x_2, \dots\rbrace $ | 分布律(Probability Mass Function, PMF)$P(X=x_k)=p_k$ |
| 连续型(Continuous) | 取值充满某个区间 | 不可列无限(如 $\mathbb{R}$ 上某区间) | 概率密度函数(Probability Density Function, PDF)$f(x)$ |
连续型随机变量的单点概率
对于连续型随机变量 $X$,任取单点 $x_0$,有 $P(X = x_0) = 0$。因此 $P(a \le X \le b) = P(a < X < b)$,端点不影响概率。
二、分布函数
2.1 定义
累积分布函数(Cumulative Distribution Function, CDF)
对任意随机变量 $X$,其分布函数定义为: $$F(x) = P(X \le x), \quad x \in \mathbb{R}$$
分布函数是描述随机变量最通用的工具——无论离散型还是连续型,分布函数都有定义。
2.2 分布函数的性质
设 $F(x)$是随机变量$X$ 的分布函数,则:
- 单调非降(Monotonicity):若 $x_1 < x_2$,则 $F(x_1) \le F(x_2)$。
- 有界性(Boundedness):$0 \le F(x) \le 1$,且 $$\lim_{x \to -\infty} F(x) = 0,\quad \lim_{x \to +\infty} F(x) = 1$$
- 右连续性(Right-continuity):$F(x) = F(x^+) = \lim_{t \to x^+} F(t)$。
- 区间概率:$P(a < X \le b) = F(b) - F(a)$。
离散型与连续型的 CDF 形态
- 离散型:$F(x)$是阶梯函数(step function),在每个取值点$x_k$处跳跃$p_k$。
- 连续型:若 $X$有密度$f(x)$,则 $F(x) = \int_{-\infty}^{x} f(t)\thinspace{}dt$,且 $F'(x) = f(x)$(在 $f$ 的连续点处)。
三、离散型分布
3.1 二项分布(Binomial Distribution)
$X \sim B(n, p)$
$n$ 重伯努利试验中成功的次数服从二项分布。分布律为: $$P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k = 0, 1, \dots, n$$
- 期望:$E(X) = np$
- 方差:$D(X) = np(1-p)$
背景:每次试验成功概率为 $p$,$n$ 次独立重复试验中「成功」出现的总次数。
典型场景
- 抛硬币 $10$次,正面朝上的次数$\sim B(10, 0.5)$。
- 质检中 $n$件产品的次品数(次品率$p$)$\sim B(n, p)$。
二项分布与 排列组合
二项分布的系数 $\binom{n}{k}$来源于组合数——从$n$次试验中选出$k$ 次成功的位置。计数原理是概率计算的基础。
3.2 泊松分布(Poisson Distribution)
$X \sim P(\lambda)$
分布律为: $$P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \quad k = 0, 1, 2, \dots$$
- 期望:$E(X) = \lambda$
- 方差:$D(X) = \lambda$
背景:描述单位时间/空间内随机事件发生的次数(如电话交换台收到的呼叫数、网页的访问量)。
泊松定理(Poisson Limit Theorem)
当 $n \to \infty$,$p \to 0$且$np \to \lambda$(常数)时,二项分布 $B(n, p)$趋近于泊松分布$P(\lambda)$。即: $$\lim_{n\to\infty} \binom{n}{k} p^k (1-p)^{n-k} = \frac{\lambda^k e^{-\lambda}}{k!}$$ 这是小概率事件在大量试验中出现次数的极限分布,体现了从离散到连续的过渡。
3.3 几何分布(Geometric Distribution)
$X \sim \text{Geom}(p)$
在伯努利试验序列中,首次成功所需的试验次数。分布律为: $$P(X = k) = (1-p)^{k-1} p, \quad k = 1, 2, 3, \dots$$
- 期望:$E(X) = \dfrac{1}{p}$
- 方差:$D(X) = \dfrac{1-p}{p^2}$
无记忆性(Memoryless Property)
几何分布是离散分布中唯一具有无记忆性的分布: $$P(X > m + n \mid X > m) = P(X > n)$$ 即「已经等了 $m$次还没成功」不影响「还需再等$n$ 次」的概率。
四、连续型分布
4.1 均匀分布(Uniform Distribution)
$X \sim U(a, b)$
概率密度函数为: $$f(x) = \begin{cases} \dfrac{1}{b-a}, & a < x < b \newline[6pt] 0, & \text{其他} \end{cases}$$
- 期望:$E(X) = \dfrac{a+b}{2}$
- 方差:$D(X) = \dfrac{(b-a)^2}{12}$
直观:在区间 $(a, b)$ 内每一点「等可能」被取到——这是连续型的等可能模型(对应离散型的古典概型)。
4.2 指数分布(Exponential Distribution)
$X \sim \text{Exp}(\lambda)$,($\lambda > 0$)
概率密度函数为: $$f(x) = \begin{cases} \lambda e^{-\lambda x}, & x > 0 \newline 0, & x \le 0 \end{cases}$$
- 期望:$E(X) = \dfrac{1}{\lambda}$
- 方差:$D(X) = \dfrac{1}{\lambda^2}$
背景:描述独立随机事件发生的时间间隔(如电子元件的寿命、排队论中的服务时间)。
指数分布的无记忆性
指数分布是连续分布中唯一具有无记忆性的分布,与几何分布的无记忆性对应: $$P(X > s + t \mid X > s) = P(X > t)$$
4.3 正态分布(Normal Distribution / Gaussian Distribution)
$X \sim N(\mu, \sigma^2)$
概率密度函数为: $$f(x) = \frac{1}{\sqrt{2\pi}\thinspace\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right), \quad x \in \mathbb{R}$$
- 期望:$E(X) = \mu$
- 方差:$D(X) = \sigma^2$
正态分布的图形特征(钟形曲线 / Bell Curve):
- 关于 $x = \mu$ 对称。
- 在 $x = \mu \pm \sigma$ 处有拐点。
- $\mu$ 决定位置(location),$\sigma$ 决定离散程度(scale)。
正态分布的核心地位
正态分布是概率论与统计学中最重要的分布,其重要性来源于:
- 许多自然现象(身高、测量误差等)近似服从正态分布。
- 中心极限定理(见第五节)保证了大量独立随机变量之和近似正态分布。
- 正态分布具有良好的数学性质(如独立正态变量的线性组合仍为正态)。
五、期望与方差
5.1 期望(Expectation / Expected Value)
期望的定义
- 离散型:$E(X) = \sum_{k} x_k \thinspace P(X = x_k)$(要求级数绝对收敛)
- 连续型:$E(X) = \int_{-\infty}^{+\infty} x \thinspace f(x)\thinspace{}dx$(要求积分绝对收敛)
直观意义:期望是随机变量取值的「加权平均」,权重为概率,代表长期平均的意义。
5.2 期望的性质
- 线性性:$E(aX + bY) = aE(X) + bE(Y)$(无需独立!)
- 常数期望:$E(c) = c$
- 独立乘积的期望:若 $X$与$Y$独立,则$E(XY) = E(X)E(Y)$
- 函数的期望:$E[g(X)] = \begin{cases} \sum g(x_k)p_k & \text{(离散)} \newline \int g(x)f(x)dx & \text{(连续)} \end{cases}$
$E(XY) = E(X)E(Y)$ 需要独立性
期望的线性性不要求独立,但乘积的期望分解为期望之积必须以独立性为前提。
5.3 方差(Variance)
方差的定义
$$D(X) = \operatorname{Var}(X) = E\big[(X - E(X))^2\big]$$
计算常用公式: $$\boxed{D(X) = E(X^2) - [E(X)]^2}$$
直观意义:方差度量随机变量取值围绕期望的离散程度。标准差 $\sigma(X) = \sqrt{D(X)}$与$X$ 具有相同的量纲,更便于解释。
5.4 方差的性质
- $D(c) = 0$
- $D(aX + b) = a^2 D(X)$
- 若 $X$与$Y$独立,则$D(X + Y) = D(X) + D(Y)$
- 一般情况:$D(X + Y) = D(X) + D(Y) + 2\operatorname{Cov}(X, Y)$
六、正态分布的标准化与 $3\sigma$ 原则
6.1 标准化(Standardization)
标准正态分布 $Z \sim N(0, 1)$
若 $X \sim N(\mu, \sigma^2)$,则将其标准化: $$Z = \frac{X - \mu}{\sigma} \sim N(0, 1)$$
$Z$ 的密度函数为: $$\varphi(z) = \frac{1}{\sqrt{2\pi}} e^{-z^2/2}$$
分布函数记为 $\Phi(z) = P(Z \le z)$,可通过查标准正态分布表获取。
标准化使得我们可以用一套表解决所有正态分布的概率计算问题: $$P(X \le x) = \Phi\negthinspace\left(\frac{x - \mu}{\sigma}\right)$$
6.2 $3\sigma$ 原则(68–95–99.7 Rule)
对于正态分布 $X \sim N(\mu, \sigma^2)$:
| 区间 | 概率 | 说明 |
|---|---|---|
| $(\mu - \sigma,\ \mu + \sigma)$ | $\approx 68.27\%$ | 约$\frac{2}{3}$的数据落在$1\sigma$ 内 |
| $(\mu - 2\sigma,\ \mu + 2\sigma)$ | $\approx 95.45\%$ | 约$95\%$的数据落在$2\sigma$ 内 |
| $(\mu - 3\sigma,\ \mu + 3\sigma)$ | $\approx 99.73\%$ | 几乎全部数据落在$3\sigma$ 内 |
实用意义
$3\sigma$原则是质量控制和异常值检测的数学基础。若某个观测值偏离均值超过$3\sigma$,在正态假设下发生的概率仅约 $0.27\%$,可视为显著异常。
七、中心极限定理的直观理解
7.1 中心极限定理(Central Limit Theorem, CLT)
中心极限定理(Lindeberg–Lévy 形式)
设 $X_1, X_2, \dots, X_n$是独立同分布的随机变量,具有期望$\mu$和方差$\sigma^2 > 0$。则当 $n \to \infty$ 时,标准化样本均值的分布收敛于标准正态分布: $$\frac{\bar{X}_n - \mu}{\sigma / \sqrt{n}} \xrightarrow{d} N(0, 1)$$
等价地,$\bar{X}_n = \frac{1}{n} \sum_{i=1}^n X_i \approx N\negthinspace\left(\mu, \frac{\sigma^2}{n}\right)$(当 $n$ 充分大时)。
7.2 直观理解
中心极限定理告诉我们:
- 无论原始分布是什么(只要方差有限),大量独立随机变量的和(或均值)总是近似服从正态分布。
- 样本量 $n$越大,近似越精确。通常$n \ge 30$ 即可获得较好的近似。
- 这是正态分布在自然界和统计学中无处不在的根本原因——大量微小独立效应的叠加产生正态分布。
直观例子
- 掷一枚骰子 $n$ 次,点数和近似服从正态分布($n$ 大时)。
- 测量误差 = 大量微小独立误差来源的总和,故测量误差近似正态。
- 人群中身高的分布 ≈ 大量遗传与环境因素叠加 → 近似正态。
与 概率论 中大数定律的关系
- 大数定律(LLN):$\bar{X}_n \xrightarrow{P} \mu$(样本均值收敛到期望),回答的是「均值趋向于什么值」。
- 中心极限定理(CLT):回答的是「均值围绕 $\mu$ 的波动有多大,且波动的分布形态如何」。
LLN 说均值稳定,CLT 说均值的波动近似正态。两者互补,共同构成大样本统计推断的理论基础。