Skip to content

随机变量与分布(Random Variables and Distributions)

核心定位

随机变量是将随机试验结果映射到实数的函数,是连接概率空间数学分析的桥梁。本笔记从随机变量的定义出发,系统梳理离散型与连续型分布、期望与方差的性质,并连接 概率论贝叶斯定理最小二乘 等相关板块。


一、随机变量的定义

1.1 随机变量的概念

随机变量(Random Variable)

设 $(\Omega, \mathcal{F}, P)$是一个概率空间。随机变量$X$是定义在样本空间$\Omega$ 上的实值函数: $$X: \Omega \to \mathbb{R}$$ 且满足可测性条件:对任意实数 $x$,$\lbrace \omega \in \Omega : X(\omega) \le x\rbrace \in \mathcal{F}$。

直观理解:随机变量将「随机试验的结果」编码为一个实数。例如:

  • 掷一枚硬币,定义 $X(\text{正面}) = 1$,$X(\text{反面}) = 0$。
  • 测量某人的身高,$X$ 直接取身高的数值(单位:cm)。

随机变量不是「变量」也不是「随机」

「随机变量」一词略有误导——它本质是一个函数(从样本空间到实数),而不是一个取值不确定的变量。但由于历史原因,这一术语沿用至今。

1.2 离散型与连续型随机变量

类型定义取值集合描述工具
离散型(Discrete)取值有限个或可列无限个$\lbrace x_1, x_2, \dots\rbrace $分布律(Probability Mass Function, PMF)$P(X=x_k)=p_k$
连续型(Continuous)取值充满某个区间不可列无限(如 $\mathbb{R}$ 上某区间)概率密度函数(Probability Density Function, PDF)$f(x)$

连续型随机变量的单点概率

对于连续型随机变量 $X$,任取单点 $x_0$,有 $P(X = x_0) = 0$。因此 $P(a \le X \le b) = P(a < X < b)$,端点不影响概率。


二、分布函数

2.1 定义

累积分布函数(Cumulative Distribution Function, CDF)

对任意随机变量 $X$,其分布函数定义为: $$F(x) = P(X \le x), \quad x \in \mathbb{R}$$

分布函数是描述随机变量最通用的工具——无论离散型还是连续型,分布函数都有定义。

2.2 分布函数的性质

设 $F(x)$是随机变量$X$ 的分布函数,则:

  1. 单调非降(Monotonicity):若 $x_1 < x_2$,则 $F(x_1) \le F(x_2)$。
  2. 有界性(Boundedness):$0 \le F(x) \le 1$,且 $$\lim_{x \to -\infty} F(x) = 0,\quad \lim_{x \to +\infty} F(x) = 1$$
  3. 右连续性(Right-continuity):$F(x) = F(x^+) = \lim_{t \to x^+} F(t)$。
  4. 区间概率:$P(a < X \le b) = F(b) - F(a)$。

离散型与连续型的 CDF 形态

  • 离散型:$F(x)$是阶梯函数(step function),在每个取值点$x_k$处跳跃$p_k$。
  • 连续型:若 $X$有密度$f(x)$,则 $F(x) = \int_{-\infty}^{x} f(t)\thinspace{}dt$,且 $F'(x) = f(x)$(在 $f$ 的连续点处)。

三、离散型分布

3.1 二项分布(Binomial Distribution)

$X \sim B(n, p)$

$n$ 重伯努利试验中成功的次数服从二项分布。分布律为: $$P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k = 0, 1, \dots, n$$

  • 期望:$E(X) = np$
  • 方差:$D(X) = np(1-p)$

背景:每次试验成功概率为 $p$,$n$ 次独立重复试验中「成功」出现的总次数。

典型场景

  • 抛硬币 $10$次,正面朝上的次数$\sim B(10, 0.5)$。
  • 质检中 $n$件产品的次品数(次品率$p$)$\sim B(n, p)$。

二项分布与 排列组合

二项分布的系数 $\binom{n}{k}$来源于组合数——从$n$次试验中选出$k$ 次成功的位置。计数原理是概率计算的基础。

3.2 泊松分布(Poisson Distribution)

$X \sim P(\lambda)$

分布律为: $$P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \quad k = 0, 1, 2, \dots$$

  • 期望:$E(X) = \lambda$
  • 方差:$D(X) = \lambda$

背景:描述单位时间/空间内随机事件发生的次数(如电话交换台收到的呼叫数、网页的访问量)。

泊松定理(Poisson Limit Theorem)

当 $n \to \infty$,$p \to 0$且$np \to \lambda$(常数)时,二项分布 $B(n, p)$趋近于泊松分布$P(\lambda)$。即: $$\lim_{n\to\infty} \binom{n}{k} p^k (1-p)^{n-k} = \frac{\lambda^k e^{-\lambda}}{k!}$$ 这是小概率事件在大量试验中出现次数的极限分布,体现了从离散到连续的过渡。

3.3 几何分布(Geometric Distribution)

$X \sim \text{Geom}(p)$

在伯努利试验序列中,首次成功所需的试验次数。分布律为: $$P(X = k) = (1-p)^{k-1} p, \quad k = 1, 2, 3, \dots$$

  • 期望:$E(X) = \dfrac{1}{p}$
  • 方差:$D(X) = \dfrac{1-p}{p^2}$

无记忆性(Memoryless Property)

几何分布是离散分布中唯一具有无记忆性的分布: $$P(X > m + n \mid X > m) = P(X > n)$$ 即「已经等了 $m$次还没成功」不影响「还需再等$n$ 次」的概率。


四、连续型分布

4.1 均匀分布(Uniform Distribution)

$X \sim U(a, b)$

概率密度函数为: $$f(x) = \begin{cases} \dfrac{1}{b-a}, & a < x < b \newline[6pt] 0, & \text{其他} \end{cases}$$

  • 期望:$E(X) = \dfrac{a+b}{2}$
  • 方差:$D(X) = \dfrac{(b-a)^2}{12}$

直观:在区间 $(a, b)$ 内每一点「等可能」被取到——这是连续型的等可能模型(对应离散型的古典概型)。

4.2 指数分布(Exponential Distribution)

$X \sim \text{Exp}(\lambda)$,($\lambda > 0$)

概率密度函数为: $$f(x) = \begin{cases} \lambda e^{-\lambda x}, & x > 0 \newline 0, & x \le 0 \end{cases}$$

  • 期望:$E(X) = \dfrac{1}{\lambda}$
  • 方差:$D(X) = \dfrac{1}{\lambda^2}$

背景:描述独立随机事件发生的时间间隔(如电子元件的寿命、排队论中的服务时间)。

指数分布的无记忆性

指数分布是连续分布中唯一具有无记忆性的分布,与几何分布的无记忆性对应: $$P(X > s + t \mid X > s) = P(X > t)$$

4.3 正态分布(Normal Distribution / Gaussian Distribution)

$X \sim N(\mu, \sigma^2)$

概率密度函数为: $$f(x) = \frac{1}{\sqrt{2\pi}\thinspace\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right), \quad x \in \mathbb{R}$$

  • 期望:$E(X) = \mu$
  • 方差:$D(X) = \sigma^2$

正态分布的图形特征(钟形曲线 / Bell Curve):

  • 关于 $x = \mu$ 对称。
  • 在 $x = \mu \pm \sigma$ 处有拐点。
  • $\mu$ 决定位置(location),$\sigma$ 决定离散程度(scale)。

正态分布的核心地位

正态分布是概率论与统计学中最重要的分布,其重要性来源于:

  1. 许多自然现象(身高、测量误差等)近似服从正态分布。
  2. 中心极限定理(见第五节)保证了大量独立随机变量之和近似正态分布。
  3. 正态分布具有良好的数学性质(如独立正态变量的线性组合仍为正态)。

五、期望与方差

5.1 期望(Expectation / Expected Value)

期望的定义

  • 离散型:$E(X) = \sum_{k} x_k \thinspace P(X = x_k)$(要求级数绝对收敛)
  • 连续型:$E(X) = \int_{-\infty}^{+\infty} x \thinspace f(x)\thinspace{}dx$(要求积分绝对收敛)

直观意义:期望是随机变量取值的「加权平均」,权重为概率,代表长期平均的意义。

5.2 期望的性质

  1. 线性性:$E(aX + bY) = aE(X) + bE(Y)$(无需独立!)
  2. 常数期望:$E(c) = c$
  3. 独立乘积的期望:若 $X$与$Y$独立,则$E(XY) = E(X)E(Y)$
  4. 函数的期望:$E[g(X)] = \begin{cases} \sum g(x_k)p_k & \text{(离散)} \newline \int g(x)f(x)dx & \text{(连续)} \end{cases}$

$E(XY) = E(X)E(Y)$ 需要独立性

期望的线性性不要求独立,但乘积的期望分解为期望之积必须以独立性为前提。

5.3 方差(Variance)

方差的定义

$$D(X) = \operatorname{Var}(X) = E\big[(X - E(X))^2\big]$$

计算常用公式: $$\boxed{D(X) = E(X^2) - [E(X)]^2}$$

直观意义:方差度量随机变量取值围绕期望的离散程度。标准差 $\sigma(X) = \sqrt{D(X)}$与$X$ 具有相同的量纲,更便于解释。

5.4 方差的性质

  1. $D(c) = 0$
  2. $D(aX + b) = a^2 D(X)$
  3. 若 $X$与$Y$独立,则$D(X + Y) = D(X) + D(Y)$
  4. 一般情况:$D(X + Y) = D(X) + D(Y) + 2\operatorname{Cov}(X, Y)$

六、正态分布的标准化与 $3\sigma$ 原则

6.1 标准化(Standardization)

标准正态分布 $Z \sim N(0, 1)$

若 $X \sim N(\mu, \sigma^2)$,则将其标准化: $$Z = \frac{X - \mu}{\sigma} \sim N(0, 1)$$

$Z$ 的密度函数为: $$\varphi(z) = \frac{1}{\sqrt{2\pi}} e^{-z^2/2}$$

分布函数记为 $\Phi(z) = P(Z \le z)$,可通过查标准正态分布表获取。

标准化使得我们可以用一套表解决所有正态分布的概率计算问题: $$P(X \le x) = \Phi\negthinspace\left(\frac{x - \mu}{\sigma}\right)$$

6.2 $3\sigma$ 原则(68–95–99.7 Rule)

对于正态分布 $X \sim N(\mu, \sigma^2)$:

区间概率说明
$(\mu - \sigma,\ \mu + \sigma)$$\approx 68.27\%$约$\frac{2}{3}$的数据落在$1\sigma$ 内
$(\mu - 2\sigma,\ \mu + 2\sigma)$$\approx 95.45\%$约$95\%$的数据落在$2\sigma$ 内
$(\mu - 3\sigma,\ \mu + 3\sigma)$$\approx 99.73\%$几乎全部数据落在$3\sigma$ 内

实用意义

$3\sigma$原则是质量控制和异常值检测的数学基础。若某个观测值偏离均值超过$3\sigma$,在正态假设下发生的概率仅约 $0.27\%$,可视为显著异常。


七、中心极限定理的直观理解

7.1 中心极限定理(Central Limit Theorem, CLT)

中心极限定理(Lindeberg–Lévy 形式)

设 $X_1, X_2, \dots, X_n$是独立同分布的随机变量,具有期望$\mu$和方差$\sigma^2 > 0$。则当 $n \to \infty$ 时,标准化样本均值的分布收敛于标准正态分布: $$\frac{\bar{X}_n - \mu}{\sigma / \sqrt{n}} \xrightarrow{d} N(0, 1)$$

等价地,$\bar{X}_n = \frac{1}{n} \sum_{i=1}^n X_i \approx N\negthinspace\left(\mu, \frac{\sigma^2}{n}\right)$(当 $n$ 充分大时)。

7.2 直观理解

中心极限定理告诉我们:

  1. 无论原始分布是什么(只要方差有限),大量独立随机变量的(或均值)总是近似服从正态分布。
  2. 样本量 $n$越大,近似越精确。通常$n \ge 30$ 即可获得较好的近似。
  3. 这是正态分布在自然界和统计学中无处不在的根本原因——大量微小独立效应的叠加产生正态分布。

直观例子

  • 掷一枚骰子 $n$ 次,点数和近似服从正态分布($n$ 大时)。
  • 测量误差 = 大量微小独立误差来源的总和,故测量误差近似正态。
  • 人群中身高的分布 ≈ 大量遗传与环境因素叠加 → 近似正态。

概率论 中大数定律的关系

  • 大数定律(LLN):$\bar{X}_n \xrightarrow{P} \mu$(样本均值收敛到期望),回答的是「均值趋向于什么值」。
  • 中心极限定理(CLT):回答的是「均值围绕 $\mu$ 的波动有多大,且波动的分布形态如何」。

LLN 说均值稳定,CLT 说均值的波动近似正态。两者互补,共同构成大样本统计推断的理论基础。


八、知识图谱

知识图谱入口

  • 概率论概率论:概率公理化体系、大数定律、随机事件基础
  • 贝叶斯定理贝叶斯定理:条件概率与后验更新,在随机变量的条件分布中自然延伸
  • 最小二乘最小二乘:正态误差假设下的最大似然估计等价于最小二乘法
  • 排列组合排列组合:古典概型的计数基础,离散型分布律 $\binom{n}{k}$ 的来源

基于 Obsidian 整理 · 由 VitePress 构建