Appearance
最小二乘法 (Least Squares Method)
核心思想
最小二乘法是求解线性方程组近似解的一种标准方法。当观测数据构成的矛盾方程组无精确解时,寻找使残差平方和达到最小的参数估计,由此得到的解在几何、概率与统计中均有深刻的解释。它不仅是曲线拟合的基石,也是线性回归与信号处理的核心工具。
1. 问题的提出
设有线性模型 $$\boldsymbol{y} = \boldsymbol{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}$$
- $\boldsymbol{y} \in \mathbb{R}^{n}$:观测值向量
- $\boldsymbol{X} \in \mathbb{R}^{n \times p}$:设计矩阵(满列秩时 $p \le n$)
- $\boldsymbol{\beta} \in \mathbb{R}^{p}$:待估参数向量
- $\boldsymbol{\varepsilon}$:未观测到的随机误差
由于测量噪声的存在,精确满足 $\boldsymbol{y} = \boldsymbol{X}\boldsymbol{\beta}$的$\boldsymbol{\beta}$通常不存在。我们转而寻求一个“最佳”近似,使得残差向量$\boldsymbol{e} = \boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta}$ 在某种度量下最小。
为什么是平方和?
若仅最小化残差的和 $\sum e_i$,正负抵消会丧失信息;若最小化绝对值之和,虽具有稳健性但不可导,难以解析求解。平方和可导、凸且易于得到显式解,同时在正态假设下与极大似然估计等价,因而成为经典选择。
2. 线性最小二乘的数学推导
2.1 目标函数
定义残差平方和 (Residual Sum of Squares, RSS): $$\text{RSS}(\boldsymbol{\beta}) = \Vert\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta}\Vert_2^2 = (\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta})^\mathsf{T}(\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta})$$
2.2 矩阵微分求极值
为求极小值,令 $\text{RSS}$对向量$\boldsymbol{\beta}$ 的梯度为零。展开目标函数: $$\begin{aligned} \text{RSS} &= \boldsymbol{y}^\mathsf{T}\boldsymbol{y} - \boldsymbol{y}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta} - \boldsymbol{\beta}^\mathsf{T}\boldsymbol{X}^\mathsf{T}\boldsymbol{y} + \boldsymbol{\beta}^\mathsf{T}\boldsymbol{X}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta} \newline &= \boldsymbol{y}^\mathsf{T}\boldsymbol{y} - 2\boldsymbol{y}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta} + \boldsymbol{\beta}^\mathsf{T}\boldsymbol{X}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta} \end{aligned}$$ (注意 $\boldsymbol{y}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta}$ 是标量,转置等于自身,故两项合并)
对 $\boldsymbol{\beta}$求梯度(利用矩阵微分法则$\frac{\partial \boldsymbol{a}^\mathsf{T}\boldsymbol{\beta}}{\partial \boldsymbol{\beta}} = \boldsymbol{a}$和$\frac{\partial \boldsymbol{\beta}^\mathsf{T}\boldsymbol{A}\boldsymbol{\beta}}{\partial \boldsymbol{\beta}} = (\boldsymbol{A}+\boldsymbol{A}^\mathsf{T})\boldsymbol{\beta}$): $$\nabla_{\boldsymbol{\beta}} \text{RSS} = -2\boldsymbol{X}^\mathsf{T}\boldsymbol{y} + 2\boldsymbol{X}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta}$$
令梯度为零,得到 正规方程 (Normal Equations):
正规方程
$$\boldsymbol{X}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta} = \boldsymbol{X}^\mathsf{T}\boldsymbol{y}$$
当 $\boldsymbol{X}$列满秩(即$\mathrm{rank}(\boldsymbol{X})=p$)时,$p \times p$矩阵$\boldsymbol{X}^\mathsf{T}\boldsymbol{X}$ 可逆,于是有唯一显式解: $$\boxed{\hat{\boldsymbol{\beta}} = (\boldsymbol{X}^\mathsf{T}\boldsymbol{X})^{-1} \boldsymbol{X}^\mathsf{T}\boldsymbol{y}}$$
此即普通最小二乘估计量 (Ordinary Least Squares, OLS)。
列不满秩的情形
若 $\boldsymbol{X}$ 列不满秩,$\boldsymbol{X}^\mathsf{T}\boldsymbol{X}$ 奇异,则正规方程有无穷多解。此时可通过广义逆(如 Moore-Penrose 伪逆)或正则化方法(如岭回归)获得唯一解。
3. 几何意义 —— 投影与正交
最小二乘解具有极其优雅的几何解释。
将 $\boldsymbol{X}$的列向量张成的子空间记作$\mathcal{C}(\boldsymbol{X}) \subseteq \mathbb{R}^n$。寻找 $\hat{\boldsymbol{\beta}}$等价于在$\mathcal{C}(\boldsymbol{X})$中寻找一个向量$\hat{\boldsymbol{y}} = \boldsymbol{X}\hat{\boldsymbol{\beta}}$,使其与观测 $\boldsymbol{y}$ 的欧几里得距离最短。
显然,当 $\boldsymbol{y}$到子空间$\mathcal{C}(\boldsymbol{X})$的垂足恰好是$\hat{\boldsymbol{y}}$时距离最小,即残差向量$\boldsymbol{e} = \boldsymbol{y} - \hat{\boldsymbol{y}}$必须垂直于子空间$\mathcal{C}(\boldsymbol{X})$: $$\boldsymbol{e} \perp \mathcal{C}(\boldsymbol{X}) \thickspace\Longleftrightarrow\thickspace \boldsymbol{X}^\mathsf{T}\boldsymbol{e} = \boldsymbol{0}$$
这正是正规方程: $$\boldsymbol{X}^\mathsf{T}(\boldsymbol{y} - \boldsymbol{X}\hat{\boldsymbol{\beta}}) = \boldsymbol{0} \quad\Longrightarrow\quad \boldsymbol{X}^\mathsf{T}\boldsymbol{X}\hat{\boldsymbol{\beta}} = \boldsymbol{X}^\mathsf{T}\boldsymbol{y}$$
投影矩阵
记 $\boldsymbol{H} = \boldsymbol{X}(\boldsymbol{X}^\mathsf{T}\boldsymbol{X})^{-1}\boldsymbol{X}^\mathsf{T}$,则 $\hat{\boldsymbol{y}} = \boldsymbol{H}\boldsymbol{y}$。
$\boldsymbol{H}$是将任何$n$维向量正交投影到$\mathcal{C}(\boldsymbol{X})$上的投影矩阵(帽子矩阵),满足$\boldsymbol{H}^2 = \boldsymbol{H}$(幂等)且 $\boldsymbol{H}^\mathsf{T} = \boldsymbol{H}$(对称)。
残差 $\boldsymbol{e} = (\boldsymbol{I} - \boldsymbol{H})\boldsymbol{y}$,其中 $\boldsymbol{I}-\boldsymbol{H}$是向正交补空间$\mathcal{C}(\boldsymbol{X})^\perp$ 的投影。
几何视角揭示了最小二乘的本质:用数据向模型空间做正交投影,信息损失(残差平方和)即为垂足与观测点距离的平方。
4. 统计意义 —— 从高斯–马尔可夫到极大似然
4.1 高斯–马尔可夫定理
假设误差 $\boldsymbol{\varepsilon}$ 满足:
- 零均值:$\mathrm{E}[\boldsymbol{\varepsilon}] = \boldsymbol{0}$
- 同方差且不相关:$\mathrm{Cov}(\boldsymbol{\varepsilon}) = \sigma^2 \boldsymbol{I}_n$
在此条件下,OLS 估计量 $\hat{\boldsymbol{\beta}}$ 是 最佳线性无偏估计 (Best Linear Unbiased Estimator, BLUE):
- 线性:$\hat{\boldsymbol{\beta}}$是$\boldsymbol{y}$ 的线性函数
- 无偏性:$\mathrm{E}[\hat{\boldsymbol{\beta}}] = \boldsymbol{\beta}$
(因为 $\mathrm{E}[\hat{\boldsymbol{\beta}}] = (\boldsymbol{X}^\mathsf{T}\boldsymbol{X})^{-1}\boldsymbol{X}^\mathsf{T}\mathrm{E}[\boldsymbol{y}] = (\boldsymbol{X}^\mathsf{T}\boldsymbol{X})^{-1}\boldsymbol{X}^\mathsf{T}\boldsymbol{X}\boldsymbol{\beta} = \boldsymbol{\beta}$) - 最小方差:在所有线性无偏估计中,$\hat{\boldsymbol{\beta}}$的协方差矩阵$\mathrm{Cov}(\hat{\boldsymbol{\beta}}) = \sigma^2 (\boldsymbol{X}^\mathsf{T}\boldsymbol{X})^{-1}$ 是最小的(在矩阵半正定意义下)。
这意味着无需误差分布的具体形式,仅凭前两阶矩,OLS 已是线性估计类中的最优者。
4.2 正态分布下的极大似然估计
进一步假设 $\boldsymbol{\varepsilon} \sim \mathcal{N}(\boldsymbol{0}, \sigma^2 \boldsymbol{I}_n)$,则 $\boldsymbol{y} \sim \mathcal{N}(\boldsymbol{X}\boldsymbol{\beta}, \sigma^2 \boldsymbol{I})$。其似然函数为 $$L(\boldsymbol{\beta}, \sigma^2) = (2\pi\sigma^2)^{-n/2} \exp\negthinspace\left( -\frac{1}{2\sigma^2} \Vert\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta}\Vert^2 \right)$$
对数似然: $$\ell(\boldsymbol{\beta}, \sigma^2) = -\frac{n}{2}\ln(2\pi) - \frac{n}{2}\ln\sigma^2 - \frac{1}{2\sigma^2}\Vert\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta}\Vert^2$$
固定 $\sigma^2$,最大化 $\ell$等价于最小化$\Vert\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta}\Vert^2$。因此 OLS 恰好是误差正态假设下的极大似然估计 (MLE)。同时可推得 $\hat{\sigma}^2_{\text{MLE}} = \frac{1}{n}\text{RSS}(\hat{\boldsymbol{\beta}})$(有偏),无偏估计量为 $\frac{1}{n-p}\text{RSS}(\hat{\boldsymbol{\beta}})$。
正态性不是必须的
即使误差不服从正态分布,OLS 仍然保持无偏性与 BLUE 性质。但假设检验与置信区间等推断通常需要正态假定,或依赖大样本渐近性质。
5. 扩展视角
5.1 加权最小二乘 (Weighted LS)
若误差方差不相等 $\mathrm{Cov}(\boldsymbol{\varepsilon}) = \sigma^2 \boldsymbol{W}^{-1}$($\boldsymbol{W}$ 对称正定),可通过极小化加权残差平方和获得有效估计: $$\text{WRSS} = (\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta})^\mathsf{T} \boldsymbol{W} (\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta})$$ 其解为 $\hat{\boldsymbol{\beta}}_W = (\boldsymbol{X}^\mathsf{T}\boldsymbol{W}\boldsymbol{X})^{-1}\boldsymbol{X}^\mathsf{T}\boldsymbol{W}\boldsymbol{y}$。这相当于先把数据变换为同方差,再做普通最小二乘,几何上相当于在非欧度量下的投影。
5.2 正则化:岭回归
当 $\boldsymbol{X}$近似列不满秩或变量间存在多重共线性时,OLS 估计的方差极大。岭回归在目标函数中加入$L_2$ 惩罚项: $$\text{RSS}_{\text{ridge}} = \Vert\boldsymbol{y} - \boldsymbol{X}\boldsymbol{\beta}\Vert^2 + \lambda \Vert\boldsymbol{\beta}\Vert^2 \quad (\lambda > 0)$$ 解为 $\hat{\boldsymbol{\beta}}_{\text{ridge}} = (\boldsymbol{X}^\mathsf{T}\boldsymbol{X} + \lambda \boldsymbol{I})^{-1}\boldsymbol{X}^\mathsf{T}\boldsymbol{y}$。该修正改善了矩阵条件数,以微小偏差为代价大幅降低方差,是处理病态问题的经典方法。
6. 结语
最小二乘法远不止是一个优化算法:
- 代数上,它给出了超定方程的最佳低秩近似解;
- 几何上,它是高维空间向模型子空间的正交投影;
- 统计上,它在极弱假设下就是线性无偏估计的最优者,且与正态极大似然完美统一。
理解最小二乘法的这三个维度,就掌握了数据建模中最基本、最有力的语言。