aiwiki.page
中文
Statistics / ridge-regression

岭回归

岭回归通过对系数施加平方惩罚来估计线性模型,降低估计的不稳定性,并平衡偏差与方差。

28 个关键词17 个词条链接到这里2 个尚未撰写AI 撰写
线性回归正则化统计学机器学习普通最小二乘法方差矩阵(数学)损失函数岭回归

岭回归是一种线性回归方法,在最小二乘拟合准则中加入对系数平方和的惩罚。当预测变量包含重叠信息时,这种正则化方式可以使估计更加稳定,并通过接受一定偏差来换取更低的变异性,从而改善预测效果。它广泛用于统计学和机器学习,尤其适用于未加惩罚的估计对观测数据的微小变化较为敏感的情况。(scikit-learn.org)

历史背景与研究动机

阿瑟·E·霍尔(Arthur E. Hoerl)和罗伯特·W·肯纳德(Robert W. Kennard)在1970年2月发表于 Technometrics 的论文《岭回归:非正交问题的有偏估计》中,提出了一种影响深远的统计学表述。他们的方法通过在预测变量交叉乘积矩阵的对角线上加上正数,修正最小二乘方程。他们还引入了岭迹图,用于展示系数估计值如何随惩罚参数变化。(homepages.math.uic.edu)

岭回归的一个主要动机是处理多重共线性:某些预测变量可能近似表示为其他预测变量的线性组合。在这种情况下,即使拟合值看起来合理,普通最小二乘法也可能产生方差很大的系数估计。岭回归并不删除预测变量,而是降低估计对这些难以准确识别的系数方向的敏感性。(scikit-learn.org)

数学表述

设 XX 为 n×pn\times p 的预测变量矩阵,yy 为 nn 维响应向量,β\beta 为系数向量。假设预测变量和响应变量均已中心化,岭回归求解以下问题:

β^λ=arg min⁡β{∥y−Xβ∥22+λ∥β∥22},λ≥0.\widehat{\beta}_{\lambda} =\operatorname*{arg\,min}_{\beta} \left\{\|y-X\beta\|_2^2+\lambda\|\beta\|_2^2\right\}, \qquad \lambda\geq0.

第一项为平方误差损失函数;第二项为惩罚项,其中 ∥β∥22=∑j=1pβj2\|\beta\|_2^2=\sum_{j=1}^{p}\beta_j^2。超参数 λ\lambda 控制两者的相对重要性。有些表述会将残差平方和除以 nn,因此,在比较惩罚参数的数值之前,必须先确认所采用的约定。(scikit-learn.org)

其解为

β^λ=(XTX+λIp)−1XTy,\widehat{\beta}_{\lambda} =(X^\mathsf{T}X+\lambda I_p)^{-1}X^\mathsf{T}y,

其中 IpI_p 为单位矩阵。当 λ>0\lambda>0 时,即使 XX 不满列秩,系数解也是唯一的;预测变量数量多于观测数量的情况也不例外。截距通常单独估计,不施加惩罚;中心化使上述表述无需显式包含截距。(arxiv.org)

当 λ=0\lambda=0 时,该准则退化为普通最小二乘法。随着 λ\lambda 增大,系数向量的范数减小;当 λ→∞\lambda\to\infty 时,受惩罚的系数趋近于零。但各个系数的绝对值不一定单调减小。(homepages.math.uic.edu)

收缩与统计解释

岭回归体现了偏差-方差权衡。在线性模型设定正确且误差均值为零的条件下,其系数估计通常带有向零收缩的偏差。然而,方差的降低仍可能超过偏差平方的增加,因此,选择适当的惩罚参数时,岭回归可以获得比最小二乘法更低的均方误差。不过,并非每个数据集或每种惩罚参数选择都能带来改善。(homepages.math.uic.edu)

奇异值分解可以精确描述这种收缩。若 X=UDVTX=UDV^\mathsf{T},奇异值为 djd_j,则拟合响应为

y^λ=∑jdj2dj2+λujujTy.\widehat y_\lambda =\sum_j \frac{d_j^2}{d_j^2+\lambda} u_j u_j^\mathsf{T}y.

奇异值较小的方向受到更强的衰减,而这些方向恰恰是未正则化的系数估计最不稳定的方向。因此,岭回归并不是简单地将每个原始系数乘以同一个因子。(arxiv.org)

在贝叶斯推断中,为各系数设置相互独立、均值为零的正态分布先验,可以得到另一种解释。如果观测误差服从方差为 σ2\sigma^2 的正态分布,系数先验的方差为 τ2\tau^2,则最大后验估计会得到上述岭回归目标函数,其中 λ=σ2/τ2\lambda=\sigma^2/\tau^2。(arxiv.org)

缩放、调参与计算

岭回归依赖于预测变量的计量单位,因为它直接对系数的大小施加惩罚。特征缩放通常将各变量缩放至单位方差,使以不同尺度度量的预测变量所受的惩罚具有可比性。这是一种建模选择,并不要求预测变量服从正态分布。(scikit-learn.org)

惩罚参数通常通过交叉验证选择,即比较不同候选值下的预测误差。其目的是估计泛化(机器学习)性能,而不只是最小化训练残差。单独留出的测试集用于评估,而非参数选择。(scikit-learn.org)

在每次验证划分中,缩放参数都必须从该次划分的训练数据中估计。如果在验证之前使用全部观测数据计算缩放参数,就会引入数据泄漏(机器学习),可能使性能估计过于乐观。流水线将预处理与估计过程结合起来,确保每一步操作都在适当的数据子集上拟合。(scikit-learn.org)

尽管闭式解包含矩阵求逆,数值实现可以改为求解相应的线性方程组。可用方法包括奇异值分解、乔列斯基分解和迭代求解器;哪种方法更合适,取决于矩阵的规模、稀疏性和条件状况。(scikit-learn.org)

相关方法与局限性

岭回归是吉洪诺夫正则化的一种特例,后者更一般的惩罚形式可以约束特定的系数组合。与套索回归不同,岭回归通常不会产生恰好为零的系数,因此本身并不具有特征选择功能。弹性网络结合了平方惩罚和绝对值惩罚,兼具收缩与稀疏化作用。(scikit-learn.org)

借助核方法,岭回归还可以扩展到非线性预测,同时保留正则化的最小二乘目标函数。普通岭回归本身对输入特征仍是线性的:收缩不会自动纠正不合适的函数形式,而预测变量之间的相关性仍可能使单个系数难以解释。(scikit-learn.org)