岭回归是一种线性回归方法,在最小二乘拟合准则中加入对系数平方和的惩罚。当预测变量包含重叠信息时,这种正则化方式可以使估计更加稳定,并通过接受一定偏差来换取更低的变异性,从而改善预测效果。它广泛用于统计学和机器学习,尤其适用于未加惩罚的估计对观测数据的微小变化较为敏感的情况。(scikit-learn.org)
历史背景与研究动机
阿瑟·E·霍尔(Arthur E. Hoerl)和罗伯特·W·肯纳德(Robert W. Kennard)在1970年2月发表于 Technometrics 的论文《岭回归:非正交问题的有偏估计》中,提出了一种影响深远的统计学表述。他们的方法通过在预测变量交叉乘积矩阵的对角线上加上正数,修正最小二乘方程。他们还引入了岭迹图,用于展示系数估计值如何随惩罚参数变化。(homepages.math.uic.edu)
岭回归的一个主要动机是处理多重共线性:某些预测变量可能近似表示为其他预测变量的线性组合。在这种情况下,即使拟合值看起来合理,普通最小二乘法也可能产生方差很大的系数估计。岭回归并不删除预测变量,而是降低估计对这些难以准确识别的系数方向的敏感性。(scikit-learn.org)
数学表述
设 为 的预测变量矩阵, 为 维响应向量, 为系数向量。假设预测变量和响应变量均已中心化,岭回归求解以下问题:
第一项为平方误差损失函数;第二项为惩罚项,其中 。超参数 控制两者的相对重要性。有些表述会将残差平方和除以 ,因此,在比较惩罚参数的数值之前,必须先确认所采用的约定。(scikit-learn.org)
其解为
其中 为单位矩阵。当 时,即使 不满列秩,系数解也是唯一的;预测变量数量多于观测数量的情况也不例外。截距通常单独估计,不施加惩罚;中心化使上述表述无需显式包含截距。(arxiv.org)
当 时,该准则退化为普通最小二乘法。随着 增大,系数向量的范数减小;当 时,受惩罚的系数趋近于零。但各个系数的绝对值不一定单调减小。(homepages.math.uic.edu)
收缩与统计解释
岭回归体现了偏差-方差权衡。在线性模型设定正确且误差均值为零的条件下,其系数估计通常带有向零收缩的偏差。然而,方差的降低仍可能超过偏差平方的增加,因此,选择适当的惩罚参数时,岭回归可以获得比最小二乘法更低的均方误差。不过,并非每个数据集或每种惩罚参数选择都能带来改善。(homepages.math.uic.edu)
奇异值分解可以精确描述这种收缩。若 ,奇异值为 ,则拟合响应为
奇异值较小的方向受到更强的衰减,而这些方向恰恰是未正则化的系数估计最不稳定的方向。因此,岭回归并不是简单地将每个原始系数乘以同一个因子。(arxiv.org)
在贝叶斯推断中,为各系数设置相互独立、均值为零的正态分布先验,可以得到另一种解释。如果观测误差服从方差为 的正态分布,系数先验的方差为 ,则最大后验估计会得到上述岭回归目标函数,其中 。(arxiv.org)
缩放、调参与计算
岭回归依赖于预测变量的计量单位,因为它直接对系数的大小施加惩罚。特征缩放通常将各变量缩放至单位方差,使以不同尺度度量的预测变量所受的惩罚具有可比性。这是一种建模选择,并不要求预测变量服从正态分布。(scikit-learn.org)
惩罚参数通常通过交叉验证选择,即比较不同候选值下的预测误差。其目的是估计泛化(机器学习)性能,而不只是最小化训练残差。单独留出的测试集用于评估,而非参数选择。(scikit-learn.org)
在每次验证划分中,缩放参数都必须从该次划分的训练数据中估计。如果在验证之前使用全部观测数据计算缩放参数,就会引入数据泄漏(机器学习),可能使性能估计过于乐观。流水线将预处理与估计过程结合起来,确保每一步操作都在适当的数据子集上拟合。(scikit-learn.org)
尽管闭式解包含矩阵求逆,数值实现可以改为求解相应的线性方程组。可用方法包括奇异值分解、乔列斯基分解和迭代求解器;哪种方法更合适,取决于矩阵的规模、稀疏性和条件状况。(scikit-learn.org)
相关方法与局限性
岭回归是吉洪诺夫正则化的一种特例,后者更一般的惩罚形式可以约束特定的系数组合。与套索回归不同,岭回归通常不会产生恰好为零的系数,因此本身并不具有特征选择功能。弹性网络结合了平方惩罚和绝对值惩罚,兼具收缩与稀疏化作用。(scikit-learn.org)
借助核方法,岭回归还可以扩展到非线性预测,同时保留正则化的最小二乘目标函数。普通岭回归本身对输入特征仍是线性的:收缩不会自动纠正不合适的函数形式,而预测变量之间的相关性仍可能使单个系数难以解释。(scikit-learn.org)