正则化是数学、统计学和机器学习中的一类方法,通过为估计问题引入额外结构来发挥作用。它可以稳定那些对测量误差高度敏感的解,消除多个可能解之间的歧义,或抑制模型对噪声的拟合。在数学逆问题中,正则化侧重于稳定重建;在统计学习中,它通常侧重于减少过拟合,并提高模型在观测数据之外的泛化(机器学习)能力。正则化可以采用显式惩罚项、约束或修改训练过程等形式。(arxiv.org)
数学表述
一种常见的表述是将数据拟合目标与惩罚项结合起来:
[ \hat{\theta}{\lambda} =\operatorname*{arg,min}{\theta} \left{L(\theta;D)+\lambda R(\theta)\right}. ]
这里,(\theta) 表示未知参数,(D) 表示观测数据,(L) 是损失函数,(R) 是正则化项,用于表达对特定解的偏好。系数 (\lambda\geq0) 决定这种偏好的相对重要性。正则化项可以偏好幅度较小的参数、平滑的信号或其他指定结构。因此,正则化改变的是何种解可被接受,而不只是改进原有问题的数值实现。(deeplearningbook.org)
一种相关的数学优化表述是在约束 (R(\theta)\leq t) 下最小化 (L)。在适当的凸优化条件下,约束形式与惩罚形式可以描述相互对应的解,但两者的参数不一定具有一一对应关系。加入惩罚项并不自动保证解的唯一性;这取决于目标函数的性质和所采用的模型。(web.stanford.edu)
逆问题与稳定性
逆问题是根据某个未知对象产生的测量结果来推断该对象的问题。这类问题可能是不适定的,因为解可能不存在、不唯一,或不随观测数据连续变化。即使存在精确的逆运算,微小的测量误差也可能导致很大的重建误差。正则化用受控的近似来代替不稳定的逆运算。(arxiv.org)
对于线性测量模型 (Ax\approx b),吉洪诺夫正则化通常采用以下形式:
[ \hat{x}{\lambda} =\operatorname*{arg,min}{x} \left{|Ax-b|_2^2+\lambda|Bx|_2^2\right}. ]
算子 (B) 指定惩罚的对象:选择恒等算子会惩罚幅度,而差分算子可以惩罚不平滑性。当 (B=I) 且 (\lambda>0) 时,有限维情形下的解为
[ \hat{x}_{\lambda} =(A^{\mathsf T}A+\lambda I)^{-1}A^{\mathsf T}b. ]
新增的项使逆运算更加稳定。其他方法包括谱滤波、截断奇异值分解,以及在噪声被过度放大之前停止迭代重建。在收敛理论中,正则化参数根据噪声水平选取,使重建结果在噪声趋于零时趋近于某个适当的精确解。(web.stanford.edu)
统计学习中的参数惩罚
在线性回归中,岭回归将系数向量的欧几里得范数平方加入残差平方和。这种 (L_2) 惩罚会收缩系数,并降低模型对相关预测变量的敏感性。当所有系数都受到惩罚且惩罚强度为正时,即使设计矩阵不满列秩,系数的解也是唯一的。岭回归通常会收缩系数,但不会将其恰好设为零。(scikit-learn.org)
Lasso回归则采用
[ R(\theta)=|\theta|_1=\sum_j|\theta_j|. ]
(L_1) 惩罚可以使系数恰好为零,从而将估计与变量选择结合起来。它产生的稀疏性不同于岭回归的连续收缩。当预测变量之间高度相关时,Lasso可能选择其中一个而排除另一个。弹性网络结合了 (L_1) 惩罚与 (L_2) 范数平方惩罚,既能产生稀疏解,又保留了岭回归的部分稳定作用。这些惩罚也适用于最小二乘法之外的方法,包括逻辑回归。(scikit-learn.org)
统计解释
正则化引入了并非完全由观测数据决定的偏好。在贝叶斯推断中,最小化负对数似然与惩罚项之和可以对应于最大后验估计:忽略缩放和加法常数后,惩罚项代表负对数先验。高斯先验产生 (L_2) 范数平方惩罚,拉普拉斯先验则产生 (L_1) 惩罚。这种对应关系涉及后验分布的众数,而不是完整的后验分布。(deeplearningbook.org)
经典的偏差-方差权衡解释了正则化的一种作用:收缩可能增大估计偏差,同时降低估计结果在不同数据集之间的变动程度。过强的正则化可能导致欠拟合。系数更小或非零参数更少,并不总意味着预测更好;实际效果取决于数据以及所施加偏好的适切性。(deeplearningbook.org)
基于训练过程的正则化
在人工神经网络中,正则化不一定表现为额外的惩罚项。随机失活在训练时随机停用部分单元,以减少模型对特定单元组合的依赖。早停法限制训练时长,通常根据留出数据上的表现选择某个检查点。数据增强提供经过变换的样本,以体现预期的不变性,例如不改变标签的图像变换。(jmlr2020.csail.mit.edu)
权重衰减在优化过程中直接收缩参数。对于普通的随机梯度下降,经过适当缩放的权重衰减与 (L_2) 惩罚等价。但对于Adam优化器等自适应方法,这种等价关系通常不成立。AdamW采用解耦权重衰减,将参数收缩与损失梯度更新分开执行。(arxiv.org)
选择与评估
正则化强度通常通过验证集或交叉验证来选择。其数值取决于所采用的约定:对损失取平均而不是求和,会改变损失相对于惩罚项的尺度。特征缩放也会改变系数惩罚的含义。(scikit-learn.org)
评估时应区分用于调参的数据与专门用于评估所选模型的测试集。预处理所需的统计量必须在相应的训练数据划分内估计;使用留出观测数据来拟合变换或选择正则化设置,会造成数据泄漏(机器学习),并可能使性能估计过于乐观。(scikit-learn.org)