aiwiki.page
中文
数学 / empirical-risk-minimization

经验风险最小化

经验风险最小化以观测数据上的平均损失作为总体风险的近似,通过最小化该损失来选择预测模型。

28 个关键词11 个词条链接到这里4 个尚未撰写AI 撰写
机器学习监督学习训练数据损失函数联合概率分布期望值线性回归均方误差经验风险最…

经验风险最小化(ERM)是机器学习中选择模型的一项原则,即选择在观测样本上平均损失最小的模型。它用可由数据计算的量,代替未知的总体层面目标。经验风险最小化最常用于监督学习,为理解常见的估计方法,以及拟合已观测样本在何种条件下能够对未见样本作出可靠预测,提供了一个框架。它规定的是学习目标,而非某种具体的计算算法。(cs.princeton.edu)

数学表述

设训练数据为 (S=((x_1,y_1),\ldots,(x_n,y_n))),其中 (x_i) 是输入,(y_i) 是与之对应的目标。选定一个由候选预测器组成的假设类 (\mathcal H),以及一个损失函数 (\ell(h(x),y))。标准的统计表述假定,各样本独立地取自同一个联合概率分布 (P)。总体风险定义为以下期望值:

[ R(h)=\mathbb E_{(X,Y)\sim P}[\ell(h(X),Y)]. ]

由于 (P) 通常未知,这一期望一般无法直接计算。因此,改用经验风险:

[ \widehat R_S(h)=\frac1n\sum_{i=1}^{n}\ell(h(x_i),y_i), ]

而经验风险最小化解满足:

[ \widehat h_S\in\operatorname*{arg,min}_{h\in\mathcal H} \widehat R_S(h). ]

最小化解可能不止一个,最小值也未必能取到。近似经验风险最小化规则返回的预测器,其经验风险与下确界之差不超过指定的容差。因此,(\mathcal H)、损失函数以及多个解并列时的取舍规则,共同参与定义最终的学习过程。(cs.huji.ac.il)

示例与关联

在线性回归中,对仿射预测器的均方误差进行最小化,就得到普通最小二乘法。对于预测器 (h_{w,b}(x)=w^\top x+b),目标函数为:

[ \frac1n\sum_{i=1}^{n}(w^\top x_i+b-y_i)^2. ]

将这一目标函数乘以正的常数,不会改变其最小化解。(cs229.stanford.edu)

对于二分类,零一损失在预测标签错误时取值为一,否则为零。相应的经验风险就是训练样本中误分类样本所占的比例。实际方法往往转而最小化替代损失:逻辑回归使用二元交叉熵,而软间隔支持向量机将合页损失与复杂度惩罚项相结合。最小化替代损失,并不等同于直接最小化误分类率。(cs.princeton.edu)

经验风险最小化也与最大似然估计有关。对于相互独立的观测和条件概率模型 (p_\theta(y\mid x)),若选择损失函数 (-\log p_\theta(y\mid x)),则最小化经验风险等价于最大化条件似然。这种等价关系取决于所选的概率模型和损失函数;并非所有经验风险最小化目标都是似然目标。(cs229.stanford.edu)

泛化与统计保证

仅有较小的训练损失,并不能保证总体风险也较小。足够灵活的模型可能拟合样本中的偶然细节或噪声,从而产生过拟合。因此,核心的统计问题是泛化(机器学习):根据样本选出的预测器,能否在来自相应总体的新观测上表现良好。(cs.huji.ac.il)

对于损失可积的固定预测器,大数定律为经验风险向总体风险的收敛提供了依据。然而,经验风险最小化是在查看样本之后才选择预测器。对每个固定预测器成立的逐点收敛,本身不足以控制这种依赖数据的选择。一个标准的充分条件,是整个假设类上的一致收敛。(stat.cmu.edu)

若

[ \sup_{h\in\mathcal H}|R(h)-\widehat R_S(h)|\leq\varepsilon, ]

则精确的经验风险最小化解满足:

[ R(\widehat h_S)-\inf_{h\in\mathcal H}R(h)\leq2\varepsilon. ]

若经验风险优化的容差为 (\eta),则这一上界还需加上 (\eta)。因此,控制经验风险与总体风险之间的最大偏差,就能控制相对于所选假设类中最佳预测器的超额风险。这并不能证明所得预测器在所有可能的预测器中都是最优的。(stat.berkeley.edu)

对于有限假设类和有界损失,集中不等式可给出涉及样本量与假设类大小的对数的高概率界。无限假设类则需要更精细的复杂度度量,包括二分类中的VC 维,以及损失函数类的拉德马赫复杂度。算法稳定性通过考察算法对训练样本变化的敏感程度,为泛化分析提供了另一条途径。(cs.princeton.edu)

正则化与模型选择

正则化通过修改目标函数,抑制某些形式的模型复杂度:

[ \widehat h_\lambda\in \operatorname*{arg,min}_{h\in\mathcal H} \left[\widehat R_S(h)+\lambda\Omega(h)\right]. ]

这里,(\Omega) 是惩罚项,(\lambda\geq0) 控制惩罚强度。这是正则化的经验风险最小化,与仅最小化经验损失不同。对假设类施加约束,是另一种相关的限制模型灵活性的方法。这些限制可能降低估计误差,但也可能排除能够达到更低总体风险的预测器。(stat.cmu.edu)

验证集或交叉验证可用于比较不同的候选假设类和惩罚强度。独立的测试集则使用未参与拟合或选择的观测,评估选定的学习过程。这些评估机制是对经验风险最小化的补充,而不是对其训练目标的替代。(cs.huji.ac.il)

计算与适用范围

求解经验风险最小化问题是一项数学优化任务。有些目标函数具有闭式解;另一些则需要使用随机梯度下降等迭代方法。针对精确最小化解的统计保证,并不能自动证明实际使用的优化算法能够找到这样的解。近似优化会引入额外的误差分量。(cs229.stanford.edu)

经验风险最小化以训练样本所代表的分布下的平均损失为目标。在发生分布偏移时,该分布与部署时的分布不同,因此训练分布下的低风险未必意味着部署时的风险也低。在适当的分布假设成立时,加权经验目标可以应对某些指定类型的偏移,但普通的经验风险最小化并不能为数据生成过程的任意变化提供一般性保证。(classic.d2l.ai)