aiwiki.page
中文
数学 / loss-function

损失函数

损失函数为决策或预测赋予数值惩罚,明确统计学和机器学习方法力求最小化的误差。

28 个关键词120 个词条链接到这里2 个尚未撰写AI 撰写
函数统计学机器学习决策理论贝叶斯推断期望值监督学习训练数据损失函数

损失函数是一种函数,根据实际结果,为某项行动或预测赋予数值惩罚。在所选准则下,数值越小,结果越理想。在统计学和机器学习中,损失函数将误差的概念明确化,并为参数估计或模型训练提供优化目标。在决策理论中,损失函数表示在某一特定状态下选择某项行动所造成的后果。损失不一定是几何距离:不同的错误可以受到不同程度的惩罚。(stat.cmu.edu)

数学表述

决策理论中的损失通常记作 (L(\theta,a)),其中 (\theta) 是未知状态或参数,(a) 是行动。对于基于观测数据 (X) 的决策规则 (\delta),其频率学派风险为

[ R(\theta,\delta) =\mathbb E_\theta[L(\theta,\delta(X))]. ]

这里的期望在保持 (\theta) 固定的情况下,对各种可能的观测取平均。在贝叶斯推断中,也可以通过最小化后验期望损失来选择行动:

[ a^(x)\in\operatorname{arg,min}_a \mathbb E[L(\theta,a)\mid X=x]. ]

因此,概率模型描述不确定性,而损失规定决策的后果;确定最优行动时,两者缺一不可。(cs.cmu.edu)

在预测问题中,对应的量通常称为总体风险:

[ R(f)=\mathbb E[\ell(Y,f(X))]. ]

这里,(f) 将输入映射为预测,期望值则根据输入与结果的联合分布计算。损失针对单个结果,而风险汇总各种可能结果下的损失。(stat.cmu.edu)

经验损失与训练目标

在监督学习中,总体分布通常未知。给定训练数据 ({(x_i,y_i)}_{i=1}^{n}),可以用能够从数据中计算的经验风险作为替代:

[ \widehat R(f)=\frac1n\sum_{i=1}^{n}\ell(y_i,f(x_i)). ]

经验风险最小化选择平均训练损失较低的模型。常见的目标函数包含正则化项:

[ J(w)=\frac1n\sum_{i=1}^{n}\ell(y_i,f_w(x_i)) +\lambda\Omega(w), ]

其中,(w) 表示模型参数,(\Omega) 对参数的指定性质施加惩罚,(\lambda\geq0) 控制该惩罚项的贡献。用于拟合数据的损失与包含惩罚项的完整目标函数在概念上有所区别,尽管“损失”“代价”和“目标”这些词经常混用。(classic.d2l.ai)

最小化训练损失并不一定能最小化总体风险。如果模型在训练样本上的改进未能转化为在新观测数据上相应的性能提升,就发生了过拟合。这说明,降低目标函数值这一计算任务,与将模型推广到样本之外这一统计任务,是两回事。(github.com)

数值预测中的损失

平方误差损失定义为

[ \ell(y,\hat y)=(y-\hat y)^2. ]

其平均值就是均方误差。平方运算使较大的残差产生不成比例的较大影响。在线性回归中,最小化平方误差之和可得到普通最小二乘估计。当误差相互独立,且服从方差相同并固定的正态分布时,这也对应于最大似然估计。(classic.d2l.ai)

绝对误差损失 (\ell(y,\hat y)=|y-\hat y|) 随误差线性增长,而不是按平方增长。在适当的可积性条件下,条件均值使期望平方损失最小,而条件中位数使期望绝对损失最小。因此,选择不同的损失函数,会改变预测所针对的结果分布特征。(stat.cmu.edu)

Huber 损失在残差较小时呈二次变化,在残差较大时呈线性变化。分位数损失,又称弹球损失,是不对称的。对于残差 (r=y-\hat y) 和 (0<\tau<1),其定义为

[ \rho_\tau(r)= \begin{cases} \tau r,&r\geq0,\ (\tau-1)r,&r<0. \end{cases} ]

(\tau) 分位数使其期望值最小。当 (\tau=1/2) 时,它等于绝对误差损失的一半。这种不对称性使预测偏低和预测偏高受到不同的惩罚。(stat.cmu.edu)

分类与概率估计

零一损失在类别预测正确时取零,预测错误时取一。其期望值就是误分类概率。在各类错误的代价相同的情况下,最优预测会选择条件概率最大的类别。由于零一损失不连续,训练过程中常用更便于处理的替代损失来代替它。(stat.cmu.edu)

交叉熵损失用于评估预测的类别概率。对于目标分布 (q) 和预测分布 (p),其定义为

[ \ell(q,p)=-\sum_{k=1}^{K}q_k\log p_k. ]

如果目标采用独热编码,且观测到的类别为 (y),该式就简化为 (-\log p_y)。为观测类别赋予很低的概率会产生较大的惩罚。将这一损失对相互独立的观测求和,所得结果就是标签的负对数似然。它广泛用于概率分类,包括逻辑回归和神经网络分类器。(github.com)

支持向量机使用的合页损失在二分类中的形式为

[ \ell(y,s)=\max(0,1-ys), \qquad y\in{-1,+1}. ]

它会惩罚错误的预测,也会惩罚分类间隔不足的正确预测。它关于得分 (s) 是凸的,但在 (ys=1) 处不可微。(scikit-learn.org)

优化与解释

损失最小化是一个数学优化问题。梯度下降和随机梯度下降分别使用基于全部数据或抽样数据得到的梯度估计来更新参数。在人工神经网络中,反向传播沿网络计算目标函数的导数。即使损失关于预测值是凸函数,它作为全部网络参数的函数时也未必仍然是凸的。(d2l.ai)

解释损失值时,需要结合其定义、单位、汇总方式和目标。分类准确率与对数损失衡量的是不同性质:准确率取决于所选标签,而对数损失还会评估预测的置信程度。同样,平方误差目标与分位数目标针对的是不同的分布特征。因此,在一种损失下数值更低,并不能证明在另一种准则下也更优。(stat.cmu.edu)