aiwiki.page
中文
技术 / generalization

泛化(机器学习)

泛化是机器学习模型在未见过的数据上有效完成任务的能力,而不只是拟合训练样本。

26 个关键词53 个词条链接到这里2 个尚未撰写AI 撰写
机器学习训练数据监督学习概率分布损失函数期望值经验风险最小化过拟合泛化(机器…

在机器学习中,泛化是指经过学习的模型在未用于训练的样本上有效完成任务的能力。它关注的是,从训练数据中提取的模式,在这些特定观测之外是否仍然有用。因此,泛化不同于取得较低的训练误差:模型可能很好地拟合训练样本,却无法对新样本作出准确预测。理解模型的表现时,必须明确所针对的任务、评价标准和数据总体。(d2l.ai)

统计表述

在监督学习中,训练样本是输入与输出组成的配对 (S={(x_i,y_i)}_{i=1}^{n})。一种常见的理论假设是,这些配对独立采样自同一个概率分布 (P)。对于预测函数 (f) 和损失函数 (\ell),总体风险为

[ R_P(f)=\mathbb{E}_{(X,Y)\sim P}[\ell(f(X),Y)]. ]

这一期望值衡量的是潜在总体上的平均预测损失。相比之下,经验训练风险为

[ \widehat R_S(f)=\frac{1}{n}\sum_{i=1}^{n}\ell(f(x_i),y_i). ]

经验风险最小化通过在选定的模型类中最小化后一个量来选择预测函数。由于预测函数依赖于训练样本,其训练损失通常并不是总体风险的无偏估计。(d2l.ai)

泛化差距通常写作 (R_P(f)-\widehat R_S(f)),不过符号约定有所不同。总体风险也称为泛化误差,而泛化差距是另一个量。如果两种风险都很高,较小的差距并不能说明预测准确。(d2l.ai)

过拟合、模型容量与归纳偏置

当对训练样本的拟合未能转化为在独立数据上同样良好的表现时,就发生了过拟合。表达能力强的模型可能会利用样本特有的噪声或偶然出现的模式。相反,欠拟合是指模型甚至无法捕捉训练样本中的相关结构。模型容量、样本量、噪声和学习过程都会影响这些结果。(classic.d2l.ai)

经典的偏差-方差权衡描述了这样一种现象:提高模型的灵活性可以降低系统性的近似误差,同时也可能增加模型对特定训练样本的敏感性。这可能使模型复杂度与测试误差之间呈现 U 形关系,但这种关系并非普遍成立。(doi.org)

学习还依赖于归纳偏置,即使某些预测函数比其他预测函数更受偏好的假设或倾向。模型架构、参数惩罚项和训练过程都可以体现这样的偏好。因此,即使两个模型对同一组观测的拟合程度相同,它们在未见过的样本上的表现也可能不同。泛化不仅取决于模型能够表示哪些函数,还取决于学习过程最终选择了哪个函数。(en.d2l.ai)

实证评估

测试集用于估计模型在未参与模型构建的样本上的表现。独立的验证集则用于模型选择和超参数调优。反复根据测试结果选择模型,会使测试集成为选择过程的一部分,从而可能使泛化能力的估计过于乐观。(scikit-learn.org)

交叉验证反复将可用数据划分为训练子集和评估子集。在 (k) 折交叉验证中,每一折都轮流作为一次评估子集,其余各折则提供训练数据。嵌套交叉验证将内层的模型选择过程与外层的评估过程分开,从而减少因直接报告调优所用的同一组评分而产生的选择偏差。(scikit-learn.org)

当模型构建使用了预测时无法获得的信息,就会发生数据泄漏(机器学习)。例如,在划分数据之前拟合预处理步骤,或让评估样本影响特征选择,都可能导致数据泄漏。特征缩放等变换必须从相应的训练子集中学习,即使随后也要将这些变换应用于评估数据。(scikit-learn.org)

评估时的数据划分方式也决定了所衡量的泛化类型。按组划分可以评估模型在未见过的个体或组织上的表现。对于时间序列,按时间顺序进行评估,可以衡量利用较早的观测预测较晚观测的能力。当观测之间存在依赖关系,或在时间上彼此接近时,随机划分可能得出误导性的结果。(scikit-learn.org)

正则化与训练过程

正则化通过改变学习目标或学习过程,使特定解更受偏好。权重惩罚项可以抑制过大的参数值;早停法则根据停止准则限制训练,该准则通常以验证集上的表现为依据。这两种技术都不能保证在每一种模型和数据集上改善泛化。它们的效果取决于模型结构、数据和训练之间的相互作用。(en.d2l.ai)

随机失活在神经网络训练过程中引入随机掩蔽,为控制学得的表示提供了另一种机制。这类技术常被描述为降低有效复杂度,但它们的益处也可能来自归纳偏好,而不只是阻止表达能力强的网络拟合训练样本。(classic.d2l.ai)

深度学习中的泛化

深度学习使仅凭参数数量解释泛化变得更加复杂。实验表明,大型人工神经网络能够拟合随机分配的标签,而在使用有意义的标签训练时,也能在测试集上取得良好表现。因此,能够记忆任意样本这一点,本身并不能解释它们在具有结构的数据上的表现。(arxiv.org)

双下降描述的是这样一种情形:随着模型容量增加,测试误差先下降,在模型刚好能够完全拟合训练数据的阈值附近上升,随后随着容量进一步增加而再次下降。这种现象已在多个模型类别中被观察到。它表明,完全拟合训练数据并不一定意味着泛化能力差,不过增加模型容量也不能保证改善表现。(doi.org)

分布偏移

常规的留出评估通常衡量模型在训练数据分布下的表现。当部署时的数据服从不同的分布时,就会出现分布偏移。仅凭在训练分布内的良好表现,并不能证明模型在这类变化下仍然可靠。例如,协变量偏移会改变输入的分布,但保持给定输入时输出的条件分布不变。(jmlr.org)

域适应利用目标域的信息来应对训练环境与部署环境之间的差异。域泛化则研究在不使用目标域训练数据的情况下,如何在新环境中进行预测。这些情形需要对哪些因素在不同环境之间保持稳定作出额外假设;与从单一总体中随机留出一部分数据的评估相比,它们的评估涉及更广义的泛化。(jmlr.org)