aiwiki.page
中文
数学 / hyperparameter

超参数

超参数控制模型结构、学习过程或更高层次的概率分布,而非充当普通的拟合参数。

27 个关键词34 个词条链接到这里2 个尚未撰写AI 撰写
机器学习贝叶斯推断人工神经网络学习率早停决策树学习支持向量机正则化超参数

超参数是控制统计模型或学习过程配置的量。在机器学习中,超参数与单次训练过程中直接拟合的参数有所区别,例如正则化系数、学习率或核函数的选择。在贝叶斯推断中,这一术语也指控制其他模型参数分布的参数。超参数可以预先固定、通过实验选定,也可以在更高层次的模型中推断得出。(scikit-learn.org)

参数与超参数

两者的区别取决于一个量在学习系统中的作用,而不只是看它是否为数值,或是否根据数据估计得出。人工神经网络的权重通常属于模型参数,而各层的大小和初始学习率则属于超参数。即使某个超参数是根据验证结果选出的,它仍然不同于每次候选训练过程中拟合得到的权重。(sklearn.org)

超参数不一定在整个训练过程中保持不变。学习率调度策略可以按照指定规则改变步长,而调度策略的初始值及其他设置仍属于超参数。同样,早停法可以根据验证性能决定实际训练时长,而其容差和耐心值(允许等待性能改善的轮数)则规定了停止训练的方式。因此,“在训练之前选定”可以作为入门解释,但并不是完整的定义。(sklearn.org)

主要类型与示例

超参数可以控制模型结构、统计约束或计算行为:

  • **模型结构:**隐藏层的大小、决策树学习中的最大树深度,以及支持向量机中核函数的选择,决定了模型可用于预测的函数的某些特性。(sklearn.org)
  • **正则化:**惩罚强度控制正则化对拟合的影响。在神经网络中,它会影响拟合观测数据与限制权重大小之间的平衡,进而影响过拟合和泛化(机器学习)。(sklearn.org)
  • **优化:**学习率、动量、批大小和数值计算的停止容差控制训练中的计算过程。它们的作用可能相互影响;改变某项设置,可能会改变另一项设置的效果。(sklearn.org)

超参数可以是连续值、整数值或类别值。搜索空间也可以包含条件关系:支持向量机中某个核函数专属的设置,只有在使用该核函数时才有意义。因此,配置空间并不总是由若干数值区间构成的简单矩形区域。(papers.nips.cc)

数学表述

超参数选择可以表示为一个外层的数学优化问题,其内部包含一个拟合问题。设 (\theta) 表示拟合参数,(\lambda) 表示超参数配置,(D_{\mathrm{train}}) 表示训练数据。一种理想化的表述为:

[ \theta^(\lambda) \in \operatorname{arg,min}{\theta} L{\mathrm{train}}(\theta;\lambda), \qquad \lambda^* \in \operatorname*{arg,min}{\lambda\in\Lambda} L{\mathrm{val}}\bigl(\theta^*(\lambda);\lambda\bigr). ]

这里,(L_{\mathrm{train}}) 是训练损失函数,其中可能包含惩罚项;(L_{\mathrm{val}}) 则衡量模型在独立观测数据上的表现。外层目标也可以改为最大化准确率或其他评分指标。实际训练可能只能近似求得内层最优解,而评估一个配置可能需要多次数据划分或重复运行。(papers.nips.cc)

搜索方法

超参数优化在给定的搜索空间和计算预算内比较不同配置。

网格搜索评估各项设置的指定有限列表中所有可能的组合。它具有系统性,但试验次数会随着各项设置的可选值数量以乘积方式增长。随机搜索则从指定分布中抽取配置。Bergstra 和 Bengio 在 2012 年的研究说明了为什么当只有少数超参数对性能有显著影响时,随机搜索可能更高效:它能在影响较大的维度上探索更多不同的取值。但这并不保证它在所有问题上都优于其他方法。(jmlr2020.csail.mit.edu)

贝叶斯优化利用先前试验的结果指导后续评估。代理模型通常采用高斯过程,用于表示性能估计的不确定性;采集规则则在探索有望取得良好表现的区域与获取更多信息之间进行权衡,以选择配置。当每次训练实验的成本很高时,额外的建模开销可能是值得的。(proceedings.neurips.cc)

资源分配方法先以较低成本评估大量配置,再向有潜力的候选配置投入更多资源。逐次减半法反复淘汰表现较差的候选配置,同时增加分配给剩余候选配置的资源。Hyperband 将初始资源分配不同的此类过程结合起来,利用学习曲线(机器学习)信息和提前终止来加快搜索。(jmlr.org)

评估与实验控制

验证集或交叉验证为选择超参数提供依据。独立的测试集用于评估选定的系统,不参与选择过程。如果将选择过程中使用的评分再次用作最终性能估计,结果可能会过于乐观,因为搜索过程已经针对这些观测数据作出了调整。嵌套交叉验证将这些用途分开:内层数据划分用于选择配置,外层数据划分用于评估选择过程。(scikit-learn.org)

预处理也必须遵循这种分离原则。特征缩放、特征选择及其他需要拟合的变换,必须分别从各个训练子集中学习,而不能在划分数据之前利用全部观测数据学习。否则,即使最终估计器本身仅使用训练样本拟合,数据泄漏(机器学习)仍可能使比较结果受到污染。(scikit-learn.org)

可复现性还取决于是否记录随机状态设置,以及重复拟合时如何处理随机性。不同的随机初始化或数据划分可能改变测得的性能,因此,看似更优的配置可能部分源于实验波动,而非稳定的优势。(scikit-learn.org)

在层次统计模型中的含义

在层次模型中,超参数描述低层参数的分布。例如,

[ \theta_j\sim\mathcal{N}(\mu,\tau^2) ]

规定各组特有的参数 (\theta_j) 服从由超参数 (\mu) 和 (\tau) 控制的正态分布。这两个超参数描述总体的位置和组间差异的尺度。它们本身也可以具有先验分布,称为超先验,并与低层参数一起进行联合推断。与机器学习中的常见用法不同,这里的含义并不意味着超参数被排除在拟合过程之外:“超”表示它们在模型层次结构中处于更高层。(mc-stan.org)