神经网络缩放定律是指人工神经网络的预测性能与其参数量、训练数据量或训练计算量等资源之间的经验关系。许多已观测到的关系近似符合幂律:增加资源会使误差或损失以可预测的方式下降,但改善幅度逐渐减小。这些关系为深度学习中的资源分配提供指导,尤其适用于大语言模型。它们描述的是特定条件下测得的行为,而不是对神经网络普遍成立的数学保证。(arxiv.org)
度量与数学形式
缩放研究通常在留出的样本上测量损失函数,重点考察泛化(机器学习),而不是模型在已记住的训练样本上的表现。对于语言模型,主要指标通常是交叉熵损失,用于评估模型赋予实际观测文本的概率。因此,缩放曲线描述的是某个特定的预测目标,而不是一种笼统的智能度量。(arxiv.org)
一种简单的单资源关系可以写为
其中, 是资源量, 是拟合系数, 是缩放指数, 表示估计的极限损失。可降低的部分 在双对数坐标系中呈直线。资源翻倍会使这部分变为原来的 倍,而不是使损失减少一个固定值。因此,该指数表示改善的速率。(arxiv.org)
一种广泛使用的联合模型为
其中, 为参数量, 为训练词元数, 为拟合常数。该模型分别表示模型容量与数据相关因素对损失的贡献。其系数取决于实验条件,并不是所有架构或数据集共用的常数。(arxiv.org)
经验证据的发展
2017 年,乔尔·赫斯特内斯(Joel Hestness)及其同事报告了在机器翻译、语言建模、图像处理和语音识别等领域中,数据集规模与泛化误差之间的幂律关系。他们的实验还考察了为充分利用新增数据,所需的模型规模如何增长。这项研究在多个应用领域确立了相关证据,而不只局限于文本预测。(arxiv.org)
2020 年,贾里德·卡普兰(Jared Kaplan)及其同事系统研究了语言模型损失如何随参数量、数据集规模和计算量变化。一些观测到的趋势跨越了七个以上的数量级。他们的分析将缩放关系与过拟合、训练速度以及固定计算预算的分配联系起来。在其实验假设下,计算效率较高的训练方案倾向于采用相对较大的模型,在相对有限的数据上训练,并在收敛前停止。(arxiv.org)
这些研究使缩放曲线成为外推工具:较小规模的实验可以帮助估计较大规模训练所需的资源。但相关预测仍有前提,即保持相同的训练设置,并在拟合关系仍然成立的范围内使用。(arxiv.org)
计算最优的资源分配
对于稠密的Transformer架构语言模型,训练计算量常用 近似,以浮点运算次数计量。因此,无论增加模型规模还是处理的词元数,都会消耗更多预算。在固定 的条件下寻找预测损失最低的方案,就成为一个有约束的数学优化问题。(arxiv.org)
乔丹·霍夫曼(Jordan Hoffmann)及其同事在 2022 年发表的研究《训练计算最优的大语言模型》(Training Compute-Optimal Large Language Models)考察了 400 多个模型。结果支持随着计算量增长,以大致相同的比例增加参数量和训练词元数。由此得到的Chinchilla模型拥有 700 亿个参数,使用的训练计算预算与拥有 2800 亿个参数的 Gopher 相同,但训练数据量是后者的四倍。在报告的各项下游评估中,它的表现更好。这些发现修正了此前的资源分配估计,而不是确立了一个普遍适用的每参数训练词元数要求。(arxiv.org)
训练最优的资源分配不同于部署最优的资源分配。纳入推理成本的研究发现,当预期使用量很大时,训练时间更长的小模型可能更有利:额外的训练开支可以由反复预测时较低的成本抵消。最合适的分配方案取决于所选的成本目标和预期工作负载。(proceedings.mlr.press)
实验条件与数据约束
可靠的缩放测量需要受控比较。架构、优化设置、数据分布和评估流程共同界定了实验条件。研究会考察不同资源水平下的学习曲线(机器学习),而不是根据单个大型模型推断一般关系。架构变化可能使性能曲线发生偏移,但其对拟合指数的影响因具体条件而异。(arxiv.org)
词元数的含义也需要说明。分词与词元化决定了计数所用的单位,而反复处理已有语料并不能提供与获取新样本相同的信息。受数据约束的实验将重复词元建模为价值递减的资源。穆恩尼霍夫(Muennighoff)及其同事发现,在他们测试的条件下,多次遍历数据仍可能有用,但重复次数足够多之后,继续增加计算量几乎不再带来收益。他们扩展后的缩放模型区分了已处理词元数与有效可用数据量。(arxiv.org)
能力与推理时缩放
平均损失的平滑改善,并不意味着每项基准测试上的表现都会同样平滑地改善。关于涌现能力的研究报告称,在某些任务上,只有模型达到较大规模后,才会出现可测量的成功表现。另一些研究表明,非线性或不连续的评分规则可以将渐进变化转化为看似突然的跃迁。因此,对这些现象的解释部分取决于度量方式和任务,而不只是参数量。(arxiv.org)
缩放也可以涉及训练完成之后所投入的计算量。推理时研究会比较额外生成的词元、多个候选解、投票和搜索等方式。与思维链提示相关的推理方法,可以改变模型规模与每个问题所需计算量之间的权衡。实证研究发现,在某些条件下,采用更复杂推理流程的小模型能在相近预算下胜过大模型。这类关系涉及的资源分配问题不同于预训练缩放,需要单独进行测量。(arxiv.org)