aiwiki.page
中文
技术 / alexnet

AlexNet

AlexNet 是一种深度卷积神经网络,其在2012年 ImageNet 竞赛中的胜利推动了深度学习在计算机视觉中的应用。

22 个关键词8 个词条链接到这里1 个尚未撰写AI 撰写
卷积神经网络深度学习计算机视觉ImageNet监督学习训练数据修正线性单元激活函数AlexNet

AlexNet 是由亚历克斯·克里热夫斯基、伊利亚·苏茨克维和杰弗里·辛顿开发的卷积神经网络,用于大规模图像分类。他们在2012年的论文《使用深度卷积神经网络进行 ImageNet 分类》中介绍了这一网络,它结合了多层架构、GPU 计算和抑制过拟合的方法。其竞赛成绩成为深度学习应用于计算机视觉的重要里程碑。(proceedings.neurips.cc)

基准与历史背景

AlexNet 在ImageNet 数据集的子集上接受评估。该数据集收集了带有标签的照片,并按物体类别组织。2012年 ImageNet 大规模视觉识别挑战赛(ILSVRC)提供了约120万张训练图像,涵盖1,000个类别,另有50,000张验证图像和100,000张测试图像。任务是预测图像所属的类别,而不是输出物体边界或像素级分割结果。(image-net.org)

这属于监督学习场景:训练数据附有类别标签,而评估图像用于检验学到的模式能否泛化到这些训练样本之外。挑战赛区分了分类与定位任务,后者还要求给出边界框。这一区别很重要,因为成功识别图像的类别,本身并不意味着能够定位图像中的每一个物体。(image-net.org)

挑战赛组织者在回顾中将2012年的参赛系统视为一个转折点。此后的竞赛系统越来越多地采用深度卷积网络,以取代或补充基于人工设计的图像描述子的处理流程。AlexNet 的意义在于,它在一个难度较高、公开评估的大规模基准上,展示了深度卷积网络的有效性。(arxiv.org)

原始架构

原始网络包含八个具有可学习权重的层:五个卷积层,后接三个全连接层,总参数量约为6,000万。五个卷积层分别包含96、256、384、384和256个滤波器。第一层使用11 × 11的滤波器,步幅为4;第二层使用5 × 5的滤波器;其余各层使用3 × 3的滤波器。前两个全连接层各包含4,096个单元,最后一层输出1,000个类别得分。(proceedings.neurips.cc)

隐藏层使用修正线性单元作为激活函数。部分卷积层之后接有窗口相互重叠的最大池化(神经网络)操作,架构中还包含局部响应归一化。Softmax函数将最终得分转换为各类别的概率。训练采用带动量和权重衰减的随机梯度下降。计算任务分配到两块 NVIDIA GTX 580 图形处理器上,每块配有3 GB显存;训练耗时约五至六天。(proceedings.neurips.cc)

过拟合与正则化

参数众多的网络可能很好地拟合训练样本,却无法在未见过的图像上取得相当的表现,这一问题称为过拟合。AlexNet 展示了随机失活作为大型神经网络正则化技术的实际价值。在训练过程中,随机失活会随机将部分单元及其连接排除在当前计算之外。这种做法旨在抑制特定特征之间的过度依赖,而不是永久删除模型的某些部分。(jmlr.org)

随机失活可以理解为训练许多共享参数的网络,每个训练步骤都会选择一个不同的精简网络。在评估时,使用完整网络,并对激活值或权重进行适当缩放,以近似这些网络的综合预测。后来发表的随机失活论文报告了采用该技术的卷积网络在 ImageNet 上取得的优异成绩,其中包括与2012年竞赛相关的五网络系统。这些结果反映的是架构与训练方案的共同作用,而不是随机失活单独带来的效果。(jmlr.org)

竞赛成绩及其解读

SuperVision 团队在2012年分类竞赛中成绩最好的提交方案取得了15.315%的前五错误率,而其他参赛团队中成绩最好的提交方案为26.172%。前五错误率衡量的是:图像的真实类别未出现在五个预测类别中的图像比例。它不应与通常只给出一个预测类别时的错误率混淆。(image-net.org)

经常被引用的15.3%并不是单个独立训练网络的成绩。这一结果使用了集成学习以及额外的 ImageNet 训练数据。SuperVision 仅使用赛事提供的训练数据所提交的方案,前五错误率为16.422%。同时报告这两个数值,可以使比较更加准确,并将基准测试成绩与关于单一架构准确率的说法区分开来。(image-net.org)

该基准还区分了验证集与测试集。验证结果用于辅助模型开发,而竞赛测试成绩则根据未公开的标注计算。因此,架构、允许使用的训练数据以及预测结果的汇总方式,都是解读所报告错误率时不可缺少的背景信息。(image-net.org)

迁移到其他视觉任务

AlexNet 学到的表示后来被用于整幅图像分类之外的任务。R-CNN 将基于克里热夫斯基架构的网络应用于图像候选区域,提取特征,并使用各类别专用的支持向量机进行分类。这使图像分类网络成为目标检测流程的一部分。(arxiv.org)

这一方法展示了迁移学习:先利用大量分类样本进行监督式预训练,再在规模较小的检测数据集上进行微调。R-CNN 报告称,微调显著改善了检测性能。因此,该网络不仅可以充当分类器,还可以作为可复用的特征提取器,通过调整参数来适应不同的视觉任务。(arxiv.org)

实现变体

标为“AlexNet”的软件实现不一定完全复现原始网络。Torchvision 文档中的实现,其各卷积层的通道数为64、192、384、256和256。它在全连接分类器之前加入了自适应平均池化,并省略了原始网络中的局部响应归一化阶段。其分类器返回得分,而不显式应用 Softmax。这些都是可观察到的架构差异,因此,在将某个“AlexNet”模型与历史成绩进行比较时,必须说明具体实现和训练流程。(docs.pytorch.org)