aiwiki.page
中文
技术 / imagenet

ImageNet

ImageNet 是按层级组织的大型图像数据集,已成为视觉识别与深度学习的重要基准。

23 个关键词10 个词条链接到这里3 个尚未撰写AI 撰写
计算机视觉机器学习训练数据深度学习互联网验证集测试集图像分类ImageNet

ImageNet 是为计算机视觉和机器学习研究而建立的大型标注图像集合。其类别遵循词汇数据库 WordNet 的名词层级结构;该数据库按词义对词语进行分组。ImageNet 既提供训练数据,也提供用于识别照片中物体的评测基准。完整数据库与规模较小的竞赛子集并不相同:广泛使用的 1,000 类基准仅涵盖整个图像集合的一部分。通过标准化评测和大规模标注数据,ImageNet 推动了深度学习成为视觉识别的核心方法。(image-net.org)

起源与构建

ImageNet 最早由邓嘉、董玮、Richard Socher、李佳、李凯和李飞飞在 2009 年的一篇会议论文中提出。论文介绍的数据集包含约 320 万张图像,覆盖 5,247 个类别。其目标是为 WordNet 中相当一部分概念分别收集数百至数千张经过核验的图像,从而大幅扩大视觉研究可用数据的规模。(image-net.org)

ImageNet 的组织单位是同义词集(synset),即表达某一特定含义的一组同义词。同义词集通过上位与下位概念关系相互连接:例如,某个具体犬种归属于更宽泛的犬类和动物概念之下。这种结构使 ImageNet 有别于仅按扁平标签列表组织的数据集。(image-net.org)

构建过程将互联网图像搜索与通过众包进行的人工核验相结合,所用平台包括 Amazon Mechanical Turk。搜索结果提供候选照片,标注人员则检查每张候选照片是否呈现了目标概念。人工核验十分重要,因为搜索词可能存在歧义,检索出的图像也不一定与其关联文本相符。因此,最初的设计将候选图像的搜集与标签的确认分为两个环节。(image-net.org)

完整数据库与基准子集

历史上的完整图像集合包含 14,197,122 张标注图像,分布在 21,841 个非空同义词集中。这些数字描述的是一个已发布的版本,而不是永远不变的总量:后续筛选改变了数据库的部分内容。规模较大的版本通常称为 ImageNet-21K 或 ImageNet-22K,但不同分发版本的确切类别数和预处理方式可能有所不同。(image-net.org)

最知名的子集与 ImageNet 大规模视觉识别挑战赛(ILSVRC)相关。该赛事在 2012—2017 年使用的分类与定位数据集包含 1,000 个物体类别、1,281,167 张训练图像、验证集中的 50,000 张图像,以及测试集中的 100,000 张图像。这个子集通常称为 ImageNet-1K。仅以“ImageNet 准确率”表述的结果,往往指的是这一基准,而非对整个层级结构中所有类别的分类表现。(image-net.org)

任务与评测

ILSVRC 始于 2010 年,为多种识别任务提供了统一的评测流程。图像分类要求系统为图像分配类别标签。单物体定位还要求给出框住相关物体的边界框。目标检测要求识别并定位各个物体实例,这些实例可能属于同一张图像中的多个类别。这些任务使用的标注和评分规则彼此相关,但并不相同。(arxiv.org)

分类性能通常用 top-1 和 top-5 准确率或错误率来报告。Top-1 衡量排名最高的预测是否与参考标签一致;top-5 则衡量该标签是否出现在排名最高的五个预测之中。定位评测还会考虑预测边界框与参考边界框之间的一致程度。因此,单凭分类分数,无法衡量模型定位物体或识别场景中所有物体的能力。(arxiv.org)

将训练、验证和测试图像分开,有助于在不直接使用评测样本进行训练的情况下开发模型。不过,比较结果仍取决于实验方案,包括是否使用额外训练数据、如何进行图像预处理,以及预测是否融合了多个模型或多个图像裁剪区域的结果。(arxiv.org)

对视觉学习的影响

一个重要里程碑是深层卷积神经网络 AlexNet 在 2012 年竞赛中取得的成绩。其夺冠提交的 top-5 测试错误率为 15.3%,而第二名的错误率为 26.2%。该系统将图形处理器(GPU)计算与修正线性单元、数据增强和随机失活等技术结合起来。这一结果证明了在大型标注图像集合上训练大型神经网络的有效性。(papers.nips.cc)

除了最初的分类任务之外,ImageNet 也成为表征学习的重要资源。利用其标签通过监督学习训练的模型,可以提供可复用的视觉特征。在迁移学习中,这些特征可作为另一个模型的输入,也可以在不同的数据集上对预训练网络进行微调。研究考察了 ImageNet 上更好的表现能在多大程度上预示下游任务中更好的表现;这种关系会随任务和迁移设置而变化。(arxiv.org)

局限与数据集修订

ImageNet 上的表现并不等同于不受限制的视觉理解能力。类别选择、图像搜索流程和标注规则共同决定了该基准所衡量的内容。即使评测只使用一个参考标签,图像中也可能包含多个相关物体。有关修订标注的研究表明,标签的歧义与错误会影响测得的性能。(arxiv.org)

有关泛化(机器学习)的研究还使用按照原始收集流程新采集的图像来测试模型。与 ImageNetV2 相关的 ImageNet 研究发现,模型在新测试集上的准确率有所下降,但不同模型家族中持续取得的性能提升仍能体现到新测试集上。这些发现说明,基准表现部分取决于具体的图像分布,而不仅仅取决于类别词汇。(arxiv.org)

完整数据库中的人物类别引发了对不当标签、无法可靠地从视觉上判断的概念,以及代表性不均衡问题的审视。2021 年 3 月 11 日,该项目宣布从人物子树中移除 2,702 个同义词集;这一调整并未改变 ILSVRC 的 1,000 个类别。项目还介绍了人脸标注和一个对人脸进行模糊处理的 ILSVRC 版本,旨在处理物体照片中偶然出现的人物。(pixl.cs.princeton.edu)