目标检测是一项计算机视觉任务,旨在识别对象实例,并确定它们在图像或视频帧中的位置。检测器通常会为每个检测到的实例输出类别标签、置信度分数和边界框。图像分类为整幅图像分配标签,而目标检测则区分并定位各个对象,包括同一类别的多个实例。它是机器学习和深度学习的重要应用之一。(arxiv.org)
任务与表示方式
在常规二维检测中,与坐标轴对齐的边界框可以用两个相对的角点表示,也可以用中心点、宽度和高度表示。输出中的对象数量并不固定:一幅图像可能不包含任何相关实例,另一幅则可能包含数十个。因此,检测器必须同时解决分类和定位问题,并区分对象与背景。置信度分数可用于对预测结果排序,并过滤低分结果。(docs.pytorch.org)
相关任务的区别在于输出形式。语义分割为像素分配类别,而实例分割还会通过掩码区分各个对象。目标跟踪将连续帧中的实例关联起来;仅在每一帧中独立检测对象,并不能确立它们在时间上的身份对应关系。目标检测的结果可以作为实例分割和目标跟踪的输入。(arxiv.org)
发展历程与主要架构
早期检测器通常使用滑动窗口扫描图像,并依赖人工设计的特征提取方法。Viola–Jones 框架使用级联分类器实现高效的人脸检测。其他方法则将基于梯度的描述子与支持向量机等分类器结合使用。此后,学习得到的表示减少了对人工设计特征的依赖,尤其是通过卷积神经网络学习的表示。(arxiv.org)
两阶段检测器首先生成候选目标区域,然后对其进行分类并细化定位。R-CNN 系列确立了一种将卷积特征应用于候选区域的重要方法。2015 年提出的 Faster R-CNN 引入了区域提议网络,与检测网络共享图像特征。该网络预测候选边界框和目标存在性分数;后续检测阶段则确定类别并调整坐标。共享特征避免了为每个候选区域单独提取完整的特征表示。(arxiv.org)
单阶段检测器不经过独立的区域提议阶段,直接预测对象的位置和类别。最初的 YOLO 方案于 2015 年首次提出,将检测视为从图像到边界框及类别概率的回归问题,通过一次网络计算完成。其统一设计着重于计算效率。“单阶段”描述的是检测流程,而不是网络层数,也不保证在所有数据集或设备上都能达到某种特定的速度或精度。(arxiv.org)
集合预测检测器将输出建模为对象集合。2020 年提出的 DETR 将图像特征与 Transformer架构的编码器—解码器及可学习的对象查询相结合。训练期间,通过二分图匹配将预测结果分配给标注对象。这种一对一分配促使模型为每个对象生成唯一的输出,使原始架构无需生成锚框,也无需进行非极大值抑制;后者是许多其他检测器用来去除重叠重复预测的处理步骤。(arxiv.org)
训练与推理
常规检测器采用监督学习,使用包含图像、对象类别和标注框的训练数据。其损失函数通常结合分类误差与定位误差;基于候选区域的架构还可能包含目标存在性损失项和候选框回归损失项。训练时,必须处理候选预测与参考对象之间的分配关系,以及数量庞大的背景候选。不同架构以不同方式实现这些分配。(arxiv.org)
迁移学习通常通过将预训练检测器适配到另一个数据集来实现,往往需要替换类别预测层并进行微调。水平翻转等数据增强方法会同步变换图像及其对应标注。推理时,模型输出的是边界框、标签和分数,而不是训练损失;许多处理流程随后还会应用分数阈值和去重步骤。(docs.pytorch.org)
评估
定位质量通常用交并比(IoU)衡量:
其中, 为预测框, 为参考框。评估时,根据类别和重叠程度要求,将预测结果与标注进行匹配。漏检、类别错误、重复检测和边界框不准确会以不同方式影响评估结果。(github.com)
平均精度(AP)概括了按分数排序的检测结果在精确率与召回率方面的表现。平均精度均值对各类别的结果进行汇总,但不同基准的报告惯例有所不同。COCO 基准的主要 AP 指标在各类别以及十个 IoU 阈值上取平均值;这些阈值从 0.50 到 0.95,步长为 0.05。它还报告单独阈值下以及不同对象尺寸下的结果。因此,AP 数值只有结合其评估规程才有意义。(github.com)
准确性只是性能的一个维度。推理延迟和内存需求取决于特征提取器、输入分辨率、检测架构及硬件。因此,比较需要在一致的实验条件下进行;仅凭架构名称,无法确定速度与精度之间的权衡关系。(arxiv.org)
应用与研究方向
目标检测用于机器人感知、车辆感知、视频分析,以及航空影像中的目标定位。长期存在的难题包括小目标、遮挡、拥挤场景、视角或光照变化,以及运动模糊。这些情况可能降低识别准确性或定位质量。(arxiv.org)
开放词汇目标检测通过将视觉表示与语言相联系,拓展了固定类别检测。例如,Grounding DINO 利用视觉—语言对齐的预训练,定位通过类别名称或指代表达指定的对象。这类系统拓宽了指定检测目标的方式,但其报告的能力仍取决于训练数据、提示和评估条件。(arxiv.org)