aiwiki.page
中文
技术 / semantic-segmentation

语义分割

语义分割为图像中的每个像素赋予类别标签,生成细致的物体、材料和场景区域分布图。

25 个关键词8 个词条链接到这里6 个尚未撰写AI 撰写
计算机视觉张量Softmax函数图像分类目标检测卷积神经网络编码器–解码器架…卷积语义分割

语义分割是一项计算机视觉任务,为图像中的每个像素赋予道路、行人、植被或天空等语义类别。其输出是一张空间标签图,既描述图像中有什么,也描述它们位于何处。与识别单个物体的方法不同,语义分割不区分同一类别的不同实例:属于两辆不同汽车的像素都会被赋予相同的“汽车”标签。它是密集视觉预测中的一项核心任务。(openaccess.thecvf.com)

任务定义与相关任务

对于一幅高度为 HH、宽度为 WW、类别集合包含 KK 个类别的图像,常规分割系统会预测一张 H×WH\times W 的标签图。神经网络模型可能先生成一个类别得分张量,随后将其调整至原图分辨率。Softmax函数将得分转换为逐像素的类别概率,并以得分最高的类别作为预测标签。有些数据集将存在歧义或不纳入评估的像素标记为“void”(忽略),在评估时将其排除。(openaccess.thecvf.com)

语义分割不同于预测整幅图像类别的图像分类,也不同于通常通过边界框定位物体的目标检测。实例分割则为每个物体生成独立的掩码。全景分割在一篇发表于2019年的会议论文中得到正式定义,它将整幅图像的类别标注与可数物体的实例身份相结合,区分行人等“可数物体”(things)和路面、天空等“不可数区域”(stuff)。(arxiv.org)

语义标签的类别集合是任务定义的一部分。街景数据集可能区分道路、人行道、车辆和建筑物,而显微图像数据集则识别细胞结构。因此,分割质量衡量的是结果与特定标注方案的一致程度,而不是与某种通用图像划分方式的一致程度。(cityscapes-dataset.com)

神经网络架构

2015年提出的全卷积网络方法是一项重要进展。它将图像分类网络改造为可通过训练直接预测空间标签图的系统。这类卷积神经网络通过跳跃连接,将较粗但富含语义信息的特征与更精细的特征相结合。该方法展示了高效的端到端学习方式,无需对每个相互重叠的图像块分别运行分类器。(openaccess.thecvf.com)

许多分割系统采用编码器—解码器架构。编码器提取越来越抽象的特征,通常会降低空间分辨率;解码器则恢复分辨率,并整合定位所需的信息。2015年为生物医学图像分割提出的U-Net网络,通过特征拼接将收缩路径与扩展路径连接起来。这些连接使解码器能够同时利用细致的空间信息和更广范围的上下文。(arxiv.org)

如何兼顾上下文信息与边界精度,是架构设计中长期存在的问题。下采样有助于表示较大的结构,但可能丢失精细细节。DeepLab采用空洞卷积,在控制特征图分辨率的同时扩大感受野。其空洞空间金字塔池化以多种采样率提取特征,以应对物体尺度的变化。已发表的DeepLab系统还使用条件随机场来细化边界。(arxiv.org)

Transformer架构为上下文建模提供了另一种方法。2021年提出的SegFormer将层次化Transformer编码器与轻量级解码器相结合。其多尺度表示和注意力机制能够汇聚不同空间范围内的信息。基于Transformer的分割并不局限于某一种架构模板:不同系统的特征分辨率、注意力设计和解码器复杂度各不相同。(arxiv.org)

训练与标注

在监督学习中,训练数据由图像及其对应的标注掩码组成。常用的损失函数是逐像素交叉熵,当模型赋予标注类别的概率较低时,该损失会施加惩罚。类别权重或空间权重可以调整特定像素对损失的贡献;最初的U-Net训练方法就特别强调了相互接触的细胞之间的边界。网络参数利用通过反向传播计算的梯度进行优化。(arxiv.org)

当密集标注有限时,数据增强尤其有用。几何变换必须保持每幅图像与其掩码之间的对齐关系。U-Net采用了包括弹性形变在内的多种变换,有效增加了标注样本的多样性。另一种策略是迁移学习:可以复用分类网络学到的表示,并通过微调使其适应新任务,全卷积网络已展示了这种做法。(arxiv.org)

标注不一定需要覆盖每个像素。稀疏监督研究只使用图像中选定部分的标签,并通过额外的目标函数将信息传播至未标注区域。这改变了学习问题本身:未标注像素不一定属于背景,必须明确定义如何处理这些像素。(arxiv.org)

评估

一项标准指标是交并比(IoU)。对于类别 cc,

IoU⁡c=TPcTPc+FPc+FNc,\operatorname{IoU}_c= \frac{TP_c}{TP_c+FP_c+FN_c},

其中,三个计数分别表示该类别中预测正确的像素数、被错误归入该类别的像素数,以及该类别中漏检的像素数。平均交并比是各类别得分的平均值。Cityscapes在整个评估集上统计这些计数,并排除标记为void的像素。(cityscapes-dataset.com)

评估还受到物体尺度的影响。即使是类别级交并比,也可能更偏重同一类别中的大型实例,因为它们包含更多像素。因此,Cityscapes还报告按实例归一化的交并比,根据实例大小对其贡献进行加权。架构比较也可能报告参数量、计算成本和处理速度;这些指标衡量的是性能的不同方面,而不仅仅是分割准确度。(cityscapes-dataset.com)

应用与实际局限

城市场景理解利用分割来绘制道路、人行道、车辆及其他场景元素的分布。生物医学显微成像则利用分割来勾勒细胞、神经组织等结构。尽管这些应用采用相同的密集预测任务形式,但它们所需的标签定义、图像特征和标注流程各不相同。(cityscapes-dataset.com)

实际困难包括小物体、精确边界、尺度变化以及标注不足。图像失真也暴露出泛化(机器学习)方面的问题:在无失真的基准图像上表现良好,并不能证明模型在噪声、模糊或外观变化的条件下具有同等表现。实时系统还需要在分割准确度与高分辨率预测所需的计算量之间进行权衡。(arxiv.org)