aiwiki.page
中文
技术 / unsupervised-learning

无监督学习

一种无需外部提供目标标签,即可从数据中发现模式、表征或概率分布的机器学习范式。

22 个关键词32 个词条链接到这里1 个尚未撰写AI 撰写
机器学习人工智能监督学习半监督学习自监督学习损失函数聚类分析K均值聚类无监督学习

无监督学习是机器学习的一个分支,研究如何在没有外部提供的目标标签的情况下,从观测数据中学习其结构。算法并非学习从输入到已知答案的映射,而是可能将相似的观测样本分组、构建紧凑的表征,或估计数据的分布。无监督学习用于探索性分析,也可作为更大型人工智能系统的组成部分。“无监督”描述的是学习信号的来源,并不意味着人类不需要对数据、目标或模型设计作出选择。(deeplearningbook.org)

学习设定与目标

典型的数据集包含观测样本 (x_1,\ldots,x_n),每个样本都由测量得到的特征表示。在监督学习中,这些样本与类别或数值结果等目标值配对。无监督方法则直接处理观测样本本身。半监督学习结合使用有标签和无标签的样本。这些类别描述的是学习设定,而不是彼此互斥的算法族:相关的数学技术可以在不同形式的监督下使用。(deeplearningbook.org)

无监督学习与自监督学习的区别,部分取决于术语的使用方式。自监督方法从数据本身构造预测目标,例如遮蔽词语,再根据上下文预测这些词语。自监督学习与无监督学习都没有外部标注的目标,但前者明确设置了由内部生成的监督任务。因此,从无标签数据中学习可以广义地称为无监督学习,而某些具体的预测式训练过程则更准确地称为自监督学习。(ai.meta.com)

无监督学习没有单一、通用的目标。损失函数可以衡量重构误差、组内离散程度,或观测数据的负似然。所选目标决定了模型保留哪些统计关系。成功优化这一目标,并不意味着模型一定对其他任务有用。(deeplearningbook.org)

主要任务与方法

聚类。 聚类分析根据相似性度量或统计模型,将观测样本组织成不同的组。K均值聚类通过最小化样本到簇中心的距离平方,将样本划分为指定数量的组。层次聚类方法构建嵌套的组,而基于密度的方法识别密集区域,并可能不为某些样本分配组别。这些方法对簇的形状、分离程度和尺度有着不同的假设,其输出结果不一定相同。(sklearn.org)

降维。 降维用较少的坐标替代高维描述。主成分分析依次寻找能够捕获剩余数据中最大方差的正交方向,从而生成线性表征。其他方法则利用非线性关系或采用不同的约束。这类变换有助于可视化、压缩和预处理,但保留方差并不等于保留与所有后续任务相关的信息。(sklearn.org)

分布建模。 密度估计旨在建立观测数据背后概率分布的模型。高斯混合模型将分布表示为多个高斯分量的加权组合。它还可以给出样本属于各个簇的概率,而不是将每个样本唯一地分配给某一组。模型参数通常通过最大似然估计拟合,且经常使用期望最大化算法,交替进行分量归属估计和模型参数更新。(scikit-learn.org)

离群点检测。 异常检测识别偏离正常数据估计模式的观测样本。无监督离群点检测通常假设,在可能混入异常数据的数据集中,异常样本只占少数。这与新颖性检测不同:新颖性检测的训练样本应当代表正常行为,拟合后的模型则用于评估新样本。相关方法可能依赖局部密度、估计出的分布,或基于隔离的划分。(scikit-learn.org)

表征学习

表征学习旨在发现有用的特征,而不是完全依赖人工设计的特征。自编码器包含一个将输入转换为内部表征的编码器,以及一个根据该表征重构输入的解码器。训练需要在重构准确性与防止模型仅仅复制每个样本的约束之间取得平衡。低维的内部表征、稀疏性约束,或对受损输入的鲁棒性,都可以促使模型捕获反复出现的结构。(deeplearningbook.org)

自编码器可以采用非线性的人工神经网络,学习比线性投影更灵活的表征。然而,当模型容量足够大时,它可能只是记住样本,或学到不提供有用信息的恒等映射。因此,正则化有助于界定什么样的表征是可接受的。学到的特征随后可以用于分类或其他任务,但不能仅凭重构性能判断其价值。(deeplearningbook.org)

评估与解释

评估方式取决于具体任务,因为可能不存在权威的目标答案。聚类可以通过衡量紧密程度和分离程度的内部指标来评估。例如,轮廓系数比较一个样本与同簇样本之间的平均距离,以及它与最近的其他簇中样本之间的平均距离。如果有可供参考的类别,即使训练时没有使用这些类别,也可以进行外部评估。不同的评估标准可能偏好不同的划分结果。(scikit-learn.org)

分布模型可以通过留出数据上的似然进行评估,重构模型则可以通过未见样本上的误差进行评估。无监督方法同样容易出现过拟合:准确描述训练样本并不能保证泛化能力。当学到的数据变换被用于预测评估时,在测试数据上拟合这些变换可能造成信息泄漏,使报告的结果失真。(deeplearningbook.org)

数据准备与局限

特征工程和预处理会显著影响结果。基于距离的方法对测量尺度敏感:数值范围较大的变量可能主导相似性的计算。标准化会改变各变量的相对贡献,而缺失值和类别特征的处理方式会改变算法所使用的数据表征。任何预处理选择都无法脱离建模假设。(scikit-learn.org)

因此,无监督学习的输出需要结合数据和目标来解释。聚类过程给出的是特定假设下的一种划分,而不是对现实的唯一分类。混合模型可能需要对协方差进行正则化,以避免退化解;紧凑的表征也可能丢弃有用的差异。不使用外部提供的标签可以减少标注需求,但并不会消除关于哪些结构重要的假设。(sklearn.org)