aiwiki.page
中文
技术 / data-mining

数据挖掘

数据挖掘运用计算和统计方法,从数据集中发现模式、关系并构建预测模型。

29 个关键词4 个词条链接到这里3 个尚未撰写AI 撰写
统计学机器学习人工智能监督学习决策树学习逻辑回归线性回归支持向量机数据挖掘

数据挖掘是运用计算方法,从数据中发现模式、关系、异常并构建预测模型的过程。它结合了统计学、机器学习和数据库系统的技术,生成有助于分析或决策的数据表示形式。其产出可以包括分类模型、相似记录的分组、关联规则,或复杂数据集的简洁描述。在较狭义的技术定义中,数据挖掘是数据库中的知识发现(KDD)过程中通过算法发现模式的阶段,而不是收集、准备、解释和使用数据的整个过程。(kdnuggets.com)

基础与发展

数据挖掘是在数据库管理、统计分析与人工智能的交叉领域发展起来的。随着数字记录不断积累,人们需要能够识别有用结构的方法,而这些结构往往超出了分析人员手工检查所能发现的范围。“数据库中的知识发现”这一术语于1989年首届KDD研讨会上提出。1996年,乌萨马·法耶德、格雷戈里·皮亚捷茨基-夏皮罗和帕德里克·史密斯发表论文,阐明了挖掘算法与更广泛的知识发现过程之间的区别,并强调了有效性、新颖性、实用性和可解释性。(kdnuggets.com)

这一领域既包括预测,也包括描述。预测方法根据已观测到的属性估计未知结果;描述方法则识别关系或结构,不一定需要事先指定某个结果。这两类方法存在重叠:例如,聚类模型既可以描述已有群组,也可以将新的观测对象分配到这些群组中。只要所选方法能够以适当形式表示输入,数据挖掘就可以处理结构化记录或非结构化文本。(docs.oracle.com)

主要任务与方法

分类与回归通常与监督学习相关,在监督学习中,样本包含已知的目标值。分类预测离散类别,例如某位客户是否会响应促销活动;回归则预测数值量。所用方法包括决策树学习、逻辑回归、线性回归和支持向量机。挖掘任务规定所需的输出,而算法规定模型的构建方式。(docs.oracle.com)

**聚类分析**根据观测对象的属性对其进行分组,无须预先定义类别标签。它是无监督学习的一种形式,可用于客户细分或探索性分析。K均值聚类是一种广泛使用的方法;基于概率的替代方法包括通过期望最大化算法拟合的模型。所得群组取决于数据表示方式和建模假设,并非预先定义的类别。(docs.oracle.com)

**关联规则学习**识别经常共同出现的项目或事件。一个常见应用是购物篮分析,即发现同一笔交易中购买的商品组合。对于规则 A→BA \rightarrow B,支持度衡量同时包含这两个项集的交易所占的比例,置信度衡量在 AA 出现的条件下 BB 出现的条件概率,提升度则将该置信度与 BB 的总体出现频率进行比较。当规则后件本来就很常见时,仅凭高置信度可能得出误导性的结论。(docs.oracle.com)

**异常检测识别偏离模型所描述的正常状态的观测对象。这些对象可能值得调查,但异常评分本身并不能证明存在欺诈或错误。特征提取**从已有属性中构建新属性;主成分分析等方法可以提供降维后的数据表示,供后续建模使用。(docs.oracle.com)

知识发现的工作流程

一种广泛使用的流程框架是CRISP-DM,即跨行业数据挖掘标准流程。它划分了六个阶段:业务理解、数据理解、数据准备、建模、评估和部署。这些阶段是迭代进行的,而非严格依次推进:评估结果可能表明,需要修订问题定义、获取更多数据或更改模型。(ibm.com)

问题定义明确分析旨在实现什么目标,以及如何评判是否成功。数据理解考察现有记录及其适用性。数据准备将这些记录转换为建模输入。建模创建候选的数据表示或预测模型,而评估则考察其结果是否满足最初的目标。部署可以是生成报告,也可以是将模型评分整合到业务运行系统中;它并不一定意味着将决策自动化。(ibm.com)

预处理是分析方法的一部分,而不只是事务性步骤。特征选择、缺失数据插补和缩放等操作,都可能影响最终模型及其表现出来的性能。在预测性能评估中,需要从数据中学习的变换必须仅使用相应的训练数据进行拟合,再以一致的方式应用于留出的观测数据。(scikit-learn.org)

评估与解释的局限

模型对已观测记录的拟合程度,不足以证明其具有预测价值。当模型捕捉到的细节无法有效适用于未见过的样本时,就会出现过拟合。独立的测试集和交叉验证有助于评估泛化(机器学习)能力,但评估设计必须反映数据的结构。按时间排列的观测数据,以及来自同一实体的重复记录,可能需要采用不同于独立样本的数据划分策略。(scikit-learn.org)

当模型开发使用了预测时无法获得的信息,就会发生数据泄漏(机器学习)。泄漏可能源于与目标相关的变量,也可能源于在划分训练数据和评估数据之前就进行了预处理和特征选择。即使使用交叉验证,数据泄漏也可能导致评估分数过于乐观。(scikit-learn.org)

关联规则表达的是共同出现的关系,而非因果关系。因此,强烈的购买关联并不能证明购买某件商品会导致购买另一件商品。解释结果时,必须区分观测到的统计关系与因果解释。(docs.oracle.com)

隐私与数据治理

挖掘个人记录会引发有关信息披露,以及数据使用或共享条件的问题。去标识化可以降低隐私风险,但并非绝对的保障:研究已经表明,某些经过去标识化处理的数据集仍可能被重新识别。因此,治理既关注分析结果的实用性,也关注个人信息被暴露的可能性。美国国家标准与技术研究院(NIST)的指导文件将去标识化视为技术方法与组织管控措施的结合,并明确关注信息披露风险和数据生命周期。(csrc.nist.gov)