数据科学是从数据中获取知识的跨学科研究与实践。它结合统计学、计算机科学、数学以及应用领域的知识,用于提出问题、获取和整理数据、构建模型、评估证据并传达结果。其范围不止于分析,还包括数据管理、可复现的工作流程和伦理考量。成果可以是解释、预测、可视化呈现或实际运行的系统;构建预测模型只是这一领域的一部分。(nationalacademies.org)
起源与学科边界
数据科学源自几种相互交叠的传统,而非某个单一的创立事件。统计数据分析、科学计算、数据库技术和机器学习都为其贡献了方法和实践方式。约翰·图基于1962年发表的论文《数据分析的未来》是一个重要先声,主张将数据分析视为一种更广泛的实证活动,而不只是数理统计的应用。此后,包括威廉·克利夫兰在内的统计学家提出,应扩大统计工作的范围,将计算、数据整理和沟通纳入其中。(ucla-biostat-257-2020spring.github.io)
这些学科的边界仍然具有弹性。统计学提供推断和处理不确定性的方法;计算提供存储和运算工具;机器学习侧重于学习模式和预测结果。数据挖掘与从数据集中发现有用结构的工作相互交叠,而数据工程则着重于基础设施和数据处理流水线。大数据带来了规模方面的挑战,但大型数据集既不是数据科学的必备条件,也不足以单凭自身就让某项活动成为数据科学。(ucla-biostat-257-2020spring.github.io)
问题、证据与目标
数据科学任务可以分为描述、预测和因果探究。描述用于刻画观测数据的特征,例如测量值的分布或群体之间的差异。预测利用已有信息估计未知结果。因果探究则询问干预会如何改变结果,使分析关注因果关系,而不只是关联。这些目标需要不同的证据和假设。(arxiv.org)
能够准确预测某个结果的模型,不一定能识别造成该结果的原因。某些变量之所以具有预测价值,可能是因为它们反映了共同原因、选择过程或该结果所产生的后果。因此,估计干预效果需要恰当的研究设计和明确的假设,而不只是较高的预测评分。这一区别会影响收集哪些数据以及如何解释结果。(arxiv.org)
领域知识有助于将一个非正式提出的问题转化为可测量的量。它能明确一次观测代表什么、所涉及的总体是什么,以及现有测量是否能够回答原本想问的问题。因此,数据科学往往需要分析人员与领域专家协作,而不是一项纯粹的计算工作。(nationalacademies.org)
数据生命周期
典型的工作流程始于问题界定和数据获取,随后是数据整理、探索、建模、评估和沟通。这些阶段会反复迭代:意外发现的模式可能暴露数据采集错误,而模型表现不佳则可能促使研究者调整测量方式,或缩小问题范围。因此,数据描述和整理维护是核心活动,而不是与分析脱节的前期杂务。(nationalacademies.org)
数据整理可能涉及统一格式、识别重复记录、核查单位和处理缺失值。缺失数据插补是在特定假设下为缺失值提供替代值。特征工程将记录的信息转化为适合分析的变量。这些转换可能影响结论;在预测工作流程中,还必须遵守拟合数据与评估数据相互分离的原则。(scikit-learn.org)
探索性数据分析利用汇总统计和图形检查来考察模式、异常观测值及可能存在的关系。数据可视化也用于向他人传达发现。探索可以产生假设并揭示问题,但探索过程中发现的模式并不会自动成为经过独立验证的证据。文档记录能够保留原始记录、数据转换和所报告结果之间的联系。(ucla-biostat-257-2020spring.github.io)
建模与评估
统计模型和计算模型对数据中的关系作出简化表示。监督学习使用目标值已知的样例,而无监督学习则在没有这类目标值的情况下考察数据结构。建模选择取决于所研究的问题、可用的观测数据、假设及预期用途;这一领域既涵盖解释性分析,也涵盖预测。(nationalacademies.org)
在预测任务中,训练数据用于拟合模型,另行保留的测试集则用于评估模型在未参与开发的观测数据上的表现。交叉验证反复将数据划分为拟合子集和验证子集。这些程序有助于评估泛化(机器学习)能力,并发现过拟合:即模型在熟悉的观测数据上看似表现良好,却无法将这种表现延续到新数据上。分组观测数据和时间序列需要采用能够考虑其依赖关系的评估方案。(scikit-learn.org)
当模型开发使用了预测时无法获得的信息,就会发生数据泄漏(机器学习)。例如,利用整个数据集估计预处理转换,可能使测试数据影响训练过程。保持评估数据独立,也意味着只能用相应的训练子集来拟合转换。(scikit-learn.org)
可复现性、治理与应用
可复现性通过保存数据、代码、计算设置和决策记录,使分析能够被检查和重复执行。沟通不仅是报告一个数值评分,还包括说明假设和局限。因此,人才培养框架将工作流程、团队协作和沟通,与数学和计算基础一同视为核心能力。(nationalacademies.org)
数据治理涉及访问权限、管理责任、文档记录、质量和负责任的再利用。隐私与伦理学关注的是如何收集和使用与人有关的数据。偏差可能源于统计程序、人为决策以及更广泛的制度过程,并不只是算法中的缺陷。这些考量贯穿整个生命周期,而不应只留到最终审查时处理。(nvlpubs.nist.gov)
数据科学的应用遍及科学研究、产业和公共机构。其共同特点是将数据、方法与结合具体情境的解释融为一体。同一种分析技术可以服务于不同目的,因此,必须根据具体问题和使用条件,评估数据集与工作流程是否适用。(ucla-biostat-257-2020spring.github.io)