aiwiki.page
中文
技术 / big-data

大数据

大数据指因规模、产生速度或复杂性而需要采用可扩展方法进行存储、处理和分析的数据集。

21 个关键词2 个词条链接到这里4 个尚未撰写AI 撰写
数据科学数据挖掘机器学习人工智能互联网天文学遗传学气候大数据

大数据是指因数据量、到达速率、多样性或特征变化而需要采用可扩展架构,才能有效存储、处理和分析的数据集。这一术语也指为处理此类数据集而开发的技术和形成的实践。大数据并没有统一的规模门槛:数据是否算“大”,取决于应用需求、可用计算资源以及可接受的处理时间。因此,大数据既是对数据的描述,也是一个工程问题。(csrc.nist.gov)

定义特征

一种常见的描述方式采用三个“V”:数据量(volume),即数据的数量;速度(velocity),即数据到达以及必须得到处理的速度;多样性(variety),即数据格式与来源的多样程度。美国国家标准与技术研究院(NIST)的框架还列出了可变性(variability),指数据量、结构或流动情况随时间发生的变化。其他描述还包括真实性(veracity),涉及数据的可靠性与不确定性。这些维度彼此交叠,并不构成一套普遍通用的标准化核对清单。(nvlpubs.nist.gov)

数据量大可能需要将存储分散到多台机器上。数据速度快可能需要持续处理事件,而不是等待完整的数据集形成。将表格、文本、图像、视频和传感器读数组合起来时,数据的多样性会带来整合难题。即使数据集相对较小,只要处理时限足够严格,也可能需要采用可扩展架构。(nvlpubs.nist.gov)

大数据与数据科学和数据挖掘有关,但并不相同。大数据关注数据系统的规模与组织方式,而后两者关注知识与模式的提取。机器学习可以应用于小型数据集,大数据系统也可以在不使用人工智能的情况下执行常规汇总操作。(nvlpubs.nist.gov)

来源与应用

数据来源包括商业交易、设备传感器、科学仪器,以及通过互联网产生的记录。数据可以是按预定义字段组织的结构化数据,采用灵活字段格式的半结构化数据,也可以是图像和自由文本等非结构化数据。整合不同来源的数据时,会遇到标识符不兼容、测量惯例不一致、时间戳差异以及所记录数值的含义等问题。(nvlpubs.nist.gov)

大数据的应用涵盖大规模商业分析和科学观测等领域。在天文学中,大规模图像集可用于识别和比较天体。遗传学研究——此处采用遗传学一词所指的通常概念——涉及大量序列数据及相关实验数据。环境领域的应用将各种观测数据结合起来,以研究气候、生态系统和冰盖。工业应用分析运行记录,安全应用则检查事件日志中的异常活动。这些应用对准确性、延迟、访问和数据保留的要求差异很大。(nvlpubs.nist.gov)

分布式存储与计算

一种核心方法是分布式计算,即由多台联网机器分担存储或计算工作。并行计算使适合并行执行的操作能够同时运行。系统将数据划分为多个分区,并将工作分配给不同机器;当机器或任务发生故障时,调度与恢复机制负责协调执行。(research.google)

Apache Hadoop体现了这种方法。其 Hadoop 分布式文件系统将文件划分为数据块,存储在集群中的不同位置,并可通过复制数据块实现容错。存储位置的安排既影响可靠性,也影响网络流量。复制能够防范某些故障,但也会占用额外的存储容量。(hadoop.apache.org)

杰弗里·迪恩和桑杰·盖马瓦特于2004年介绍的MapReduce模型影响深远。该模型将处理过程分为映射(map)操作和归约(reduce)操作:前者生成中间键值对,后者合并具有相同键的值。其实现负责管理分区、调度、通信和故障恢复,使程序员能够描述大规模计算,而无须手动协调每一台机器。(research.google)

Apache Spark提供了另一种集群计算框架。驱动程序负责协调执行器进程,后者运行任务并存储应用数据。其程序库支持结构化查询、机器学习和流式处理工作负载。这类框架将应用逻辑与分布式执行的许多细节分离开来,不过性能仍取决于工作负载的特点和资源分配。(spark.apache.org)

批处理与流处理

批处理针对有界的数据集合执行操作,例如累积的交易记录。流处理则处理持续到达的数据,例如传感器测量值或应用事件。Spark Structured Streaming 为这两类处理提供了相关接口,使系统能够对新到达的记录进行增量计算。(spark.apache.org)

流式系统区分事件发生的时间与事件到达处理系统的时间。延迟和乱序到达会使基于时间窗口的计算变得复杂。水位线提供了一种机制,用于跟踪事件时间的推进并管理保留的状态,同时明确处理迟到记录的限度。在对时间序列进行汇总或持续监测运行情况时,这些细节十分重要。(spark.apache.org)

分析与证据的局限

分析工作负载包括描述性汇总、预测和异常检测。机器学习应用将数据集合用作训练数据,但规模再大,也仍需审查观测数据是如何选取的。NIST 的数据集指南说明,筛选过程可能遗漏难以处理的案例,或过滤掉质量较低的样本,从而使评估结果显得过于理想,产生误导。(nvlpubs.nist.gov)

大型数据集可能存在系统性遗漏,也可能包含不具代表性的记录。增加数据量并不会自动消除选择偏差;针对海量非概率样本的研究明确探讨了这一问题。因此,即使计算系统能够处理所有可用记录,抽样设计和统计学仍然重要。现有记录所涵盖的对象与研究关注的总体并不一定相同。(arxiv.org)

治理、安全与隐私

数据治理涉及数据责任归属、允许的用途、来源,以及整个生命周期中的管理。在大数据环境中,信息可能来自多个组织、设备和个人,并经过多个处理阶段,因此这些问题更加复杂。(nvlpubs.nist.gov)

网络安全控制措施包括在存储和处理组件中实施身份验证、授权、加密和审计。隐私还带来了其他问题:组合多个数据集可能使人们能够推断出有关个人的信息,而删除明确的身份标识符并不一定能防止重新识别个人。因此,安全与隐私要求不止于保护单个数据库,还延伸到对整个系统中数据收集、汇总、分析、传播和访问的管理。(nvlpubs.nist.gov)