缺失数据插补是用根据已观测信息或明确指定的模型得出的值替代缺失观测的过程。在统计学和机器学习中,插补使分析方法和算法能够处理不完整的数据集。数据缺失可能源于问题未获回答、测量失败,或信息从未被记录。插补值是估计值或合理的替代值,并非找回的真实观测值;如何解释这些值,取决于所用的方法和假设。(scikit-learn.org)
缺失机制
缺失情况与数据之间的关系,是选择和解释插补方法的关键。通常用以下三种机制描述这种关系:
- **完全随机缺失(MCAR):**缺失概率既不依赖已观测的数据值,也不依赖未观测的数据值。
- **随机缺失(MAR):**在给定已观测信息的条件下,缺失情况不再额外依赖缺失值。
- **非随机缺失(MNAR):**在给定已观测信息的条件下,缺失情况仍然依赖未观测值。
MAR 并不意味着缺失项是毫无规律地出现的。例如,按已观测信息划分的不同群体,其应答率可以不同,而不违反 MAR 假设。鲁宾在 1976 年提出的理论框架,确立了基于似然或贝叶斯方法的推断可以忽略缺失过程的条件,其中包括 MAR,以及模型参数之间适当的分离条件。(people.csail.mit.edu)
仅凭已观测数据,通常无法区分 MAR 与 MNAR。因此,采用假设 MAR 的插补方法,并不能证明这一假设成立。MNAR 分析需要额外的假设或信息;敏感性分析用于考察对未观测值作出不同假设时,结果会如何变化。(journals.sagepub.com)
单次插补方法
单次插补生成一个完整数据集。简单方法用常数、数值变量已观测值的均值或中位数,或分类变量中出现频率最高的类别来替代缺失项。这些方法计算成本低,但不对变量之间的关系建模。(scikit-learn.org)
多变量方法利用不同特征之间的信息。回归插补利用其他变量预测存在缺失的变量:线性回归可用于对数值型响应建模,逻辑回归则可用于对二元响应建模。迭代过程依次循环处理存在缺失的变量,利用其他变量的已观测值或当前插补值更新替代值。其预测模型也可以采用随机森林或其他合适的估计器。(search.r-project.org)
基于近邻的插补运用K近邻算法,根据可用特征识别相似记录。随后,用所选近邻中已观测值的平均值替代缺失的数值,也可以按距离加权求平均。相似性的定义,以及记录之间共同具有已观测值的特征是否充足,都会影响结果。(scikit-learn.org)
预测均值匹配将建模与供体选择结合起来。它先找出预测值与某个不完整样本的预测值接近的已观测样本,再从这一供体组中抽取一个已观测值。由于替代值来自已观测数据,这种方法可以保留变量经验分布中的某些特征,而简单的参数化预测未必能再现这些特征。(stefvanbuuren.name)
多重插补与不确定性
多重插补生成多个合理的完整数据集,而不是将某一个替代值视为确定值。每个数据集分别进行分析,再合并估计结果。规范的程序会体现缺失值和插补模型参数的不确定性;仅仅重复执行确定性的填补操作,并不能体现这种不确定性。(jstatsoft.org)
对于一个标量参数,设 为其在第 个完整数据集中的估计值, 为该估计值的抽样方差估计,共有 个数据集。鲁宾法则给出:
其中, 衡量插补内的不确定性, 衡量插补间的方差, 则是用于计算标准误及适当的置信区间的总方差。合并的是分析所得的估计结果,而不是将各个完整数据集平均成一个数据集。(stefvanbuuren.name)
链式方程与模型设定
链式方程多重插补(MICE),也称完全条件设定,为每个存在缺失的变量指定一个条件模型。它从初始替代值出发,以其他变量为预测变量,反复更新各变量的值。不同模型可适用于连续数据、二元数据、有序分类数据和无序分类数据。(jstatsoft.org)
迭代插补与多重插补并不相同:迭代描述的是替代值如何更新,而多重性指的是生成多个完整数据集。迭代算法也可以只返回一个完整数据集。(scikit-learn.org)
模型设定必须与预期的分析相适应。重要的交互作用、非线性关系和多层次结构,可能需要在模型中明确体现。派生变量需要采用一致的处理方式:对总量及其组成变量分别独立插补,可能破坏它们之间的算术关系。被动插补通过根据组成变量重新计算派生量,来维持这些关系。(jstatsoft.org)
预测工作流程与评估
在预测建模中,插补是一个需要从数据中学习的预处理步骤。其参数根据训练数据估计,随后在不重新拟合的情况下应用于验证集或测试集。进行交叉验证时,应在每个训练折内分别拟合。若在划分数据之前计算替代值,可能造成数据泄漏(机器学习),并使性能估计过于乐观。(scikit-learn.org)
缺失指示变量保留了哪些数据项原本缺失的信息。一些决策树学习方法能够直接处理缺失值,因此并非总是需要显式插补。重建质量与下游预测性能是两个不同的目标;更复杂的插补方法并不一定能改善预测。(scikit-learn.org)
评估时,可以在数值已知的数据中模拟缺失,并考察重建误差、估计量的偏差、不确定性估计和区间覆盖率。结果既取决于抽样过程,也取决于所模拟的缺失机制。因此,在某一种遮蔽方案下表现良好,并不能证明方法在所有现实缺失过程中都有效。(stefvanbuuren.name)