相关性是变量之间的一种统计关联:它们的取值呈现出共同变化的模式。在统计学中,这一术语通常特指线性关系的强度和方向,以皮尔逊相关系数衡量。其他相关性度量则描述排序或单调变化模式之间的关联。相关性刻画观测到的关系或概率关系;仅凭相关性本身,不能确立因果关系。(online.stat.psu.edu)
皮尔逊相关
对于两个随机变量 (X) 和 (Y),若其方差均有限且严格大于零,则总体皮尔逊相关系数为
[ \rho_{X,Y} =\frac{\operatorname{Cov}(X,Y)}{\sigma_X\sigma_Y} =\frac{\mathbb E[(X-\mu_X)(Y-\mu_Y)]}{\sigma_X\sigma_Y}. ]
其中,(\mu_X) 和 (\mu_Y) 是期望值,(\operatorname{Cov}(X,Y)) 是两者的协方差,(\sigma_X,\sigma_Y) 是各自的标准差。将协方差标准化,可以消除其对计量单位的依赖。如果任一变量的方差为零,皮尔逊相关系数就没有定义。(online.stat.psu.edu)
对于 (n) 对观测值,样本相关系数为
[ r= \frac{\sum_{i=1}^{n}(x_i-\bar x)(y_i-\bar y)} {\sqrt{\sum_{i=1}^{n}(x_i-\bar x)^2 \sum_{i=1}^{n}(y_i-\bar y)^2}}. ]
观测值必须成对:每个 (x_i) 与对应的 (y_i) 都来自同一个观测对象。样本相关系数既用于估计总体中的关系,也可作为观测数据集的描述性统计量。计算该系数不要求数据服从正态分布,但常规检验和区间估计需要额外的假设。(docs.scipy.org)
解释与数学性质
皮尔逊相关系数的取值范围为 (-1) 至 (+1)。正值表示一个变量取值较大时,另一个变量的取值往往也较大;负值则表示相反的变化方向。其绝对值衡量线性关联的强度。取值为 (+1) 和 (-1) 时,分别表示完全递增和完全递减的线性关系。取值为零表示不存在线性相关,而非不存在任何可能的关系。(online.stat.psu.edu)
相关性具有对称性:交换 (X) 和 (Y) 不会改变其值。给任一变量加上常数,或将其乘以正常数,也不会改变皮尔逊相关系数;仅将其中一个变量乘以负常数,则会使相关系数的符号反转。因此,通过正比例的线性换算改变计量单位,不会改变相关系数。与回归斜率不同,相关系数没有单位,也不区分解释变量和响应变量。(web.stanford.edu)
只要相关系数存在,统计独立性就意味着相关系数为零,但反过来通常不成立。举一个数学例子:设 (X) 在 ([-1,1]) 上服从均匀分布,且 (Y=X^2)。由对称性可知,协方差为零,尽管 (Y) 完全由 (X) 决定。不过,对于联合服从多元正态分布的变量,协方差为零确实意味着相互独立。(online.stat.psu.edu)
秩相关与偏相关
斯皮尔曼秩相关衡量单调关联,即当一个变量增大时,另一个变量是否总体上随之增大或减小,而不要求两者呈直线关系。其样本形式是对观测值的秩计算皮尔逊相关系数;对于取值相同的观测,通常赋予平均秩。因此,使用秩会将研究问题从数值大小之间的关联转变为相对位置之间的关联。(docs.scipy.org)
肯德尔秩相关通常记为 (\tau),通过比较一致对和不一致对来衡量关联。对于一对观测,若两个变量对它们给出的排序方向相同,则称为一致对;若排序方向相反,则称为不一致对。在没有并列秩的情况下,
[ \tau=\frac{C-D}{\binom n2}, ]
其中,(C) 和 (D) 分别为一致对与不一致对的数量。tau-b 等变体会对并列秩进行调整。斯皮尔曼系数和肯德尔系数描述了秩关联中相互关联的不同方面,但它们的数值不能互换。(docs.scipy.org)
偏相关衡量在控制指定的其他变量后,仍然存在的线性关联。在通常的样本形式中,分别将两个变量对控制变量进行线性回归,再计算两组残差之间的相关系数。统计调整本身并不能赋予结果因果解释。(online.stat.psu.edu)
统计推断
统计假设检验可以评估观测到的样本相关系数是否与总体相关系数为零相容。对于从二元正态总体中抽取的相互独立的观测对,在 (H_0:\rho=0) 下,
[ t=r\sqrt{\frac{n-2}{1-r^2}} ]
服从具有 (n-2) 个自由度的学生t分布。由此得到的P值描述结果在零假设模型下的极端程度,而非关联的大小或实际重要性。(online.stat.psu.edu)
置信区间表达总体相关系数的不确定性。一种常见的近似方法使用费舍尔变换:
[ z=\frac12\log\left(\frac{1+r}{1-r}\right). ]
在通常的正态总体假设下,其近似标准误为 (1/\sqrt{n-3})。在变换后的尺度上求出区间端点,再将其转换回相关系数尺度。因此,即使观测到的相关系数相同,在不同样本量下,其估计精度也可能有很大差异。(online.stat.psu.edu)
局限性及其与回归的关系
散点图可以揭示单个系数可能掩盖的特征,包括曲线形态、聚类和异常观测。皮尔逊相关系数对离群值敏感,离群值可能增强、减弱,甚至反转表面上的关联。即使存在很强的非线性关系,皮尔逊相关系数也可能很小。(online.stat.psu.edu)
混杂可以通过其他变量产生关联,而控制相关变量可能改变关联的大小或方向。因此,因果推断需要相关性以外的证据和假设,包括对其他可能解释和研究设计的考量。统计显著性并不能消除这些解释上的局限。(online.stat.psu.edu)
在采用普通最小二乘法拟合且包含截距的一元回归中,决定系数满足 (R^2=r^2)。它表示观测到的响应变量变异中,可由拟合直线解释的比例。平方运算消除了方向信息:强度相同的正相关和负相关会得到相同的 (R^2)。这一恒等式仅适用于上述特定的回归情形,并不适用于任意预测模型。(online.stat.psu.edu)