决定系数通常记作 ,读作“R 平方”,是统计学中衡量模型拟合程度的指标。对于采用普通最小二乘法拟合、且包含截距项的线性回归,它表示拟合模型所解释的响应观测值围绕其均值的变异所占的比例。更一般地说,它将模型的预测误差平方和与始终预测响应均值的基准模型的误差平方和进行比较。这一区别很重要:通常的样本内 介于 0 与 1 之间,而对任意预测或样本外预测计算的 则可能为负。(online.stat.psu.edu)
定义与计算
对于观测值 、相应的预测值 ,以及样本均值
定义总平方和
和残差平方和
通常采用的中心化定义为
前提是 。分母衡量的是对每个观测值都预测为 时的误差;分子衡量的是模型在同一组观测值上的误差。(online.stat.psu.edu)
由于这两个量具有相同的平方量纲,其比值是无量纲的。对于固定的评估数据集,最大化 等价于最小化均方误差,因为 是固定的。然而,若不同数据集的响应变异程度不同,即使均方误差相等, 也未必相等。这些性质都可以直接从定义推出。(scikit-learn.org)
解释与取值范围
当响应不是常数时,根据定义可得:
- **:**每个预测值都等于对应的观测值。
- **:**模型的总误差平方和与始终预测评估数据集均值时相同。
- **:**模型的误差平方和大于这一均值基准的误差平方和。
没有有限的下界:足够差的预测可以使 任意增大。因此,尽管其符号写作平方形式,这种广义的预测评分并不一定是某个实数的平方。(scikit-learn.org)
对于包含截距项的普通最小二乘拟合,始终预测均值的常数模型是可选模型之一。最小二乘法对训练观测值的拟合不可能比这一基准更差,因此 。例如,若 ,,则 :拟合模型解释了观测值围绕均值的变异的 75%。这并不意味着 75% 的单个预测是正确的。(online.stat.psu.edu)
最小二乘分解与几何解释
在包含截距项的普通最小二乘法中,总平方和可以分解为
因此,
这一恒等式给出了常见的“已解释变异除以总变异”的解释。但它并不是对任意预测都成立的普遍恒等式。(online.stat.psu.edu)
从几何角度看,最小二乘法是向模型各预测变量列向量的线性包所作的正交投影。残差向量与拟合值向量正交。包含截距项还会使残差之和为零,因此中心化后的响应向量可以分解为相互正交的拟合分量和残差分量。由此,平方和恒等式就是有限维内积空间中勾股定理的一个实例。这一几何解释可由最小二乘分解推出。(online.stat.psu.edu)
与相关关系的联系
对于只有一个预测变量且包含截距项的简单普通最小二乘回归,
其中, 是预测变量与响应变量之间衡量皮尔逊相关关系的相关系数。平方运算消除了正负号:强度相同的正线性关系与负线性关系具有相同的 。要确定关系的方向,需要查看回归斜率或相关系数。(online.stat.psu.edu)
对于包含截距项的多元普通最小二乘回归,只要响应拟合值不是常数, 也等于响应观测值与拟合值之间相关系数的平方。这种等价关系通常不适用于任意预测。一个预测序列可能与观测值完全相关,却因偏移量或尺度不正确而具有很大的误差平方和。(stats.oarc.ucla.edu)
调整后的 R 平方
在嵌套的普通最小二乘模型中增加预测变量,不会增大训练残差平方和。因此,即使新增预测变量几乎没有提供有意义的信息,训练 也不会下降。这使得未经调整的 本身不足以作为选择模型复杂度的依据。(online.stat.psu.edu)
调整后的 R 平方引入了自由度校正。对于具有 个观测值、一个截距项和 个预测变量的满秩模型,
其中假定 。与通常的训练 不同,增加预测变量时,调整后的 R 平方可能下降。它有助于比较模型,但严格来说并不是已解释变异的比例,也不能取代在未见数据上的评估。(online.stat.psu.edu)
预测评估
在机器学习中,可以在留出的测试集上或在交叉验证过程中计算 。这类评分评估的是预测的泛化(机器学习)能力,而不仅仅是对用于估计模型的观测值的拟合程度。仅有较高的训练评分,并不能证明样本外表现良好,还可能伴随过拟合。(scikit-learn.org)
必须明确说明所用的基准。在常规的测试集计算中, 是测试集响应值的均值。如果改为将模型与使用训练集响应均值作出的预测相比较,评分的分母就会不同,结果也可能不同。因此,除非明确指出所用的是哪个均值,否则“优于预测均值”这一说法并不完整。(scikit-learn.org)
其他约定与相关指标
**不含截距项的模型。**一些软件会报告非中心化的决定系数,
它的基准是零,而不是响应均值。因此,中心化与非中心化的数值不能直接互换。也可以使用中心化定义来评估不含截距项的模型,此时其训练评分可能为负。(statsmodels.org)
**解释方差评分。**一个相关指标采用如下公式:
其中, 表示方差。与通常的 不同,它不会对预测中的常数偏移作出惩罚。当残差均值为零时,这两个评分相同。(scikit-learn.org)
伪 R 平方。逻辑回归和其他广义线性模型经常使用伪 指标,包括 McFadden、Cox–Snell 和 Nagelkerke 指标。这些指标采用不同的构造方式,通常涉及似然函数,一般不能像普通最小二乘法的决定系数那样解释为已解释变异的比例。进行比较时,必须使用相同的定义、结果变量和数据集。(stats.oarc.ucla.edu)
局限性与未定义的情况
较高的 不能确立因果关系,不能证明所选的函数关系正确,也不能保证预测具有实用价值。较低的数值本身也不能排除有意义的关联。残差模式、不确定性以及应用所要求的预测精度,都包含单一拟合统计量无法表达的信息。不存在能够普遍适用、用于区分“好”模型与“坏”模型的阈值。(online.stat.psu.edu)
如果所有响应观测值都相同,则 ,因此通常的数学定义没有定义。软件可能会按约定用有限的评分代替;例如,根据 scikit-learn 文档中的默认行为,在这种情况下,完美预测返回 1,非完美预测返回 0。这些替代值是软件实现中的约定,而不是由定义公式推导出的结果。对于仅有一个观测值的情况,这一评分同样没有明确定义。(scikit-learn.org)
参考来源
- r2_score — scikit-learn 1.6.1 documentationscikit-learn.org
- 4. Metrics and scoring: quantifying the quality of predictions — scikit-learn documentationscikit-learn.org
- statsmodels.regression.linear_model — statsmodels documentationstatsmodels.org
- FAQ: What are pseudo R-squareds?stats.oarc.ucla.edu