均方误差(MSE)是统计学和机器学习中使用的一种误差度量。它衡量估计值或预测值与被估计或预测的值之间差异的平方的平均值。在统计估计中,这种平均是对重复抽样取期望;在预测评估中,通常是对各个观测值取算术平均。MSE 既可作为评估指标,也可作为拟合模型的损失函数。平方运算可防止正负误差相互抵消,并赋予较大误差远高于较小误差的权重。(stat.berkeley.edu)
定义与基本性质
对于 (n) 个观测值 (y_i) 及其对应的预测值 (\hat y_i),经验 MSE 为
[ \operatorname{MSE} =\frac{1}{n}\sum_{i=1}^{n}(y_i-\hat y_i)^2. ]
它非负,且当且仅当每个预测值都与对应的观测值一致时等于零。例如,误差为 (1,-2,3) 时,MSE 为 ((1+4+9)/3=14/3)。若各观测值的权重 (w_i) 非负且权重总和为正,则加权版本为
[ \operatorname{MSE}_w =\frac{\sum_i w_i(y_i-\hat y_i)^2}{\sum_i w_i}. ]
对于多个响应变量,可以分别报告各自的误差,也可以按照指定的输出权重进行汇总。(scikit-learn.org)
在估计理论中,固定参数 (\theta) 的估计量 (\hat\theta) 的 MSE 为
[ \operatorname{MSE}{\theta}(\hat\theta) =\mathbb E{\theta}[(\hat\theta-\theta)^2]. ]
这里的期望值针对的是估计量的抽样分布,而不是对某个已获得的数据集中的各个坐标或观测值取平均。这些定义体现了相同的平方误差原则,但所涉及的平均运算不同。(stat.berkeley.edu)
MSE 的单位是误差单位的平方:如果误差以米为单位,MSE 就以平方米为单位。将所有误差乘以 (c),MSE 就会乘以 (c^2)。其平方根,即均方根误差(RMSE),可恢复原来的单位。对于固定的评估数据集和汇总规则,MSE 与 RMSE 对模型的排序完全相同,因为平方根函数是单调递增的。(scikit-learn.org)
偏差、方差与预测风险
只要相关的二阶矩存在,估计量的 MSE 就可以分解为
[ \operatorname{MSE}{\theta}(\hat\theta) =\operatorname{Var}{\theta}(\hat\theta) +\bigl(\mathbb E_{\theta}[\hat\theta]-\theta\bigr)^2. ]
第一项是方差,描述抽样带来的变动;第二项是估计量的偏差的平方,描述估计量相对于参数的系统性偏离。因此,无偏估计量的 MSE 等于其方差。但无偏性本身并不能保证 MSE 最小:如果方差的减少超过偏差平方的增加,有偏估计量也可能表现得更好。(stat.berkeley.edu)
预测误差也有类似的分解。假设 (Y=f(X)+\varepsilon),且 (\mathbb E[\varepsilon\mid X]=0)。在固定输入 (x) 处,对训练样本以及一个独立的新响应取平均,可得
[ \mathbb E[(Y-\hat f(x))^2\mid X=x] =\operatorname{Bias}(\hat f(x))^2 +\operatorname{Var}(\hat f(x)) +\operatorname{Var}(\varepsilon\mid X=x). ]
最后一项是在给定信息集下无法消除的响应变异。这一区分是偏差-方差权衡的基础:降低训练误差不一定能降低期望预测误差。(nlp.stanford.edu)
平方损失下的最优预测
对于具有有限二阶矩的随机变量 (Y),使 (\mathbb E[(Y-a)^2]) 最小的常数 (a) 是 (\mathbb E[Y])。给定预测变量 (X) 时,对应的最优预测函数是条件期望
[ f^*(x)=\mathbb E[Y\mid X=x]. ]
这一结论可由以下恒等式得到:
[ \mathbb E[(Y-a)^2\mid X=x] =\operatorname{Var}(Y\mid X=x) +\bigl(\mathbb E[Y\mid X=x]-a\bigr)^2. ]
因此,平方损失以条件均值为预测目标,而不是中位数或最可能的响应值。相比之下,平均绝对误差以条件中位数为预测目标。因此,损失函数的选择决定了预测值代表响应分布的哪一方面。(scikit-learn.org)
模型拟合与优化
在监督学习中,最小化训练数据上的经验 MSE 是经验风险最小化的一个实例。对于线性回归,预测值是拟合系数的线性函数,最小化 MSE 得到的系数与普通最小二乘法相同。将误差平方和除以 (n),或在此基础上再除以二,都不会改变使其最小的参数值。(cs229.stanford.edu)
对于标量预测值,平方损失对预测值的导数为 (2(\hat y-y))。这一光滑表达式便于使用梯度下降和随机梯度下降。虽然平方损失是预测值的凸函数,但将它与非线性参数化模型复合后,得到的函数通常并不是关于模型参数的凸函数。(cs229.stanford.edu)
当误差相互独立、均值为零,并服从具有相同方差的正态分布时,最小化平方误差等价于对回归均值参数进行最大似然估计。计算 MSE 并不需要高斯分布假设;这一假设只是为它提供了上述特定的概率解释。(cs229.stanford.edu)
解释与局限
MSE 对异常大的误差很敏感。误差增大到两倍,其贡献就会增大到四倍,因此少数极端观测值可能主导结果。绝对误差损失随误差线性增长,而胡贝尔损失在误差接近零时呈二次增长,在误差足够大时呈线性增长。这些损失体现的是不同的惩罚方式,而不是同一准则的可互换版本。(scikit-learn.org)
训练 MSE 较低并不能证明模型具备良好的泛化(机器学习)能力。过拟合可能使训练误差很小,而在未见过的观测值上产生大得多的误差。使用预留的测试集或通过交叉验证进行评估,可以将拟合表现与预测评估区分开来;反复依据测试结果选择模型,则会破坏这种区分。(scikit-learn.org)
最后,使用回归术语时需要谨慎。在经典回归和方差分析中,“误差均方”(mean square error)通常指残差平方和除以残差自由度。对于含截距的一元线性回归,分母是 (n-2),而不是 (n)。这一量用于估计模型的误差方差,与上文定义的经验预测 MSE 不同。(online.stat.psu.edu)