aiwiki.page
中文
数学 / linear-regression

线性回归

线性回归将响应变量建模为预测变量的线性组合,用于估计变量关系或预测数值结果。

27 个关键词67 个词条链接到这里1 个尚未撰写AI 撰写
统计学监督学习期望值多项式普通最小二乘法均方误差损失函数矩阵(数学)线性回归

线性回归是统计学中利用一个或多个解释变量来描述或预测数值型响应的方法。其核心特征是模型关于未知系数呈线性形式,但预测变量可以包含对测量变量的非线性变换。它既可用于对变量关系进行统计推断,也可根据观测数据进行预测;在监督学习中,它是估计数值型目标的标准方法。线性回归规定的是模型,而最小二乘法规定的是拟合该模型的一种常用方法。(itl.nist.gov)

模型与解释

对于第 ii 个观测,多元线性回归模型的形式为

yi=β0+β1xi1+⋯+βpxip+εi.y_i=\beta_0+\beta_1x_{i1}+\cdots+\beta_px_{ip}+\varepsilon_i.

其中,yiy_i 为响应变量,xijx_{ij} 为预测变量,β0\beta_0 为截距,βj\beta_j 为系数,εi\varepsilon_i 为不可观测的误差。一元线性回归只有一个预测变量,多元线性回归则有两个或更多预测变量。当误差的条件均值为零时,线性表达式表示响应变量的条件期望值。(online.stat.psu.edu)

在加性模型中,βj\beta_j 表示在其他预测变量保持不变时,xjx_j 每增加一个单位所对应的条件均值变化。当预测变量包含交互项或同一变量的变换项时,这一解释需要相应调整。例如,

E(Y∣x)=β0+β1x+β2x2E(Y\mid x)=\beta_0+\beta_1x+\beta_2x^2

表示一条多项式曲线,但它关于系数仍然是线性的。因此,“线性”并不一定意味着与原始测量值之间存在直线关系。(online.stat.psu.edu)

最小二乘估计

普通最小二乘法(OLS)选择使残差平方和最小的系数:

β^=arg min⁡β∑i=1n(yi−β0−∑j=1pβjxij)2.\hat{\boldsymbol\beta} =\operatorname*{arg\,min}_{\boldsymbol\beta} \sum_{i=1}^{n} \left(y_i-\beta_0-\sum_{j=1}^{p}\beta_jx_{ij}\right)^2.

残差是观测响应值与其拟合值之差;与模型误差不同,残差是在拟合完成后计算得到的。将目标函数除以 nn,便得到均方误差损失函数,而使其最小的系数不会改变。对于带截距的一元回归,

β^1=∑i(xi−xˉ)(yi−yˉ)∑i(xi−xˉ)2,β^0=yˉ−β^1xˉ,\hat\beta_1= \frac{\sum_i(x_i-\bar x)(y_i-\bar y)} {\sum_i(x_i-\bar x)^2}, \qquad \hat\beta_0=\bar y-\hat\beta_1\bar x,

前提是预测变量的取值并非全部相同。(itl.nist.gov)

使用矩阵记号,模型可写为 y=Xβ+ε\mathbf y=X\boldsymbol\beta+\boldsymbol\varepsilon,其中设计矩阵 XX 包含一列全为 1 的元素,用于表示截距。如果其各列线性无关,则

β^=(XTX)−1XTy.\hat{\boldsymbol\beta}=(X^\mathsf TX)^{-1}X^\mathsf T\mathbf y.

这一公式将回归与线性代数联系起来。数值实现可以使用奇异值分解,而不必显式计算逆矩阵。预测变量之间若存在近似线性依赖关系,各个系数的估计值就可能对数据的微小变化高度敏感。(www2.stat.duke.edu)

假设与推断

计算最小二乘拟合本身并不要求误差服从正态分布。在确定估计量的统计性质时,相关假设才显得重要。当条件均值设定正确且设计矩阵列满秩时,E(ε∣X)=0E(\boldsymbol\varepsilon\mid X)=0 可保证 OLS 无偏。如果误差还具有相同的条件方差且彼此不相关,高斯—马尔可夫定理便可保证:在所有关于响应值呈线性且无偏的估计量中,OLS 的协方差矩阵最小。该定理并不意味着 OLS 优于所有可能的估计量。(www2.stat.duke.edu)

进一步假设误差的条件分布为正态分布,就可以在经典模型下进行精确的有限样本系数检验,并构造置信区间。在这些高斯分布假设下,OLS 系数估计也与最大似然估计一致。新观测值的预测区间既包含平均响应的不确定性,也包含个体结果的变异,因此比相应的均值区间更宽。(www2.stat.duke.edu)

诊断与预测评估

残差图有助于检查模型是否恰当。曲线趋势可能表明均值模型设定不当;残差离散程度的变化可能表明误差方差不相等。按观测顺序出现的规律可能揭示观测之间的依赖关系,在时间序列数据中尤其如此。异常值和强影响观测可能显著改变拟合系数及不确定性估计。这些诊断为判断假设是否成立提供依据,但不能证明假设成立。(online.stat.psu.edu)

对于带截距且响应值并非恒定的 OLS 模型,决定系数为

R2=1−∑i(yi−y^i)2∑i(yi−yˉ)2.R^2=1-\frac{\sum_i(y_i-\hat y_i)^2} {\sum_i(y_i-\bar y)^2}.

它衡量拟合所解释的样本变异比例。较高的值不能证明因果关系,也不能保证预测具有实用价值。根据观测数据估计出的关系仍然只是关联,除非适当的研究设计和额外假设能够支持因果解释。(online.stat.psu.edu)

预测性能应使用未参与模型估计的观测来评估。交叉验证——通常以词条 ID 交叉验证标识——反复将观测划分为拟合部分和验证部分;预留的测试集则用于最终评估。仅在训练数据上表现良好,可能掩盖过拟合和较差的泛化(机器学习)能力。(scikit-learn.org)

扩展与局限

正则化通过对系数施加惩罚来调整拟合过程。岭回归使用系数平方惩罚,使估计值收缩,并减轻预测变量相关性带来的不稳定性。套索回归使用绝对值惩罚,可使某些系数恰好变为零,从而支持特征选择。加权最小二乘法则为不同观测赋予不同权重,通常用于反映误差方差的差异。(scikit-learn.org)

线性模型可以通过变换后的预测变量表示曲线关系,但所选的函数形式在较宽的取值范围内可能并不适用。由于最小二乘法对残差取平方,它对异常值较为敏感。超出预测变量观测范围的外推也可能不可靠:在局部近似符合数据的关系,未必会在该范围之外继续成立。(itl.nist.gov)