逻辑回归是统计学中根据解释变量对分类结果的概率进行建模的一种方法。其基本形式处理两种结果,通常编码为 0 和 1。它将几率的对数建模为预测变量的线性组合,再将这一组合转换为概率。在机器学习中,尽管名称中有“回归”一词,它实际上是一种用于分类的监督学习方法。(sklearn.org)
数学表述
设 为响应变量, 为预测变量。二元逻辑回归定义为
其中, 为截距,其余系数描述各预测变量的贡献。逻辑函数将任意有限实数得分映射为严格介于 0 和 1 之间的概率。等价地,
Logit 是几率的自然对数。因此,逻辑回归是一种响应变量服从伯努利分布、采用 logit 连接函数的广义线性模型;对于分组后的成功次数,则可以采用二项分布建模。与直接对二元响应变量应用普通线性回归不同,逻辑回归预测的概率不会超出允许的范围。(sklearn.org)
模型的线性性体现在系数上,而不是概率上。预测变量可以包含通过特征工程引入的变换项和交互项。对于满足 的分类阈值 ,当 时预测为类别 1,等价于将 与 进行比较。因此,分类边界在所表示的特征空间中是一个超平面,但经过变换的特征可以在原始变量空间中产生非线性边界。(sklearn.org)
估计与优化
系数通常通过最大似然估计来拟合。对于训练数据中条件独立的观测,似然函数为
最大化这一表达式,等价于最小化负对数似然:
这一损失函数是二元交叉熵,也称为对数损失。它对高置信度的错误预测施加尤其严厉的惩罚。(online.stat.psu.edu)
系数通常没有闭式解。数值求解方法包括牛顿法、拟牛顿算法和梯度下降。未加惩罚项的负对数似然关于系数是凸函数,因此拟合过程是一个凸优化问题。不过,凸性并不保证存在有限或唯一的最小值点:解的存在性和模型的可识别性还取决于数据和模型设定。(sklearn.org)
系数解释
在不包含涉及 的交互项的加性模型中,保持其他预测变量不变,将 增加一个单位,会使对数几率增加 。因此,几率会乘以 ,即相应的几率比。分类预测变量的系数应相对于其参照类别来解释。存在交互项时,相关的几率比可能取决于其他预测变量的取值。(stats.ox.ac.uk)
几率比并不是概率比。例如,将几率从 翻倍至 ,会使概率从 变为约 ,而不是 。更一般地,将几率乘以 ,会使初始概率 变为 ;因此,这对概率的影响取决于初始值。解释系数时,必须区分几率的变化与概率的变化。(online.stat.psu.edu)
正则化与估计难点
正则化在拟合目标中加入系数惩罚项。 惩罚使系数向零收缩,而 惩罚可以使部分系数恰好变为零。弹性网络正则化结合了这两种惩罚。这些惩罚项可以提高数值稳定性并抑制过拟合,尤其是在预测变量很多时。惩罚强度可以通过交叉验证选择。预测变量的尺度很重要,因为惩罚作用于系数的大小,而系数大小与变量所采用的计量单位有关。(scikit-learn.org)
一个特殊的难点是完全分离:预测变量的某个线性组合能够完美区分观测到的类别。此时,随着系数趋于无穷,未加惩罚项的似然可以趋近其上确界,从而不存在有限的最大似然估计。准完全分离也可能造成类似困难。预测变量之间的高度相关性同样会增加估计和解释的难度。适当的惩罚项可以使拟合更稳定,但也会改变估计目标。(stats.ox.ac.uk)
多分类扩展
多项逻辑回归用于处理类别数超过两个的无序结果。一种形式采用Softmax 函数:
每个类别都有一个线性得分,各类别概率之和为 1。为确保模型可识别,需要施加约束,例如选择一个参照类别。另一种方法是一对其余分类,它分别拟合多个二元模型,而不是采用单一的多项似然。对于有序类别,累积 logit 模型可以体现类别的顺序,通常采用比例几率假设。(sklearn.org)
预测与评估
概率估计与类别判定是两种不同的操作:阈值将估计概率转换为类别标签。评估时同样需要区分区分能力与校准程度:前者指得分区分类别的能力,后者指预测概率与观测频率的一致程度。对数损失和布里尔分数用于评估概率预测,而 ROC 曲线下面积等排序指标用于评估区分能力。当模型设定合适时,逻辑回归模型可以具有良好的校准表现,但仅仅使用逻辑连接函数并不能保证校准良好。可靠性图将预测结果分组,比较各组的平均预测概率与观测到的事件频率。(sklearn.org)