感知机是机器学习中的一种模型,通过对输入特征的加权和施加阈值来进行分类。这个术语也指用于从带标签的样本中学习这些权重的纠错算法。在标准形式下,感知机是一种二元线性分类器,也是人工神经网络的基本构建单元。当训练样本线性可分时,其学习规则能够收敛,但这一保证并不适用于任意数据集。(cs.cornell.edu)
历史发展
弗兰克·罗森布拉特于1957年提出感知机,将其作为处理感知与记忆的系统模型。他的研究把早期人工智能与能够通过学习改变自身响应的实验装置联系起来。Mark I感知机是为视觉模式识别而设计的硬件实现;其留存设备现由史密森学会旗下的美国国家历史博物馆收藏。(si.edu)
1969年,马文·明斯基与西摩·帕普特出版了《感知机:计算几何导论》。他们研究了特定感知机结构的表达能力及局限,包括由其特征表示方式带来的限制。这些结果针对的是特定的数学模型,并非证明所有神经网络都无法完成复杂的学习任务。(mitpress.mit.edu)
数学模型
对于输入向量 (x=(x_1,\ldots,x_d)),感知机计算
[ z=w^\top x+b=\sum_{j=1}^{d}w_jx_j+b, ]
其中,(w) 包含学习得到的权重,(b) 为偏置,也称截距。阈值型激活函数将这一得分转换为类别标签。当标签为 (-1) 和 (+1) 时,一种约定是
[ \hat y= \begin{cases} +1,&z>0,\ -1,&z\leq0. \end{cases} ]
得分恰好为零时如何处理,需要明确约定。通过追加一个恒等于一的特征,可以将偏置并入权重向量。(cs.cornell.edu)
在向量空间中,当 (w\neq0) 时,方程 (w^\top x+b=0) 定义了一个超平面:在二维空间中是直线,在三维空间中是平面,在更高维空间中则是相应的推广。两个预测类别分别位于两侧的半空间中。尽管阈值操作使输出不连续,分类边界对于所提供的特征而言仍是线性的。(cs.cornell.edu)
学习规则
感知机训练属于监督学习。给定由样本对 ((x_i,y_i)) 组成的训练数据,算法逐个处理样本。一种常见形式是在满足以下条件时进行更新:
[ y_i(w^\top x_i+b)\leq0. ]
随后执行
[ w\leftarrow w+\eta y_i x_i,\qquad b\leftarrow b+\eta y_i, ]
其中,(\eta>0) 为学习率。对于分类正确且带符号得分严格为正的样本,参数保持不变。在这一形式下,无论预测时如何约定零得分对应的类别,位于边界上的样本都会触发更新。(cs.cornell.edu)
这种更新会提高触发更新的样本的带符号得分,但也可能改变其他样本的预测结果。训练可以反复遍历一个固定数据集,也可以采用在线学习,在样本到达时逐个处理。当无法实现完全分离时,具体实现通常会设置迭代次数上限或其他停止条件。(scikit-learn.org)
这一规则也可以通过以下损失函数来解释:
[ \ell(w,b;x,y)=\max{0,-y(w^\top x+b)}. ]
当带符号得分为负时,该更新是针对这一损失的一步随机次梯度更新;得分为零时,选择适当的次梯度也会得到相同的更新。得分本身并不是经过校准的类别概率。(scikit-learn.org)
收敛性与局限
感知机收敛定理指出,对于有限且严格线性可分的数据集,标准学习规则只会执行有限次更新。在参数初始化为零、学习率为一的情况下,假设增广输入的范数至多为 (R),且存在一个单位长度的分离向量,使每个样本的带符号间隔都至少为 (\gamma>0)。那么,更新次数的上界为
[ M\leq(R/\gamma)^2. ]
因此,分离间隔越大,这一上界就越紧。该定理保证的是找到一个分离面,而不是找到具有最大间隔的分离面,也不保证模型在未见样本上的准确率。(cs.cornell.edu)
如果各类别无法在所提供的特征空间中分离,经典算法就不一定收敛。一个标准反例是异或(XOR):二元输入 ((0,0)) 和 ((1,1)) 属于一个类别,而 ((0,1)) 和 ((1,0)) 属于另一个类别。没有任何一条直线能够将这两类分开。增加非线性特征或引入适当的隐藏层,可以改变模型对这一分类关系的表示能力。(cs.cornell.edu)
扩展与相关模型
特征工程可以在分类前对输入进行变换。核方法则使感知机能够使用变换后特征空间中的内积,而无需显式构造该空间的坐标。此时,分类边界对于原始输入可能是非线性的,但对于变换后的表示仍是线性的。投票感知机的各种变体会组合训练过程中先后得到的分类器,而不是只保留最终的权重向量。与支持向量机不同,经典感知机并不显式优化最大间隔目标。(cseweb.ucsd.edu)
多层感知机是一种不同且表达能力更强的架构,由多个依次连接的层组成,各层包含带权重的单元和非线性激活。隐藏层使模型能够实现非线性映射。这类网络通常使用反向传播计算导数,并通过基于梯度的优化更新参数,而不是在整个网络中分别应用原始感知机规则。它们可以执行分类或回归任务,训练目标中也可以加入正则化,以惩罚过大的权重并限制过拟合。其非线性训练问题并不具备单层感知机收敛定理所提供的保证。(scikit-learn.org)