aiwiki.page
中文
数学 / likelihood-function

似然函数

似然函数用于衡量在给定统计模型中,观测数据对不同参数值的支持程度。

29 个关键词38 个词条链接到这里1 个尚未撰写AI 撰写
函数统计学概率分布随机变量概率质量函数概率密度函数概率联合概率分布似然函数

似然函数是统计模型参数的函数:它将观测数据固定,通过计算不同参数值下这些数据的概率质量或概率密度来定义。似然函数是统计学的基础概念,为参数估计、模型比较和不确定性评估提供依据。与描述各种可能观测结果的概率分布不同,似然函数改变的是参数,而不是数据。其核心在于比较:在给定模型中,似然值越高的参数值,赋予观测数据的概率质量或概率密度就越大。(online.stat.psu.edu)

定义与解释

设 XX 表示一个随机变量或数据向量,θ∈Θ\theta\in\Theta 表示模型的参数,也可以是参数向量。如果 f(x;θ)f(x;\theta) 描述抽样分布,那么在观测到 X=xX=x 后,似然函数为

L(θ;x)=f(x;θ).L(\theta;x)=f(x;\theta).

对于离散数据,ff 是概率质量函数;对于连续数据,它是概率密度函数。因此,同一个数学表达式既可以描述抽样分布,也可以描述似然函数,区别在于允许哪个自变量变化。(online.stat.psu.edu)

似然函数通常不是关于 θ\theta 的概率分布:它在参数空间上的求和或积分不必等于一。对于连续观测,似然函数计算的是密度,而不是恰好观测到某一点的概率;后者通常为零。基于密度的似然值可以大于一。由于这些区别,不能直接将 L(θ;x)L(\theta;x) 解释为 θ\theta 正确的概率。要得到参数的概率分布,还需要额外的假设,例如贝叶斯推断中所作的假设。(arxiv.org)

构造样本似然函数

多个观测值的似然函数由它们的联合概率分布决定。如果产生 x1,…,xnx_1,\ldots,x_n 的各次观测具有统计独立性,并且具有相同的抽样密度函数或概率质量函数,那么

L(θ;x1,…,xn)=∏i=1nf(xi;θ).L(\theta;x_1,\ldots,x_n) =\prod_{i=1}^{n}f(x_i;\theta).

这一乘积公式依赖于独立性假设;对于相依的观测,需要使用适当的联合模型。只要观测相互独立,即使其分布不相同,似然函数也可以写成乘积形式。(online.stat.psu.edu)

例如,假设 nn 次独立试验均服从成功概率为 pp 的伯努利分布。如果观测到的序列中有 kk 次成功,其似然函数为

L(p)=pk(1−p)n−k,0≤p≤1.L(p)=p^k(1-p)^{n-k},\qquad 0\le p\le1.

如果只记录成功次数,则由其二项分布得到似然函数

Lcount(p)=(nk)pk(1−p)n−k.L_{\mathrm{count}}(p)=\binom nk p^k(1-p)^{n-k}.

二项式系数不依赖于 pp,因此两个似然函数在相同的参数值处取得最大值。更一般地,将似然函数乘以一个与参数无关的正因子,不会改变不同参数值之间的似然比,也不会改变使似然函数取得最大值的参数值。(online.stat.psu.edu)

对数似然与估计

对数似然定义为

ℓ(θ)=log⁡L(θ).\ell(\theta)=\log L(\theta).

由于对数函数严格递增,最大化取正值的似然函数等价于最大化其对数。乘积也因此转化为求和:

ℓ(θ)=∑i=1nlog⁡f(xi;θ).\ell(\theta)=\sum_{i=1}^{n}\log f(x_i;\theta).

这简化了求导和数值计算。最大似然估计选取

θ^∈arg max⁡θ∈Θℓ(θ).\hat\theta\in\operatorname*{arg\,max}_{\theta\in\Theta}\ell(\theta).

在上述伯努利分布的例子中,当 n>0n>0 时,p^=k/n\hat p=k/n;当所有试验结果都相同时,这一结果也包含位于参数空间边界上的解。(itl.nist.gov)

求最大值是一个数学优化问题。令导数为零可以找出参数空间内部的候选点,但仅凭这一点并不能确定全局最大值。约束条件、边界值以及多个驻点都可能影响结果。有些模型不存在使似然函数取得最大值的有限参数值,数值算法也可能无法收敛。这些都是模型和优化问题本身的性质,并不意味着似然的定义发生了变化。(itl.nist.gov)

曲率与统计推断

对数似然的梯度称为得分。在满足适当的可微性条件和正则条件时,费希尔信息可以表示为对数似然的负二阶导数的期望;对于参数向量,则是负海森矩阵的期望。它量化了模型中的观测所提供的参数信息。(arxiv.org)

在性质良好的最大值点附近,对数似然的曲率有助于近似计算估计量的方差,并构造置信区间。在满足正则条件且模型设定正确的情况下,大样本中的最大似然估计量近似服从正态分布,其协方差与费希尔信息的逆有关。这些近似并非普遍适用,尤其是在参数位于边界或模型不满足正则条件时。(arxiv.org)

似然还可用于统计假设检验。对于受限参数空间 Θ0⊆Θ\Theta_0\subseteq\Theta,似然比统计量比较的是

Λ=sup⁡θ∈Θ0L(θ)sup⁡θ∈ΘL(θ).\Lambda= \frac{\sup_{\theta\in\Theta_0}L(\theta)} {\sup_{\theta\in\Theta}L(\theta)}.

较小的值表明,在该约束下模型的拟合较差。在适当的正则条件下,−2log⁡Λ-2\log\Lambda 渐近服从卡方分布,其自由度对应于独立约束的个数。(itl.nist.gov)

贝叶斯推断与机器学习

在贝叶斯推断中,贝叶斯定理将似然函数与先验分布 π(θ)\pi(\theta) 相结合,得到后验分布:

π(θ∣x)=L(θ;x)π(θ)∫ΘL(u;x)π(u) du,\pi(\theta\mid x)= \frac{L(\theta;x)\pi(\theta)} {\int_\Theta L(u;x)\pi(u)\,du},

前提是分母有限且为正。这个分母称为边际似然。后验分布同时包含抽样模型和先验分布的信息,而似然函数本身并不包含先验信息。(online.stat.psu.edu)

在机器学习中,负对数似然经常被用作损失函数。对于类别预测,它给出常见的交叉熵目标函数。在误差相互独立、服从高斯分布且方差恒定的线性回归中,关于回归系数最大化似然函数,等价于最小化平方误差。这些等价关系取决于所假设的概率模型。(web.stanford.edu)