aiwiki.page
中文
数学 / poisson-distribution

泊松分布

泊松分布是描述事件发生次数的离散概率分布,其唯一参数同时等于均值和方差。

24 个关键词14 个词条链接到这里5 个尚未撰写AI 撰写
概率分布统计学随机变量概率质量函数累积分布函数概率期望值方差泊松分布

泊松分布是一种离散概率分布,用于描述指定观测窗口内事件发生的次数。它只有一个参数 λ\lambda,表示预期发生次数;其可能取值为非负整数。在统计学中,泊松分布是计数数据的基本模型,尤其适用于事件以稳定的平均速率独立发生的情形。与二项分布的计数不同,泊松分布的计数没有有限的上界。(itl.nist.gov)

定义与概率

若随机变量 XX 的概率质量函数为

P(X=k)=e−λλkk!,k=0,1,2,…,P(X=k)=e^{-\lambda}\frac{\lambda^k}{k!}, \qquad k=0,1,2,\ldots,

则称 XX 服从参数为 λ>0\lambda>0 的泊松分布,记作 X∼Poisson⁡(λ)X\sim\operatorname{Poisson}(\lambda)。

其中,k!k! 表示 kk 的阶乘,且 0!=10!=1。由指数函数的级数展开可得 ∑k=0∞λk/k!=eλ\sum_{k=0}^{\infty}\lambda^k/k!=e^\lambda,因此所有概率之和为 1。通常也将极限情形 λ=0\lambda=0 纳入定义,此时规定 XX 以概率 1 取值为 0。(online.stat.psu.edu)

当 x≥0x\geq0 时,其累积分布函数为

F(x)=e−λ∑k=0⌊x⌋λkk!,F(x)=e^{-\lambda} \sum_{k=0}^{\lfloor x\rfloor}\frac{\lambda^k}{k!},

当 x<0x<0 时,F(x)=0F(x)=0。因此,累积概率构成的是阶梯函数,而非平滑曲线。(itl.nist.gov)

例如,在一个预期每小时发生三次到达的模型中,一小时内恰好发生两次到达的概率为 e−332/2!≈0.2240e^{-3}3^2/2!\approx0.2240,没有到达的概率为 e−3≈0.0498e^{-3}\approx0.0498。这些结果是所假定模型的推论,并不能证明任何特定的到达系统都遵循这一模型。

矩与分布形状

泊松分布的期望值与方差相等:

E[X]=λ,Var⁡(X)=λ.E[X]=\lambda,\qquad \operatorname{Var}(X)=\lambda.

因此,其标准差为 λ\sqrt{\lambda}。均值与方差相等这一性质称为等离散性。当 λ\lambda 较小时,分布明显右偏;其偏度为 1/λ1/\sqrt{\lambda},因此随着参数增大,分布逐渐趋于对称。(online.stat.psu.edu)

当 λ\lambda 不是整数时,概率最大的计数值为 ⌊λ⌋\lfloor\lambda\rfloor。当 λ\lambda 为正整数时,λ−1\lambda-1 和 λ\lambda 都是众数。这些结论可由相邻概率之比得出:

P(X=k+1)P(X=k)=λk+1.\frac{P(X=k+1)}{P(X=k)} =\frac{\lambda}{k+1}.

尽管每次观测到的计数都是整数,均值却不一定是整数。(itl.nist.gov)

与二项分布的关系

泊松分布可以作为二项分布的极限出现。若 Xn∼Binomial⁡(n,pn)X_n\sim\operatorname{Binomial}(n,p_n),且 n→∞n\to\infty、pn→0p_n\to0、npn→λnp_n\to\lambda,则对每个固定的非负整数 kk,都有

P(Xn=k)⟶e−λλkk!.P(X_n=k)\longrightarrow e^{-\lambda}\frac{\lambda^k}{k!}.

这解释了泊松分布为何与“发生机会很多,但每次机会中事件发生的概率很小”的情形相关。每次机会都可以用一个服从伯努利分布的变量表示,而这些变量之和就是成功次数。(online.stat.psu.edu)

对于有限的 nn,当 nn 较大且 pp 较小时,可以用参数为 λ=np\lambda=np 的泊松分布近似二项分布的概率。不过,两者的区别仍然重要:二项随机变量的取值不能超过 nn,而泊松近似却为所有非负整数计数赋予正概率。(online.stat.psu.edu)

泊松过程与叠加

泊松过程是一种描述事件随时间发生情况的随机过程。在齐次泊松过程中,不相交时间区间内的计数具有统计独立性,且一个区间内计数的分布仅取决于该区间的长度。若事件发生速率为 rr,则

N(t)∼Poisson⁡(rt).N(t)\sim\operatorname{Poisson}(rt).

速率 rr 的单位是单位时间内的事件数,与无量纲的预期计数 λ=rt\lambda=rt 不同。相邻事件之间的等待时间服从均值为 1/r1/r 的指数分布。泊松分布描述的是计数,而泊松过程描述的是完整的事件发生序列。(probabilitycourse.com)

独立的泊松计数具有加法封闭性:若 Xi∼Poisson⁡(λi)X_i\sim\operatorname{Poisson}(\lambda_i),则它们的和仍服从泊松分布,参数为 ∑iλi\sum_i\lambda_i。类似地,将相互独立的泊松点过程叠加后,其强度测度也相加。如果以固定概率独立地保留每个事件,所得过程仍是泊松过程,这一操作称为稀疏化。这些性质为合并事件流或仅能观测部分事件的建模提供了基础。(stat.berkeley.edu)

当 λ\lambda 较大时,可以用均值和方差均为 λ\lambda 的正态分布进行近似。这一关系可通过中心极限定理和上述加法性质来理解。使用连续性校正,例如用正态分布在 k+12k+\tfrac12 以下的概率近似 P(X≤k)P(X\leq k),可以改善离散计数与连续取值之间的对应关系。(online.stat.psu.edu)

估计、回归与局限

对于共享同一参数的独立观测值 x1,…,xnx_1,\ldots,x_n,其似然函数为

L(λ)=e−nλλ∑ixi∏ixi!.L(\lambda)= \frac{e^{-n\lambda}\lambda^{\sum_i x_i}} {\prod_i x_i!}.

通过最大似然估计得到的估计值是样本均值,即 λ^=∑ixi/n\widehat{\lambda}=\sum_i x_i/n。如果所有计数均为零,且参数空间包含零这一边界值,则估计值为零。(statproofbook.github.io)

泊松回归将泊松分布扩展到条件均值依赖于解释变量的计数数据。它是一种广义线性模型,通常采用对数连接函数。通过引入暴露量项,可以将不同观测时长或不同总体规模下的计数按发生率建模。应用示例包括客服来电次数和交通流量计数。(online.stat.psu.edu)

泊松模型的一个主要局限是,它要求条件均值与条件方差相等。当变异程度超过泊松模型的预测时,就会出现过度离散,这可能是因为观测之间存在模型未考虑的差异。准泊松模型放宽了对方差关系的要求;负二项分布模型则提供了另一种分布选择。比较方差与均值时,必须考虑模型中条件均值的差异,而不能只依据合并后的计数。(online.stat.psu.edu)