概率质量函数(PMF)是一种函数,为离散随机变量的每个可能取值指定该取值出现的概率。它完整地确定了一个离散概率分布,其概率集中在有限个或可数无穷多个取值上。常见记号包括 pX(x)、p(x) 和 f(x);同时讨论多个分布时,下标用于标明对应的随机变量。(online.stat.psu.edu)
定义与基本性质
对于离散随机变量 X,其概率质量函数定义为
pX(x)=P(X=x).
令 S={x:pX(x)>0} 表示概率为正的取值所组成的集合,在初等论述中通常称为该分布的支撑集。这是一个可数集,且概率质量函数满足
pX(x)≥0,x∈S∑pX(x)=1.
S 以外的取值,其概率均为零。这些条件也是充分条件:在有限集或可数集上,任何非负且总和为一的赋值都能确定一个离散分布。对于可能取值的任意子集 A,有
P(X∈A)=x∈A∩S∑pX(x).
因此,复合事件的概率可通过将其所包含各个取值的概率质量相加得到。(online.stat.psu.edu)
“离散”并不意味着取值必须是整数,也不意味着取值之间必须等距。关键要求是全部概率都集中在一个可数的取值集合上。概率质量函数可以用公式、表格,或由独立标记点或条形组成的图来表示。图中的高度表示各个取值的概率,而不是连续的密度。(online.stat.psu.edu)
示例与常见分布
对于一枚公平的六面骰子,令 X 为朝上一面的点数,则
pX(k)={1/6,0,k∈{1,2,3,4,5,6},其他情况.
因此,P(X>4)=pX(5)+pX(6)=1/3。这是一个各取值概率质量相等的有限分布示例,而许多离散分布会为不同取值指定不同的概率。(online.stat.psu.edu)
伯努利分布用于描述一次只有两种可能结果的试验。当成功概率为 q 时,它为取值 1 指定概率质量 q,为取值 0 指定概率质量 1−q。二项分布描述的是 n 次相互独立且成功概率相同的伯努利试验中的成功次数:
pX(k)=(kn)qk(1−q)n−k,k=0,…,n.
二项式系数计入了这 n 次试验中出现 k 次成功的不同排列方式。(online.stat.psu.edu)
泊松分布是具有无限支撑集的一个重要例子,其参数为 λ>0:
pX(k)=e−λk!λk,k=0,1,2,….
它为每个非负整数指定概率,常用于事件发生次数的模型。虽然其中包含无穷多项,但这些项的总和为一。(online.stat.psu.edu)
与累积分布函数和密度的关系
对于实值离散随机变量,累积分布函数(CDF)将所有不大于某个阈值的取值所对应的概率质量累加起来:
FX(t)=P(X≤t)=x∈Sx≤t∑pX(x).
在概率质量为正的取值 x 处,累积分布函数有一个大小为 pX(x) 的跳跃。等价地,
pX(x)=FX(x)−FX(x−),
其中,FX(x−) 是左侧极限。对于整数值随机变量,该式变为 pX(k)=FX(k)−FX(k−1)。与概率质量函数不同,累积分布函数对离散变量和连续变量都采用同一个概率表达式来定义。(online.stat.psu.edu)
概率质量函数必须与概率密度函数(PDF)区分开来。概率质量函数的值本身就是概率,因此不能超过一。对于由连续密度描述的分布,区间概率通过积分求得,而任一单个取值的概率都为零。密度值并不是单个取值的概率,可以超过一;等于一的是密度的总积分,而不是密度值的总和。(online.stat.psu.edu)
期望与变换
概率质量函数提供了计算期望值所需的权重:
E[X]=x∈S∑xpX(x),
若要求期望值有限,则该级数必须绝对收敛。更一般地,
E[g(X)]=x∈S∑g(x)pX(x).
当相关的矩有限时,方差为
Var(X)=x∈S∑(x−μ)2pX(x)=E[X2]−μ2,μ=E[X].
方差的平方根就是标准差。一个合法的概率质量函数不一定具有有限的均值或方差,尤其是在其支撑集为无限集时。(online.stat.psu.edu)
联合与条件概率质量函数
对于两个离散随机变量,联合概率分布由下式确定:
pX,Y(x,y)=P(X=x,Y=y).
对另一个变量的所有取值求和,就得到单个变量的概率质量函数,也称为边缘概率质量函数:
pX(x)=y∑pX,Y(x,y).
根据条件概率的定义,当 pY(y)>0 时,
pX∣Y(x∣y)=pY(y)pX,Y(x,y).
统计独立性成立,当且仅当联合概率质量函数对所有取值对都能分解为 pX,Y(x,y)=pX(x)pY(y)。(online.stat.psu.edu)
在统计推断中的作用
在统计学中,带参数的概率质量函数 p(x;θ) 描述概率如何随未知参数变化。对于具有同一概率质量函数的独立观测值 x1,…,xn,相应概率的乘积定义了似然函数:
L(θ)=i=1∏np(xi;θ).
最大似然估计选择使这一表达式达到最大值的参数值。两者的区别在于解释方式:概率质量函数将参数视为固定值,将结果视为变量;似然函数则将观测数据视为固定值,并比较不同的参数值。因此,似然函数通常不是参数上的概率分布。(online.stat.psu.edu)