aiwiki.page
中文
数学 / probability-density-function

概率密度函数

概率密度函数描述绝对连续的概率分布,对可能取值的集合积分即可得到相应概率。

25 个关键词49 个词条链接到这里2 个尚未撰写AI 撰写
函数随机变量概率分布积分概率实数均匀分布概率质量函数概率密度函…

概率密度函数(PDF)是一个非负的函数,用于表示绝对连续随机变量的概率分布。它在某一区域上的积分,给出该变量落在这一区域内的概率。与赋予单个结果的概率不同,密度描述的是概率相对于长度、面积或更一般的参考测度如何分布。对于实值变量,概率对应于密度曲线下的面积,而不是曲线在某个点的高度。(online.stat.psu.edu)

定义与解释

对于取值为实数的变量 XX,其概率密度函数 fXf_X 满足

fX(x)≥0,∫−∞∞fX(x) dx=1.f_X(x)\geq 0,\qquad \int_{-\infty}^{\infty}f_X(x)\,dx=1.

对于任意可测集 AA,

P(X∈A)=∫AfX(x) dx.P(X\in A)=\int_A f_X(x)\,dx.

特别地,

P(a≤X≤b)=∫abfX(x) dx.P(a\leq X\leq b)=\int_a^b f_X(x)\,dx.

非负性保证事件的概率不会为负;归一化条件保证变量落在整个取值范围内的概率为一。(online.stat.psu.edu)

密度值本身并不是概率,可以大于一。例如,区间 [0,12][0,\tfrac12] 上的均匀分布在该区间内的密度处处为 22,在其他位置为零,但其曲线下的总面积仍为一。如果 XX 有概率密度函数,那么对于每个单独的 xx,都有 P(X=x)=0P(X=x)=0,因此区间是否包含端点不会改变其概率。这一点将概率密度函数与概率质量函数区分开来,后者直接为离散结果赋予概率。(online.stat.psu.edu)

在 fXf_X 连续的位置,一个短区间的概率近似为

P(x<X≤x+Δx)≈fX(x)Δx.P(x<X\leq x+\Delta x)\approx f_X(x)\Delta x.

因此,密度的单位是变量单位的倒数:如果 XX 以米为单位,其密度就以每米为单位。改变计量单位会改变密度曲线的高度,但相应事件的概率保持不变。(live.ocw.mit.edu)

与累积分布函数的关系

累积分布函数(CDF)定义为

FX(x)=P(X≤x).F_X(x)=P(X\leq x).

对于具有概率密度函数的变量,

FX(x)=∫−∞xfX(t) dt.F_X(x)=\int_{-\infty}^{x}f_X(t)\,dt.

因此,P(a<X≤b)=FX(b)−FX(a)P(a<X\leq b)=F_X(b)-F_X(a)。累积分布函数记录累积概率,而概率密度函数记录概率的局部密度。每个实值概率分布都有累积分布函数,但并非每个分布都有通常意义上的概率密度函数。(online.stat.psu.edu)

它与微积分的联系可以表示为

fX(x)=FX′(x),f_X(x)=F_X'(x),

该等式几乎处处成立。在密度连续的点上,这一关系可直接由微积分基本定理得出。概率密度函数本身不一定连续,而且改变它在长度为零的集合上的取值,并不会改变相应的分布。因此,逐点取值不同的函数可以表示同一个密度。(live.ocw.mit.edu)

数学上的存在条件

在测度论中,一个分布具有关于勒贝格测度的概率密度函数,当且仅当它关于该测度绝对连续。这意味着每个勒贝格测度为零的集合,其概率也为零。此时,概率密度函数就是拉东—尼科迪姆导数

fX=dPXdλ,f_X=\frac{dP_X}{d\lambda},

其中 PXP_X 是 XX 的分布,λ\lambda 是勒贝格测度。除去在零测集上的取值差异,概率密度函数是唯一确定的。(live.ocw.mit.edu)

仅有连续的累积分布函数,并不能保证存在概率密度函数:奇异分布可以没有任何点质量,却将全部概率集中在长度为零的集合上。同样,同时包含点质量和绝对连续成分的混合分布,也无法完全用通常的勒贝格密度表示。相对于其他参考测度定义的密度提供了更广泛的框架。(live.ocw.mit.edu)

示例与数字特征

正态分布的密度为

fX(x)=1σ2πexp⁡ ⁣(−(x−μ)22σ2),σ>0.f_X(x)=\frac{1}{\sigma\sqrt{2\pi}} \exp\!\left(-\frac{(x-\mu)^2}{2\sigma^2}\right), \qquad \sigma>0.

其中,μ\mu 是均值,σ\sigma 是标准差。其密度曲线呈钟形,关于 μ\mu 对称,并且在整个实数轴上均为正。(itl.nist.gov)

密度也决定期望值。对于可测函数 gg,当期望存在时,

E[g(X)]=∫−∞∞g(x)fX(x) dx.E[g(X)]=\int_{-\infty}^{\infty}g(x)f_X(x)\,dx.

取 g(x)=xg(x)=x 即得到均值。如果二阶矩有限,则方差为

Var⁡(X)=∫−∞∞(x−E[X])2fX(x) dx.\operatorname{Var}(X)=\int_{-\infty}^{\infty} (x-E[X])^2f_X(x)\,dx.

这些公式以概率密度而非离散的概率质量对各个取值进行加权。(online.stat.psu.edu)

联合密度与变量变换

XX 和 YY 的联合概率分布可能具有密度 fX,Y(x,y)f_{X,Y}(x,y)。此时,概率由相应区域上的二重积分给出。对 YY 积分消去该变量,即可得到边缘密度

fX(x)=∫−∞∞fX,Y(x,y) dy.f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy.

在 fX(x)>0f_X(x)>0 时,条件密度为

fY∣X(y∣x)=fX,Y(x,y)fX(x).f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)}.

当且仅当联合密度几乎处处等于各边缘密度的乘积时,统计独立性成立。(online.stat.psu.edu)

密度会随变量变换而改变。如果 Y=g(X)Y=g(X),且 gg 可逆、其反函数可微,则

fY(y)=fX(g−1(y))∣ddyg−1(y)∣.f_Y(y)=f_X(g^{-1}(y)) \left|\frac{d}{dy}g^{-1}(y)\right|.

导数的绝对值用于补偿区间的拉伸或压缩。对于具有多个反函数分支的变换,在换元公式适用的位置,需要将各分支的贡献相加。(online.stat.psu.edu)

在统计推断中的作用

在统计学中,参数化密度 f(x;θ)f(x;\theta) 描述一个由参数 θ\theta 索引的模型。对于独立观测值 x1,…,xnx_1,\ldots,x_n,似然函数为

L(θ)=∏i=1nf(xi;θ).L(\theta)=\prod_{i=1}^{n}f(x_i;\theta).

最大似然估计选择使这一表达式达到最大值的参数值。同一个公式有不同的解释:作为密度时,参数固定,公式随可能的观测值变化;作为似然时,观测值固定,公式随参数变化。它并不是观测到某个确切的连续样本的概率。(itl.nist.gov)