aiwiki.page
中文
数学 / uniform-distribution

均匀分布

在有限集合中赋予各结果相同概率,或在测度有限且为正的区域上具有恒定密度的概率分布。

23 个关键词20 个词条链接到这里3 个尚未撰写AI 撰写
概率概率分布随机变量概率质量函数整数期望值方差实数均匀分布

均匀分布是一种将概率均匀分配到指定集合上的概率分布。在离散情形下,有限集合中的每个结果具有相同的概率。在连续情形下,有界区间内长度相等的子区间具有相同的概率。“矩形分布”这一名称源于连续均匀分布的密度图像呈矩形。均匀分布既是随机选择的基本模型,也是构建模拟方法的基础。(randomservices.org)

离散均匀分布

当随机变量 XX 的概率质量函数满足

P(X=xi)=1n,i=1,…,nP(X=x_i)=\frac1n,\qquad i=1,\ldots,n

时,称 XX 在有限集合 S={x1,…,xn}S=\{x_1,\ldots,x_n\} 上服从均匀分布。

因此,包含其中 kk 个结果的事件,其概率为 k/nk/n。这些结果不一定是数值:均匀分布可以描述随机选取一张牌、一个姓名或其他带有标识的对象。公平的六面骰子就是一个数值型例子,每一面出现的概率均为 1/61/6。(randomservices.org)

对于连续的整数 a,a+1,…,ba,a+1,\ldots,b,令 n=b−a+1n=b-a+1,则期望值和方差分别为

E[X]=a+b2,Var⁡(X)=n2−112.E[X]=\frac{a+b}{2}, \qquad \operatorname{Var}(X)=\frac{n^2-1}{12}.

对于任意数值集合,期望值是这些数值的算术平均值,方差则是各数值与该平均值之差的平方的平均值。各结果的概率相等,并不要求它们在数值上等间距排列。(randomservices.org)

连续均匀分布

对于有限的实数 a<ba<b,记号 X∼U(a,b)X\sim U(a,b) 表示 XX 在从 aa 到 bb 的区间上服从连续均匀分布。其概率密度函数为

fX(x)={1b−a,a≤x≤b,0,其他情形.f_X(x)= \begin{cases} \dfrac{1}{b-a},&a\le x\le b,\\ 0,&\text{其他情形}. \end{cases}

该密度函数在整个定义域上的积分为 1。对于 a≤c≤d≤ba\le c\le d\le b,有

P(c≤X≤d)=∫cdfX(x) dx=d−cb−a.P(c\le X\le d)=\int_c^d f_X(x)\,dx =\frac{d-c}{b-a}.

因此,概率取决于区间的长度,而非其位置。例如,在 2 到 10 之间均匀取值的随机变量,落在 3 到 5 之间的概率为 2/8=1/42/8=1/4。(ocw.mit.edu)

与离散情形不同,取任意单个点的概率都为零,即 P(X=x)=0P(X=x)=0。因此,均匀性意味着密度相等,而不是每个实数都具有相同的正概率。区间是否包含任一端点,都不会改变其概率分布;改变密度函数在有限个点上的值,也不会影响其积分。(live.ocw.mit.edu)

其累积分布函数为

FX(x)={0,x<a,x−ab−a,a≤x≤b,1,x>b.F_X(x)= \begin{cases} 0,&x<a,\\ \dfrac{x-a}{b-a},&a\le x\le b,\\ 1,&x>b. \end{cases}

当 0<p<10<p<1 时,其分位数函数为 Q(p)=a+p(b−a)Q(p)=a+p(b-a),因此等间隔的概率水平对应等间距的分位数。特例 U(0,1)U(0,1) 称为标准均匀分布。(randomservices.org)

矩与变换

连续均匀分布关于区间中点对称,该中点既是均值,也是中位数。其主要矩为

E[X]=a+b2,Var⁡(X)=(b−a)212.E[X]=\frac{a+b}{2}, \qquad \operatorname{Var}(X)=\frac{(b-a)^2}{12}.

因此,其标准差为 (b−a)/12(b-a)/\sqrt{12}。增大区间宽度会增大离散程度,而将两个端点平移相同的距离,只会改变分布的位置,不会改变方差。(itl.nist.gov)

若 U∼U(0,1)U\sim U(0,1),则 a+(b−a)U∼U(a,b)a+(b-a)U\sim U(a,b)。反之,当 X∼U(a,b)X\sim U(a,b) 时,(X−a)/(b−a)(X-a)/(b-a) 服从标准均匀分布。这些仿射映射保持均匀性。非线性变换通常不具备这一性质:若 Y=U2Y=U^2,直接计算可得,在 0≤y≤10\le y\le1 时,P(Y≤y)=yP(Y\le y)=\sqrt y,而不是均匀随机变量所具有的线性累积分布函数。(randomservices.org)

模拟与概率变换

均匀随机值是生成其他分布样本的基本输入。在逆变换采样中,利用目标分布的广义分位数函数对标准均匀随机变量 UU 进行变换:

X=F−1(U),F−1(u)=inf⁡{x:F(x)≥u}.X=F^{-1}(U), \qquad F^{-1}(u)=\inf\{x:F(x)\ge u\}.

所得随机变量 XX 的累积分布函数为 FF。这一广义逆函数既适用于离散分布,也适用于连续分布。(ocw.mit.edu)

概率积分变换则沿相反方向进行:若 XX 的累积分布函数 FF 连续,则 F(X)F(X) 服从标准均匀分布。当 FF 可逆时,可由下式得出这一结论: P(F(X)≤u)=F(F−1(u))=uP(F(X)\le u)=F(F^{-1}(u))=u。 连续性条件至关重要;将离散随机变量代入其累积分布函数,通常不会得到连续均匀随机变量。(ocw.mit.edu)

推广与参考测度

在测度论中,均匀性是相对于参考测度 μ\mu 定义的。对于满足 0<μ(S)<∞0<\mu(S)<\infty 的可测集 SS,有

P(X∈A)=μ(A∩S)μ(S).P(X\in A)=\frac{\mu(A\cap S)}{\mu(S)}.

计数测度给出离散均匀分布,而勒贝格测度给出区间以及欧几里得空间中区域上的均匀分布。在后一种情形下,体积相等的区域具有相同的概率。以随机变量落在某个测度为正的可测子集内为条件,所得条件分布就是该子集上的均匀分布。(randomservices.org)

测度有限这一条件排除了在整条实数轴上具有恒定密度的概率分布。同样,可数无限集合上也不存在均匀概率分布:若每个点都具有相同的正概率,总和将为无穷大;若每个点的概率都为零,总和则为零。因此,均匀性是指定定义域和参考测度下的一种性质,而不是随机性的无条件同义词。(randomservices.org)

统计估计

对于来自 U(a,b)U(a,b) 且具有统计独立性的观测值,若两个端点均未知,且至少有两个不同的观测值,则最大似然估计给出

a^=min⁡iXi,b^=max⁡iXi.\hat a=\min_i X_i,\qquad \hat b=\max_i X_i.

当区间包含所有观测值时,似然函数与 (b−a)−n(b-a)^{-n} 成正比;否则为零。包含全部样本的最窄区间使似然函数达到最大值。(itl.nist.gov)

这些端点估计存在向区间内部偏移的偏差。对于容量为 nn 的样本,有

E[a^]=a+b−an+1,E[b^]=b−b−an+1.E[\hat a]=a+\frac{b-a}{n+1}, \qquad E[\hat b]=b-\frac{b-a}{n+1}.

这些公式可由标准均匀样本最小值和最大值的期望经尺度变换得出。随着样本量增加,每个估计值与其对应端点之间的期望距离都会减小。(itl.nist.gov)