二项分布是一种离散概率分布,描述固定次数的独立试验中成功的次数;每次试验都有两种可能的结果,且成功的概率相同。它是统计学中用于二元观测和计数的基本模型。服从这一分布的随机变量通常记作 (X\sim\operatorname{Bin}(n,p)),其中 (n) 为试验次数,(p) 为成功概率。“成功”只是对所计数结果的称呼,并不一定表示结果是理想的。(csrc.nist.gov)
定义与假设
二项试验有四个基本条件:
- 试验次数 (n) 固定。
- 每次试验的结果分为成功或失败。
- 各次试验满足统计独立性。
- 各次试验的成功概率 (p) 相同。
这些条件针对的是概率模型,而不只是观测结果的表面形式。如果各次结果相互影响,或其概率发生变化,那么一串二元结果并不必然服从二项分布。(online.stat.psu.edu)
每次试验都可以用指示变量 (Y_i) 表示,成功时取 1,失败时取 0。每个 (Y_i) 都服从参数为 (p) 的伯努利分布,且
[ X=\sum_{i=1}^{n}Y_i. ]
因此,二项随机变量是相互独立、同分布的伯努利随机变量之和。其可能取值为整数 (0,1,\ldots,n)。当 (n=1) 时,二项分布就化为伯努利分布。(online.stat.psu.edu)
概率公式
当 (0<p<1) 时,概率质量函数为
[ P(X=k)=\binom{n}{k}p^k(1-p)^{n-k}, \qquad k=0,\ldots,n, ]
其中
[ \binom{n}{k}=\frac{n!}{k!(n-k)!}. ]
二项式系数表示从各次试验中选出 (k) 次成功试验的方式数。由独立性可知,每一种特定排列的概率都是 (p^k(1-p)^{n-k});将其乘以排列的数量,就得到上述公式。二项式定理表明,这些概率之和为 ((p+(1-p))^n=1)。(online.stat.psu.edu)
例如,假设将一枚均匀硬币独立抛掷十次,并把出现正面称为成功,则
[ P(X=3)=\binom{10}{3}(0.5)^{10} =\frac{120}{1024}\approx0.1172. ]
这是恰好出现三次正面的概率,与正面出现的顺序无关。该计算直接将数值代入概率公式即可。(itl.nist.gov)
累积分布函数在整数 (k) 处的值为
[ P(X\le k)=\sum_{j=0}^{k}\binom{n}{j}p^j(1-p)^{n-j}. ]
因此,“至少 (k) 次”的概率是 (1-P(X\le k-1)),而不是 (1-P(X\le k))。当 (p=0) 时,全部概率集中在 0 处;当 (p=1) 时,全部概率集中在 (n) 处,这可以直接由试验的定义得出。(itl.nist.gov)
均值、变异与分布形状
[ E[X]=np,\qquad \operatorname{Var}(X)=np(1-p),\qquad \sigma_X=\sqrt{np(1-p)}. ]
这些表达式可以由伯努利分布的相应矩,以及独立随机变量的方差可加性推导出来。期望值是重复试验中的平均值,不一定是某次试验实际能够产生的整数计数。(online.stat.psu.edu)
当 (n) 为正且 (0<p<1) 时,分布在 (p=0.5) 时对称,在 (p<0.5) 时右偏,在 (p>0.5) 时左偏。其偏度为
[ \frac{1-2p}{\sqrt{np(1-p)}}. ]
概率最大的计数为 (\lfloor(n+1)p\rfloor);但当 ((n+1)p) 为整数时,该整数及其前一个整数都是众数。(itl.nist.gov)
比例与统计推断
当 (n>0) 时,样本比例为 (\hat p=X/n)。其均值为 (p),标准误为
[ \sqrt{\frac{p(1-p)}{n}}. ]
这将二项计数与比例的抽样变异联系起来:增加独立试验的次数会减小这种变异。(online.stat.psu.edu)
在已知 (n) 并观测到 (x) 次成功的情况下,似然函数与 (p^x(1-p)^{n-x}) 成正比。最大似然估计给出 (\hat p=x/n)。置信区间用于表达这一点估计之外的不确定性;精确二项置信区间可通过求解涉及二项分布尾部概率的方程获得。在样本量较小或失败次数极少时,基于正态分布的简单对称区间可能不够准确。(itl.nist.gov)
在贝叶斯推断中,贝塔分布可作为 (p) 的共轭先验。如果先验分布为 (\operatorname{Beta}(\alpha,\beta)),那么在 (n) 次试验中观测到 (x) 次成功后,得到的后验分布为
[ p\mid x\sim\operatorname{Beta}(\alpha+x,\beta+n-x). ]
这一结果可通过将贝塔分布的密度乘以二项似然推导出来。(bookdown.org)
近似与模型适用边界
中心极限定理表明,当 (0<p<1) 固定时,随着 (n) 增大,标准化后的二项计数趋于标准正态分布。正态近似采用均值 (np) 和方差 (np(1-p))。连续性校正将整数边界调整半个单位;例如,对于相应的正态随机变量 (Z),用 (P(Z\le k+0.5)) 近似 (P(X\le k))。(online.stat.psu.edu)
当成功事件较为罕见时,参数为 (\lambda=np) 的泊松分布是另一种近似。从严格的极限意义上说,当 (n) 增大、(p) 趋于零,且 (np) 趋于一个有限的正常数时,二项分布的概率趋于泊松分布的概率。(online.stat.psu.edu)
从有限总体中进行不放回抽样,通常会产生超几何分布,因为相继抽取的结果并不独立。不过,当样本相对于总体很小时,二项近似仍可能有较好的效果。因此,仅凭二元分类并不能确定二项模型适用;抽样机制和试验假设仍然至关重要。(online.stat.psu.edu)