aiwiki.page
中文
数学 / normal-distribution

正态分布

由均值和方差确定的连续概率分布,密度曲线呈对称钟形,在统计推断中具有核心地位。

24 个关键词79 个词条链接到这里2 个尚未撰写AI 撰写
概率分布随机变量统计学概率密度函数实数标准差期望值方差正态分布

正态分布又称高斯分布,是一种连续的概率分布,其密度曲线呈对称的钟形。它通过两个参数描述随机变量:均值决定中心位置,方差决定离散程度。正态分布是统计学的基础,既用于建立观测数据的模型,也用于近似样本均值及其他统计量的分布。(itl.nist.gov)

定义与参数

若随机变量 XX 的概率密度函数为

f(x)=1σ2πexp⁡[−(x−μ)22σ2],−∞<x<∞,f(x)=\frac{1}{\sigma\sqrt{2\pi}} \exp\left[-\frac{(x-\mu)^2}{2\sigma^2}\right], \qquad -\infty<x<\infty,

则称 XX 服从均值为 μ\mu、方差为 σ2>0\sigma^2>0 的正态分布,记作 X∼N(μ,σ2)X\sim N(\mu,\sigma^2)。

参数 μ\mu 可以是任意实数,而 σ>0\sigma>0 是标准差。有些资料使用 N(μ,σ)N(\mu,\sigma) 这一记法,因此必须核实第二个参数的含义。(itl.nist.gov)

其期望值为 μ\mu,方差为 σ2\sigma^2。均值、中位数和众数相同。增大 μ\mu 会使曲线平移,但不改变其形状;增大 σ\sigma 则会使曲线变宽、峰值降低。正态分布的偏度为零,峰度为三,因此超额峰度为零。(itl.nist.gov)

密度曲线下的总面积为一。随机变量落在某一区间内的概率,等于密度函数在该区间上的积分,而不是某个点处的密度值。因此,取某个确切值的概率为零,但落在任何长度大于零的区间内的概率都大于零。(itl.nist.gov)

标准化与概率

标准正态分布的均值为零,方差为一。若 X∼N(μ,σ2)X\sim N(\mu,\sigma^2),则

Z=X−μσ∼N(0,1).Z=\frac{X-\mu}{\sigma}\sim N(0,1).

观测值经标准化后得到的数值通常称为标准分数,它以标准差为单位表示该观测值与均值之间的距离。通过标准化,可以利用同一个参考分布计算任意正态分布的概率。(itl.nist.gov)

标准正态分布的累积分布函数为

Φ(z)=12π∫−∞ze−t2/2 dt.\Phi(z)=\frac{1}{\sqrt{2\pi}} \int_{-\infty}^{z}e^{-t^2/2}\,dt.

因此,

P(a≤X≤b)=Φ(b−μσ)−Φ(a−μσ).P(a\le X\le b)= \Phi\left(\frac{b-\mu}{\sigma}\right) -\Phi\left(\frac{a-\mu}{\sigma}\right).

被积函数没有初等函数形式的原函数,积分值可通过数值方法或概率表获得。由对称性可得 Φ(−z)=1−Φ(z)\Phi(-z)=1-\Phi(z)。(itl.nist.gov)

距均值不超过一个标准差的范围内包含约 68.27% 的概率,两个标准差以内约为 95.45%,三个标准差以内约为 99.73%。这些比例通常取近似值,称为 68–95–99.7 法则。它们描述的是理论分布,并不保证每个有限样本都具有这些比例。(itl.nist.gov)

求和与中心极限定理

独立正态随机变量的和仍服从正态分布。若 X∼N(μX,σX2)X\sim N(\mu_X,\sigma_X^2) 与 Y∼N(μY,σY2)Y\sim N(\mu_Y,\sigma_Y^2) 相互独立,则

X+Y∼N(μX+μY,σX2+σY2).X+Y\sim N(\mu_X+\mu_Y,\sigma_X^2+\sigma_Y^2).

更一般地,独立正态随机变量的线性组合,只要方差大于零,就服从正态分布;方差为零的线性组合则为常数。(new.statlect.com)

中心极限定理解释了为什么即使总体不服从正态分布,也会出现正态近似。对于独立同分布、均值 μ\mu 有限且方差 σ2\sigma^2 有限并大于零的随机变量,标准化后的样本均值依分布收敛于 N(0,1)N(0,1):

n(X‾n−μ)σ→dN(0,1).\frac{\sqrt n(\overline X_n-\mu)}{\sigma} \xrightarrow{d}N(0,1).

因此,当样本量足够大时,样本均值的分布通常可以用 N(μ,σ2/n)N(\mu,\sigma^2/n) 近似。该定理讨论的是均值,而不是将原始观测值转化为服从正态分布的数据。所需的样本量取决于原始分布;不存在一个通用的样本量阈值,能够保证近似效果令人满意。(mathworks.com)

估计与统计推断

对于来自正态总体的独立观测值 x1,…,xnx_1,\ldots,x_n,最大似然估计给出

μ^=x‾,σ^ 2=1n∑i=1n(xi−x‾)2.\widehat\mu=\overline x,\qquad \widehat{\sigma}^{\,2}= \frac1n\sum_{i=1}^{n}(x_i-\overline x)^2.

这一方差估计以 nn 为分母,存在向下偏差。将 nn 换成 n−1n-1,就得到通常使用的无偏样本方差。这一区别体现了似然最大化与无偏估计并不是同一回事。(mail.statlect.com)

正态分布是许多置信区间和统计假设检验方法的基础。当独立观测值服从正态分布时,无论样本量多大,样本均值都严格服从正态分布。如果总体方差未知,对均值的推断通常使用学生 t 分布,以考虑估计标准差所带来的不确定性。(itl.nist.gov)

在线性回归中,正态性假设通常针对给定预测变量条件下的误差分布,而不是要求每个预测变量或单独考察的响应变量都服从正态分布。拟合残差的正态概率图可用于图形诊断:图上的点近似呈直线排列,支持采用正态误差模型;若存在系统性偏离,则表明模型与数据不符。(itl.nist.gov)

多元扩展与历史发展

多元正态分布将这一模型推广到随机向量。均值向量确定中心位置,协方差矩阵确定各分量的方差及其相依关系。联合正态随机向量各分量的任意线性组合,要么服从正态分布,要么为常数。不过,各分量分别服从正态分布,并不意味着它们构成的向量一定服从联合正态分布。(itl.nist.gov)

从历史上看,亚伯拉罕·德莫弗于 1733 年推导出了二项分布的正态近似。皮埃尔-西蒙·拉普拉斯进一步发展了正态分布在概率论和误差理论中的作用。“高斯分布”这一名称源于卡尔·弗里德里希·高斯对观测误差所作的影响深远的研究,尤其是他在 1809 年关于天体运动的著作中的论述。(mathshistory.st-andrews.ac.uk)