正态分布又称高斯分布,是一种连续的概率分布,其密度曲线呈对称的钟形。它通过两个参数描述随机变量:均值决定中心位置,方差决定离散程度。正态分布是统计学的基础,既用于建立观测数据的模型,也用于近似样本均值及其他统计量的分布。(itl.nist.gov)
定义与参数
若随机变量 的概率密度函数为
则称 服从均值为 、方差为 的正态分布,记作 。
参数 可以是任意实数,而 是标准差。有些资料使用 这一记法,因此必须核实第二个参数的含义。(itl.nist.gov)
其期望值为 ,方差为 。均值、中位数和众数相同。增大 会使曲线平移,但不改变其形状;增大 则会使曲线变宽、峰值降低。正态分布的偏度为零,峰度为三,因此超额峰度为零。(itl.nist.gov)
密度曲线下的总面积为一。随机变量落在某一区间内的概率,等于密度函数在该区间上的积分,而不是某个点处的密度值。因此,取某个确切值的概率为零,但落在任何长度大于零的区间内的概率都大于零。(itl.nist.gov)
标准化与概率
标准正态分布的均值为零,方差为一。若 ,则
观测值经标准化后得到的数值通常称为标准分数,它以标准差为单位表示该观测值与均值之间的距离。通过标准化,可以利用同一个参考分布计算任意正态分布的概率。(itl.nist.gov)
标准正态分布的累积分布函数为
因此,
被积函数没有初等函数形式的原函数,积分值可通过数值方法或概率表获得。由对称性可得 。(itl.nist.gov)
距均值不超过一个标准差的范围内包含约 68.27% 的概率,两个标准差以内约为 95.45%,三个标准差以内约为 99.73%。这些比例通常取近似值,称为 68–95–99.7 法则。它们描述的是理论分布,并不保证每个有限样本都具有这些比例。(itl.nist.gov)
求和与中心极限定理
独立正态随机变量的和仍服从正态分布。若 与 相互独立,则
更一般地,独立正态随机变量的线性组合,只要方差大于零,就服从正态分布;方差为零的线性组合则为常数。(new.statlect.com)
中心极限定理解释了为什么即使总体不服从正态分布,也会出现正态近似。对于独立同分布、均值 有限且方差 有限并大于零的随机变量,标准化后的样本均值依分布收敛于 :
因此,当样本量足够大时,样本均值的分布通常可以用 近似。该定理讨论的是均值,而不是将原始观测值转化为服从正态分布的数据。所需的样本量取决于原始分布;不存在一个通用的样本量阈值,能够保证近似效果令人满意。(mathworks.com)
估计与统计推断
对于来自正态总体的独立观测值 ,最大似然估计给出
这一方差估计以 为分母,存在向下偏差。将 换成 ,就得到通常使用的无偏样本方差。这一区别体现了似然最大化与无偏估计并不是同一回事。(mail.statlect.com)
正态分布是许多置信区间和统计假设检验方法的基础。当独立观测值服从正态分布时,无论样本量多大,样本均值都严格服从正态分布。如果总体方差未知,对均值的推断通常使用学生 t 分布,以考虑估计标准差所带来的不确定性。(itl.nist.gov)
在线性回归中,正态性假设通常针对给定预测变量条件下的误差分布,而不是要求每个预测变量或单独考察的响应变量都服从正态分布。拟合残差的正态概率图可用于图形诊断:图上的点近似呈直线排列,支持采用正态误差模型;若存在系统性偏离,则表明模型与数据不符。(itl.nist.gov)
多元扩展与历史发展
多元正态分布将这一模型推广到随机向量。均值向量确定中心位置,协方差矩阵确定各分量的方差及其相依关系。联合正态随机向量各分量的任意线性组合,要么服从正态分布,要么为常数。不过,各分量分别服从正态分布,并不意味着它们构成的向量一定服从联合正态分布。(itl.nist.gov)
从历史上看,亚伯拉罕·德莫弗于 1733 年推导出了二项分布的正态近似。皮埃尔-西蒙·拉普拉斯进一步发展了正态分布在概率论和误差理论中的作用。“高斯分布”这一名称源于卡尔·弗里德里希·高斯对观测误差所作的影响深远的研究,尤其是他在 1809 年关于天体运动的著作中的论述。(mathshistory.st-andrews.ac.uk)