随机变量是为随机试验的每个可能结果赋予一个数值的函数。它将抛硬币所得的正反面序列等结果,与正面出现的次数等数量联系起来。在概率论中,实值随机变量的严格定义是概率空间上的可测函数。其定义规则是固定的;不确定的是哪个结果会发生,以及由此会观测到哪个数值。(ocw.mit.edu)
数学定义
概率空间记作 ((\Omega,\mathcal F,P))。其中,(\Omega) 是由所有可能结果组成的样本空间,(\mathcal F) 是由事件组成的σ-代数,(P) 则为这些事件赋予概率。实值随机变量是一个函数 [ X:\Omega\longrightarrow\mathbb R ] 并且对每个实数 (x),都有 [ {\omega\in\Omega:X(\omega)\leq x}\in\mathcal F. ] 这一可测性条件保证,关于 (X) 取值的陈述对应于概率有定义的事件。这一定义属于测度论的框架。(math.mit.edu)
观测到的数值 (X(\omega)) 称为随机变量的一个实现。通常用大写字母表示随机变量,用小写字母表示其可能取值。不同的结果可以产生相同的实现:例如,投掷两枚骰子,若 (X) 表示点数之和,则结果 ((1,6)) 和 ((3,4)) 都给出 (X=7)。常值函数也是随机变量,尽管其取值没有不确定性。(ocw.mit.edu)
分布与分类
(X) 的概率分布,也称分布律,描述了概率如何分配到它的取值上。对于一个博雷尔集 (B), [ P_X(B)=P{\omega:X(\omega)\in B}. ] 因此,随机变量是定义在试验结果上的函数,而其分布则是定义在取值上的概率测度。不同的随机变量可以具有相同的分布,却不必在每个结果上都取相同的值。(math.mit.edu)
累积分布函数(CDF)定义为 [ F_X(x)=P(X\leq x). ] 它完全确定随机变量的分布律。每个累积分布函数都是单调不减且右连续的,并且当 (x) 趋于负无穷和正无穷时,其极限分别为 (0) 和 (1)。区间概率可由下式求得: [ P(a<X\leq b)=F_X(b)-F_X(a). ] (math.mit.edu)
除去可能存在的零概率结果,离散型随机变量的取值属于一个有限集或可数无限集。它的概率质量函数为 (p_X(x)=P(X=x)),各取值的概率均非负,且总和为一。表示成功与否的指示变量服从伯努利分布;到达次数则可以用泊松分布建模。(ocw.mit.edu)
绝对连续型随机变量具有概率密度函数 (f_X),满足 [ P(a<X\leq b)=\int_a^b f_X(x),dx. ] 密度函数的积分为一,但它在某一点的函数值不是概率,可以大于一。任意单个取值的概率都为零。正态分布是一个重要例子。并非所有分布都是离散型或绝对连续型:混合型分布同时包含点质量和连续部分,而奇异连续分布的累积分布函数虽然连续,却不存在相对于通常长度测度的密度函数。(ocw.mit.edu)
期望与变异性
期望值通过以概率为权重的平均值来概括一个分布。对于离散型和绝对连续型随机变量,分别有 [ E[X]=\sum_x xp_X(x), \qquad E[X]=\int_{-\infty}^{\infty}xf_X(x),dx. ] 期望值有限要求 (E[|X|]<\infty);并非每个随机变量都满足这一条件。期望值不一定是随机变量可能取到的值。例如,公平的六面骰子的均值为 (3.5)。(ocw.mit.edu)
当二阶矩有限时,方差用于衡量离散程度: [ \operatorname{Var}(X) =E[(X-E[X])^2] =E[X^2]-(E[X])^2. ] 方差的平方根称为标准差。对于常数 (a,b), [ E[aX+b]=aE[X]+b,\qquad \operatorname{Var}(aX+b)=a^2\operatorname{Var}(X). ] 即使随机变量之间存在依赖关系,期望仍具有线性性质;方差的可加性则需要独立性等额外条件。(ocw.mit.edu)
变换与依赖关系
若 (g) 是可测函数,则 (Y=g(X)) 也是随机变量。要确定它的分布,需要找出哪些原始取值被映射到各个目标集合中。一般来说,(E[g(X)]) 并不等于 (g(E[X])):例如,对一个随机变量平方后求期望,涉及的是它的二阶矩,而不仅仅是均值。(ocw.mit.edu)
定义在同一概率空间上的多个随机变量具有联合概率分布。如果对所有博雷尔集 (A,B),都有 [ P(X\in A,Y\in B)=P(X\in A)P(Y\in B), ] 则 (X) 与 (Y) 相互独立。仅知道它们各自的分布,并不能确定它们是否独立。协方差衡量一种关联关系,但协方差为零通常并不意味着独立。关于一个变量的信息,也可以通过条件分布和条件期望来表示。(ocw.mit.edu)
序列与统计应用
随机过程是带有索引的一族随机变量,常用于表示随时间演变的量。对于独立同分布且绝对期望有限的随机变量,大数定律确立了它们的样本均值向共同均值的收敛性。当方差有限且为正时,经典的中心极限定理描述了标准化后的样本均值的分布向标准正态分布的收敛。这些结果涉及取平均的不同方面:均值的稳定,以及波动的分布。(ocw.mit.edu)
在统计学中,观测值被建模为随机变量的实现。统计量是观测值的函数,因此,在观测到数据之前,它本身也是随机的。统计量的抽样分布描述了在假想的重复抽样中,其取值如何变化,并为量化估计的不确定性提供依据。(ocw.mit.edu)